147. 和蚂蚁灵波沈宇军聊:机器人原生基础模型、大脑和本体的关系、预训练与数据scale up、老师汤晓鸥

2026-07-22 · Show: 张小珺Jùn|商业访谈录 · 6775s · Source

蚂蚁灵波沈宇军:机器人原生基础模型、大脑与本体、预训练和数据 Scale Up

概览

本期围绕“机器人大脑”展开:为什么进入 2026 年,中国也出现了一批从大脑而非本体出发的具身智能公司,以及蚂蚁灵波为什么选择做机器人原生基础模型,而不是先做通用机器人硬件。

沈宇军的核心判断是,具身智能最终会有自己的模型体系。语言模型可以作为理解指令的入口,但真正把物理世界里的事情“干明白”,需要从传感器、空间、视频时序、动作和数据采集方式出发,重新设计面向机器人的预训练路径。

讨论的主线从沈宇军个人经历讲起,延伸到蚂蚁灵波的技术路线、第一代和第二代模型的变化、真机数据与仿真数据的取舍、机器人 GPT-1 时刻为何还没到,以及未来行业会在大脑、本体、传感器和数据之间交替推进。

分段落总结

[00:05] 开场:从机器人大脑出发的新现象

[事实] 主持人指出,进入 2026 年,中国科技行业出现了一批从“机器人大脑”出发的公司,现阶段重心不在本体上。

[事实] 本期嘉宾是蚂蚁集团孵化的蚂蚁灵波首席科学家沈宇军,主题包括机器人底座模型预训练、瓶颈、数据 scale up,以及机器人的 GPT-1 moment。

[02:02] 沈宇军的 AI 路径:从商汤到生成模型

[事实] 沈宇军本科在清华期间进入刚成立不久的商汤实习,后来到港中文汤晓鸥老师团队读书。

[事实] 他早期对检测、分割、分类打榜兴趣有限,转而被 GAN 和图像生成、图像编辑吸引,从 2017 年开始做生成模型。

[04:00] GAN 的 scale up 局限

[事实] 沈宇军团队直到 2026 年初仍做过 GAN scale up 的最后尝试,认为 GAN 在某些方面仍有价值。

[事实] 他认为 GAN 的主要问题是计算量利用效率较低,尤其面对复杂图像和视频生成时,不如 diffusion 等路线适合继续扩展。

[推测] 他对 GAN 的判断不是完全否定,而是把对抗训练中积累的经验视为未来可能迁移到其他场景的技术资产。

[06:40] 从字节应用到视觉方向的迷茫

[事实] 沈宇军博士毕业后先加入字节跳动,做与抖音内容和特效相关的 AI 应用,例如变老、变年轻、性别转换和人脸过渡。

[事实] 他后来认为计算机视觉过去较大规模的产业价值主要来自人脸识别和自动驾驶,其他视觉应用的用武之地并不充分。

[09:20] 转向具身智能与蚂蚁灵波成立

[事实] 沈宇军在 2024 年开始考虑转向机器人,因为物理世界中的机器人高度依赖视觉。

[事实] 蚂蚁集团希望把数字世界的生活服务延伸到物理世界,2024 年底成立蚂蚁灵波,沈宇军也从蚂蚁技术研究院调入。

[12:00] 从研究机构到创业公司

[事实] 沈宇军认为,如果具身智能仍按研究机构方式推进,容易与真实行业需求脱节。

[事实] 蚂蚁灵波以公司形式运作,希望把技术探索和产业落地结合起来,一边探索智能上限,一边用真实场景反向驱动模型迭代。

[16:00] 为什么先做大脑,不做本体

[事实] 蚂蚁灵波创立之初就明确希望做机器人大脑,希望未来不同品牌和不同形态的机器人都能运行灵波模型。

[事实] 沈宇军认为未来家庭机器人未必是统一品牌或统一形态,因此灵波把“跨本体”的通用大脑作为核心目标。

[推测] 这一路线把本体不确定性留给生态和行业演化,同时把公司能力集中在模型、数据和智能层。

[18:30] 2025 到 2026 的两次关键路线选择

[事实] 2025 年,团队判断机器人不能只做静态多模态理解,而要从视频中学习动态时序,因此较早投入视觉动作模型或世界动作模型方向。

[事实] 2026 年,团队认为数字世界模型的动机与物理世界需求不完全匹配,于是决定针对物理世界需求重做视觉相关模型。

[22:00] 传感器与物理世界原生

[事实] 沈宇军强调,机器人真实运行时会遇到传感器噪声,学术数据集的干净分布与真实物理世界天然不同。

[事实] 蚂蚁灵波的两大技术主张是从真实传感器出发做空间智能,以及从视频中学习时序和动作。

[24:50] 炒菜 Demo 与大脑路线的强化

[事实] 2025 年外滩大会的炒菜 Demo 暴露了长程任务中的软硬件问题,也让团队更坚定要把“大脑”做扎实。

[事实] 沈宇军认为,如果没有可复用的大脑,每换一个场景都要重新做大量复制,成本会很高。

[28:00] 第一代大脑:四个模型的定位

[事实] 第一代模型围绕从传感器和视频中学习展开,包括深度、视频动作模型、世界模型和 VLA 等方向。

[事实] 第一代大脑支持九种构型,主要解决较简单的抓取任务和桌面操作任务。

[30:30] 第二代大脑:从实验室走向真实场景

[事实] 第二代模型的重要变化来自落地需求:真实场景中机器人不只在固定桌面高度操作,还需要抬头、弯腰、移动底盘、使用腕部相机等。

[事实] 第二代模型从九种构型扩展到二十多种构型,自由度从双臂和夹爪扩展到头、腰、底盘和灵巧手等。

[32:40] 预训练规模与数据升级

[事实] 第二代模型基于约 3B 规模模型训练,数据量从第一代约 2 万小时扩展到约 6 万小时。

[事实] 团队重新清洗了第一代数据,按更严格的数据管线筛选后再扩充,因此有效数据规模相比上一版约有数倍提升。

[34:00] 真机数据、eGo 数据与仿真取舍

[事实] 蚂蚁灵波的数据来源以真机数据为主,也包括 eGo 这类头戴相机采集的人类视角数据。

[事实] 沈宇军认为仿真数据适合评测和部分场景,但通用任务、柔性物体和复杂操作的分布覆盖仍有限,因此训练上更偏向真机数据。

[推测] 他的判断核心不是否认仿真,而是认为当前通用具身模型更需要真实、多构型、多任务的数据分布。

[36:20] 数据采集的 know-how

[事实] 沈宇军认为数据采集最难的是下发什么任务,以及如何让任务覆盖头、腰、手、底盘等不同自由度。

[事实] 跨本体数据清洗很难,因为不同本体的相机位置、关节自由度和配置不同,很难用一条统一管线处理所有数据。

[40:30] Viren 与 Depth:看得更清楚

[事实] 第二代模型中,团队不再基于 DINO V2 做 Depth,而是从几何角度重新做视觉预训练,以更好理解空间和距离。

[事实] 沈宇军用水流和玻璃门后的猫举例说明:语义理解知道“那里有猫”,但物理世界的空间感知还要知道前面有玻璃门、是否能接触到目标。

[46:00] VLA 升级:产业数据驱动落地

[事实] 第二天发布的 VLA 升级主要来自落地场景反馈,包括提高数据质量、增加构型、支持更复杂任务。

[事实] 沈宇军认为 VLA 对灵波的重要价值,是从产业视角弄清楚落地真正需要什么数据。

[48:00] Video、World 与 VA:重做物理世界架构

[事实] 团队认为数字世界视频生成模型重画质、可等待、可双向建模,而机器人执行需要实时、单向、动作相关的建模。

[事实] 第二代工作中,Video 证明了 MOE 视频模型训练能力,World 证明了单向 attention 预训练能力,最终这些技术汇入 VA2.0。

[52:00] MOE 与单向建模的工程难点

[事实] 沈宇军说,MOE 不是简单减少激活参数,关键是让不同专家被均衡激活;团队为此失败过几十次、花了约两个月。

[事实] 团队也放弃了把双向模型强行改成单向的路线,因为这会破坏预训练中学到的知识,转而从一开始设计单向模型。

[60:00] 大脑还是小脑:意图实现与意图来源

[事实] 沈宇军认为灵波当前解决的是“给出指令后把事情做出来”,不是机器人主动产生意图或复杂规划。

[事实] 他举例说,机器人能执行“帮我拿伞”,但尚未解决“看到下雨主动拿伞”这种更高阶交互智能。

[64:00] 第二代能力:随机性与位置泛化

[事实] 第二代模型在处理随机性上明显提升,例如与人打撞球时,只依赖机器人自身相机感知来球并实时反应。

[事实] 在整理桌面任务中,人可以随机撒物品、拿出物品或一起收拾,机器人仍能继续完成任务。

[推测] 这些例子说明模型不只是记住固定轨迹,而是在位置泛化和突发情况处理上有进展。

[66:00] 任务泛化仍受数据限制

[事实] 沈宇军承认,第二代模型在全新任务上的泛化还没有做好,原因是机器人见过的任务和数据仍不够多。

[事实] 后训练数据成本相比第一代下降:第一代通常每个任务约 100 条数据,第二代约 20 条数据即可做部分任务适配。

[67:30] 机器人 GPT-1 moment 还没到

[事实] 沈宇军认为具身智能还没有到 GPT-1 时刻,因为还没有看到一种足够好的数据 scale up 方式。

[事实] 他认为,当具身数据本身能够规模化,甚至与互联网数据达到相近量级时,才更接近他心中的机器人 GPT-1 moment。

[70:00] 原生具身模型是一场大赌注

[事实] 团队在 1.0 发布后判断,沿着数字世界模型魔改下去走不长远,因此必须具备更底层模型训练能力。

[事实] 沈宇军认为这是一次赌注,因为当时不确定能否收敛、资源是否足够,也没有现成经验可复制。

[72:00] 与海外路线的比较

[事实] 沈宇军提到 Generalist 的公开数据规模更大,数据管线更成熟;Physical Intelligence 更强调 zero-shot,而 Generalist 更接受高效后训练。

[事实] 他认为 zero-shot 和高效后训练最终都需要,因为家庭机器人应当大部分任务自己会做,少部分任务经人教一下也能学会。

[76:00] 具身智能与语言模型的关系

[事实] 沈宇军更倾向认为具身智能会成长为相对独立的方向,但会继续把大语言模型作为理解指令的入口。

[事实] 他认为语言模型解决需求泛化,具身模型解决如何把事情做好,当前阶段的核心焦点仍是后者。

[78:00] 行业进展:硬件、落地和数据

[事实] 沈宇军认为行业进展比预期更快,硬件量产、灵巧手、触觉传感器和模型进场景都在加速。

[事实] 他觉得不及预期的是数据,尤其在具身原生预训练真正出现前,行业对大规模具身数据的迫切性没有被充分激发。

[82:00] 为什么越来越多公司做大脑

[事实] 沈宇军认为本体难以通用,且必须绑定具体场景设计;如果场景选不准,本体设计也会出问题。

[事实] 他判断当前行业主要矛盾是“大脑落后于本体”,所以更多团队开始聚焦如何让机器人先把活干好。

[86:00] 传感器会被模型需求重新定义

[事实] 沈宇军认为,大脑和本体会交替上升;当智能层变强后,会对本体和传感器提出新的要求。

[事实] 他举触觉传感器为例,过去可能优先追求力的精度,但模型时代也许更需要实时反应等不同指标。

[88:00] 下一步:从架构原生走向数据原生

[事实] 沈宇军认为,灵波已经在视觉原生和架构原生上推进了一步,下一步关键是数据原生。

[事实] 数据原生要解决任务泛化,需要更优雅的数据采集方式、更多高质量数据,以及能被模型真正使用的数据标准。

[90:00] eGo 数据与规模化数据的平衡

[事实] 沈宇军认为 eGo 提出了较好的数据采集理念,但头部相机数据是否足够支持灵巧手精细操作仍未知。

[事实] 他强调数据既要可规模化,又要能被模型使用;质量、模态和数量之间需要找到平衡。

[92:00] 创业感受:落地与敢赌

[事实] 沈宇军把这次经历称为两个第一次:第一次面向落地,第一次创业。

[事实] 他认为创业必须敢赌,因为资源有限、路径未知;如果路线确定,大厂更容易凭资源胜出。

[96:00] 蚂蚁集团的支持与最好预期

[事实] 沈宇军说蚂蚁集团整体是 AI first,灵波承载的是物理世界 AI 和具身智能上限探索的一部分。

[事实] 他最好的预期是机器人真正进入家庭,并且运行灵波的模型;最坏预期则是某次关键赌注没有做出来。

[100:00] 竞争格局与本体形态

[事实] 沈宇军预计机器人大脑领域可能类似大模型格局:有大厂玩家,也有两三家创业公司,各自形成数据、本体和场景生态。

[事实] 他对人形机器人构型没有执念,认为当前最核心卡点不是轮式还是足式,而是智能不够,智能不够的核心又是数据不够。

[104:00] 汤晓鸥、开源传播与未来愿景

[事实] 沈宇军回忆汤晓鸥老师幽默,且能从混沌中快速抓主要矛盾。

[事实] 他认为具身智能不像大模型或多模态模型那样容易传播,因为普通用户没有机械臂,预训练模型也不是拿来即用。

[106:00] 希望机器人离大众更近

[事实] 沈宇军希望未来机器人能像语言模型 App 一样离大众更近,让普通人有渠道体验和使用。

[事实] 他提到如果有一天能把自己做的机器人直接带给父母看,成就感会和现在完全不同。

[108:00] 快问快答与最后的关键 Bet

[事实] 沈宇军喜欢日料,喜欢的地点是家,推荐的人生之书是《笑傲江湖》。

[事实] 如果机器人有性格,他希望机器人是“J 人”,因为核心还是实用和能干活;在情绪价值和干活之间,他会选择干活。

[事实] 他最后强调的关键 bet 是“具身原生”,即坚信具身智能要有自己的模型。

播客点评/总结

[推测] 本期的价值在于,它不是泛泛讨论机器人热潮,而是把“机器人大脑”拆成了传感器、空间感知、视频时序、模型架构、数据管线和产业落地几个具体层面,适合想理解具身智能技术路线的人。

[推测] 亮点是沈宇军对“数字世界模型”和“物理世界模型”的差异讲得比较具体:画质、实时性、单向时间、动作对齐、空间可接触性,这些细节能帮助听众理解为什么机器人不只是给大模型接一个机械臂。

[推测] 局限在于,节目主要围绕蚂蚁灵波自身路线展开,对外部路线的比较更多是高层判断,缺少更细的实验指标、失败案例和不同模型之间的公开基准对照。

[推测] 本期尤其适合 AI 从业者、机器人创业者、投资研究人员,以及关注中国具身智能产业如何从硬件优势走向数据和模型优势的听众。