“我看到了 Scaling Law 的信号” | 对谈清华叉院助理教授徐梦迪:具身智能、世界模型、真正的泛化
从预训练到持续学习:具身智能的 Scaling Law、世界模型与真正的泛化
概览
本期对谈围绕一个核心问题展开:机器人如何超越预训练数据的边界,在开放、持续变化的现实环境中快速学习。徐梦迪认为,真正的泛化不仅来自更大规模的数据和模型,还依赖机器人根据演示、纠正、身体动作及失败经验进行上下文学习与现场适应。
讨论进一步比较了 VLA、世界模型和多种数据路线。世界模型试图学习与具体任务无关的世界变化规律,数据则决定模型能够获得哪些能力;真机数据、仿真数据、UMI 数据与人类数据各有所长,应被放在不同训练阶段协同使用。
对于具身智能的 Scaling Law,徐梦迪已经观察到数据规模扩大后测试损失改善的信号,但强调损失下降不等于任务成功率上升。真正有意义的 Scaling Law,应表现为模型规模和数据量增加时,机器人在未见任务上的成功率持续提升。
对谈也穿插了她从车辆工程、仿生机器人到 Robot Learning 的研究经历,以及从 CMU、斯坦福回到清华任教的选择。贯穿其中的方法论是:围绕长期重要的问题保持专注,同时把机器人视为硬件、模型、数据与现实部署共同组成的完整系统。
分段落总结
[00:06] 研究目标与“真正的泛化”
[事实] 徐梦迪目前投入最多的方向,是让机器人能够在现实场景中持续提升自己。
[事实] 她认为人类泛化能力既来自丰富的先验知识,也来自快速学习新知识的能力。
[事实] 因此,真正的机器人泛化不能只依靠预先学到的知识,还要让机器人具备类似人类的快速学习能力。
[01:37] 从 MAML 走向 Robot Learning
[事实] 徐梦迪在 CMU 开始从事 Robot Learning,把机器学习方法用于机器人。
[事实] MAML 展示出的新任务快速适应能力,让她意识到这可能是机器人未来的重要方向。
[事实] 当时实验室成员会广泛阅读机器学习前沿论文并相互交流,这帮助她接触到元学习等新方向。
[02:50] 从车辆工程到机器人算法
[事实] 她本科就读车辆工程,课程覆盖机械设计、汽车电子和算法,因此获得了跨硬件与软件的知识基础。
[事实] 本科科研从蜜蜂翅膀的超弹性恢复等仿生机器人问题开始,之后在 CMU 参与蛇形机器人设计。
[事实] 她在蛇形机器人项目中逐步由机械设计转向机器人算法。
[05:08] 衡水竞赛经历与兴趣驱动
[事实] 徐梦迪来自河北衡水,高中是物理竞赛生;竞赛班作息严格,但学习内容和管理方式与普通高考班有所不同。
[事实] 她认为竞赛需要很强的时间投入,但同学之间更像共同解题、共同成长的伙伴,而非单纯的竞争者。
[事实] 她小时候喜欢拼装四驱车,对机械结构长期保持兴趣,这也影响了后来选择车辆工程。
[11:51] 开放世界中的适应型通用机器人
[事实] 她的博士论文主题是构建能够适应环境变化的通用机器人,并获得所在系的最佳博士论文奖之一。
[事实] 她认为预训练非常有用,但不足以保证机器人在部署环境中可靠工作,因为现实任务、物体和人的偏好都在不断变化。
[事实] 她探索了上下文学习和测试时训练两条路线,希望机器人通过交互与上下文继续学习,而不被预训练知识完全限制。
[13:53] Prompt Decision Transformer 与参数适应
[事实] Prompt Decision Transformer 受到 GPT-3 上下文学习能力的启发,尝试让机器人通过提示快速适应新的运动与操作任务。
[事实] 后续的 Hyper Decision Transformer 使用超网络生成少量适配器,只需调整 Transformer 约 0.5% 的参数,以减少遗忘原有知识的问题。
[事实] 随着数据和预训练规模扩大,她更看好不修改模型参数、主要依靠上下文完成快速适应的路线。
[17:01] 让模型参数代表“学习算法”
[事实] Algorithm Distillation 提出,模型参数不只可以记忆专家任务知识,也可以等价于一种强化学习算法。
[事实] 该方法把次优轨迹放入上下文,让模型根据过去的不良执行历史改善未来动作,从而表现出自我提升能力。
[事实] 相关工作已在仿真导航和运动任务中展示效果,但将其用于更复杂的机器人操作仍较困难。
[19:24] 为什么适应能力重新受到重视
[事实] 徐梦迪观察到,业界和学界正在逐渐形成共识:只依靠大规模预训练或专家示范模仿,无法解决机器人面对的全部问题。
[事实] 人类的泛化同时依赖强先验与快速学习,机器人也需要兼顾这两部分能力。
[事实] 机器人进入现实环境前仍需足够强的基础模型,否则现场学习可能造成打碎物品等危险行为。
[22:01] 斯坦福研究:任务、偏好与创造性工具使用
[事实] 在李飞飞和吴嘉俊团队做博士后期间,她参与了 BEHAVIOR Benchmark、机器人指令与偏好适应,以及创造性工具使用等研究。
[事实] 创造性工具使用强调根据物体功能而非名称选择工具,例如没有蛋糕刀时使用叉子或筷子切蛋糕。
[事实] 相关基准从多模态模型选择工具、可变形物体的三维或四维重建,以及将人类工具使用能力迁移给机器人三个层面进行评估。
[26:39] 从解决问题到定义问题
[事实] 徐梦迪认为李飞飞更偏愿景驱动,经常促使研究者跳出单个项目,思考未来十年真正重要的问题。
[事实] 在评测指标讨论中,李飞飞强调最终成功率才是核心指标,其他细粒度指标更多服务于开发和调试。
[事实] 她由此体会到,博士生更关注如何解决问题,而独立研究者还需要判断什么问题真正值得定义和投入。
[事实] 吴嘉俊则更深入参与项目设计与细节讨论,并鼓励她建立自己的研究品牌。
[29:38] 如何建立长期的研究品牌
[事实] 她认为研究品牌应从真实兴趣出发,而不是刻意追求与别人不同。
[事实] 一个值得投入十年甚至更久的问题,本身就可以定义研究者的品牌。
[事实] 当研究者围绕同一重要问题持续研究三到五年,稳定的研究方向和辨识度会自然形成。
[31:05] 回国任教与学术自由的选择
[事实] 徐梦迪曾在工业界与学术界之间长期权衡;工业界拥有更强的算力和规模化资源,学术界则提供更高的研究自由度。
[事实] 她最终选择清华交叉信息研究院,是因为这里兼具优秀学生、跨学科环境,以及把机器人做成完整落地系统的条件。
[事实] 对她而言,能把时间投入自己认为最重要的问题,比单纯追求更多资源更重要。
[34:34] 专注于少数真正重要的问题
[事实] 面试时,一位老师问她为什么相信自己五年后能成为领域内的顶尖研究者。
[事实] 她后来认为,比单纯表达自信更好的答案,是找到真正感兴趣的问题,并沿着正确方向持续进行有深度的研究。
[事实] 姚期智给她的重要建议是集中注意力,因为真正重要的问题不多,而个人时间非常有限。
[事实] 她当前最关注的仍是让机器人具备上下文学习能力,不再完全由训练阶段见过的数据定义。
[39:04] 环境选择、幸运与信息采集
[事实] 徐梦迪不把自己的经历概括为一帆风顺,而更愿意称为幸运,因为每个阶段都有朋友、导师和合作者提供支持。
[事实] 她认为个人成长一部分取决于自己,一部分取决于所选择的环境,而环境又会反过来塑造个人。
[事实] 选择环境时,她更关注这个环境能否最大化自己的兴趣和能力,而不是笼统意义上的“最好”。
[事实] 在作出选择前,她会主动联系朋友或研究者收集信息;邮件最重要的是体现对领域的真实了解、明确兴趣和诚意。
[45:00] 中国具身智能:实际进步与泡沫并存
[事实] 她观察到,中国具身智能从材料、传感器、本体、数据到模型等各层面都有公司投入,也确实产生了实际进步。
[事实] 与此同时,由于技术路线尚未收敛,市场关注点在数据、世界模型等方向之间摆动,泡沫与震荡不可避免。
[事实] 她认为进步与泡沫并不互斥,长期仍对行业发展保持乐观。
[47:01] 数据、VLA 与世界模型
[事实] 数据决定模型能够看到什么,世界模型则更关注模型如何表示和理解世界,两者不是互斥路线。
[事实] 相比围绕具体任务训练的 VLA,世界模型试图学习与任务无关的世界变化规律。
[事实] 她更相信世界模型路线,因为现实任务无法穷举,而世界规律具有更基础、更可扩展的价值。
[推测] 世界模型并非要替代 VLA,而更可能与动作模型形成互补:前者负责理解和预测,后者负责执行具体任务。
[49:15] 具身智能的 Scaling Law 信号
[事实] 她已经从部分公司发布的结果中看到信号:预训练数据从十万小时扩大到百万小时后,模型在未见测试数据上的损失有所改善。
[事实] 但机器人任务中的损失与成功率并不直接挂钩,少数关键接触动作的误差就可能让整个长程任务失败。
[事实] 她期待看到的真正 Scaling Law,是随着数据和模型规模增长,机器人在未见任务上的成功率稳定上升。
[事实] 她认为当前具身模型大致仍处在类似 GPT-1 的阶段,需要针对目标领域进行微调;理想目标则是类似 GPT-3,通过上下文直接适应任务。
[52:06] Benchmark、安全与实时性
[事实] 她认为具身智能比语言模型更需要基准测试,因为机器人拥有身体,失败可能带来现实风险。
[事实] 评测需要覆盖成功率、失败方式和风险边界,并通过部署前的压力测试告诉开发者和用户模型能做什么、不能做什么。
[事实] 她推荐持续维护的 BEHAVIOR Benchmark,其优势是包含长程家庭任务,局限则是仿真与现实之间存在差距。
[事实] 除安全外,实时性也是机器人的独特要求;机器人必须持续与环境交互,无法像复杂语言模型那样等待数分钟再响应。
[56:23] 上下文学习如何改变终端机器人
[事实] 以叠衣服为例,不同家庭可能要求折叠、卷起、按颜色摆放或直接悬挂,预训练无法穷举所有用户偏好。
[事实] 上下文学习希望让终端用户通过演示或指示定义机器人的具体行为。
[事实] 当机器人在大量家庭和服务场景中反复适应新任务时,它学习新任务所需的时间有望逐渐缩短。
[事实] 她认为这种“学习如何学习”的能力,是机器人进一步规模化的重要路径。
[58:49] 数据闭环与当前真机实验
[事实] 这一路线最难的环节,是建立稳定的数据闭环:基础模型必须足够好,让用户经过有限教学就能看到明显改善。
[事实] 如果初始能力不足,用户不会持续使用和纠正机器人,数据闭环也就无法启动。
[事实] 她的团队目前从较简单的桌面任务开始,让双臂真机根据人的纠正指示和演示改变行为。
[事实] 团队的长期目标是实现包含灵巧手在内的全身灵巧操作。
[60:30] 上下文学习与离线模仿学习的区别
[事实] 离线模仿学习通常把专家示范通过监督学习写入模型,更接近任务知识的记忆。
[事实] 这类模型主要依赖训练分布内部的插值泛化,例如处理见过范围内的新物体位置,但不等于学会新任务。
[事实] 上下文学习希望同时利用次优数据、人的身体动作、语言纠正、人类演示和机器人演示,以激发模型从反馈中学习的能力。
[63:31] 模型能力反向定义数据需求
[事实] 数据采集方式不应凭空决定,而应由模型所需能力反推。
[事实] 若希望动作更平滑,就需要平滑轨迹;若希望模型从失败中恢复,就需要包含失败与纠正过程的数据。
[事实] 分割、追踪、深度重建和上下文学习等不同能力,对数据模态和内容提出不同要求。
[事实] 当前的困难在于业界对模型最终应具备哪些能力仍缺少统一定义。
[65:28] 多源数据的融合路线
[事实] 徐梦迪主张融合使用不同数据,因为每类数据适合承担不同训练功能。
[事实] 真机遥操作数据最接近目标机器人,适合微调或后训练;仿真数据易于改变位置、纹理和颜色,适合预训练和中期训练。
[事实] UMI 数据处于人类数据和机器人数据之间,采集成本相对较低。
[事实] 人类数据成本最低、场景覆盖最广,可用于学习场景和物体的变化;其形态差异有望通过形态迁移方法解决。
[68:27] 给年轻研究者的建议
[事实] 她建议初入具身智能的学生先广泛阅读、主动交流,在充分了解领域后再收敛出真实兴趣。
[事实] 仅对流行概念感兴趣并不足够,研究者需要尽早把兴趣转化为实际行动。
[事实] 真机部署高度依赖经验,越早动手,越容易理解这个领域真正困难的地方。
[事实] 她面试博士生时常问对方最感兴趣或认为做得最好的一篇论文,以考察其研究品位、领域理解和独立判断。
[71:24] 实验室培养与团队文化
[事实] 她对本科生采取相对开放的方式,希望为学生提供接触前沿研究的平台。
[事实] 组会采用教程式组织:先系统梳理领域或技术流派,再由学生介绍自己的项目。
[事实] 她认为实验室的早期建设类似从零开始组建团队,博士生不仅参与研究,也共同承担实验室建设工作。
[事实] 她希望成员不只是学术合作者,也能成为长期相互信任的朋友。
[76:16] AI 工具与论文爆发
[事实] 她日常会交替使用 ChatGPT 和 Gemini,既用于总结、调研,也开始用于非工作对话和实验室命名等创意任务。
[事实] 面对 Robotics 论文数量快速增长,她主要关注熟悉研究者主动推荐或宣传的论文,把作者网络作为初步筛选机制。
[事实] 她认为 AI 生成的论文可能通过审稿,但通常论证更空泛、漏洞更多,整体质量尚未超过认真写作的人类研究者。
[79:30] 具身智能马拉松的当前位置
[事实] 如果把具身智能比作 42 公里的马拉松,她认为行业大约跑到 10 公里,即四分之一的位置。
[事实] 强调泛化和通用性的智能机器人尚未真正进入现实场景大规模使用,因此仍有很长的路要走。
[事实] 她对未来保持乐观,预计未来三到五年可能通过 Scaling 看到明确的范式转变或技术拐点。
播客点评/总结
本期最有价值之处,是把“泛化”从一个宽泛口号拆成两个可操作的问题:模型是否拥有足够强的先验,以及是否能在部署后快速学习。它也清楚说明了为什么扩大数据和模型虽然必要,却不能自动解决机器人在开放世界中的适应问题。
讨论没有把数据、VLA、世界模型或上下文学习包装成单一答案,而是反复强调模型能力、数据结构、真实部署、安全评测与用户反馈之间的系统关系。关于损失与成功率脱节、基础模型与数据闭环相互依赖的分析,尤其揭示了具身智能不同于语言模型的核心难点。
[推测] 节目的局限是覆盖话题较多,部分论文与技术路线只给出了概念性介绍,缺少可横向比较的量化结果;对产业泡沫、商业落地成本和硬件可靠性的讨论也相对简略。
这期内容适合具身智能、机器人学习和世界模型方向的研究者与学生,也适合正在判断行业阶段、研究路线或学术职业选择的从业者。即使没有机器人背景,也能从中获得关于长期研究、环境选择和建立个人研究品牌的方法论启发。