当具身智能走到十字路口|对谈苏度、蚂蚁灵波、自变量、破壳:四种一线判断

当具身智能走到十字路口:数据、智能与场景之争

Episode guide Published 十字路口Crossing 42 min

概览

本期围绕具身智能在 2026 年面临的三类路线分歧展开:数据之争、智能之争和场景之争。嘉宾们分别从仿真数据、真实数据、基础模型能力、机器人商业化等角度,讨论行业尚未收敛的关键路径。

在数据问题上,讨论并不是简单站队“仿真”或“真机”,而是强调不同数据在不同阶段的作用。仿真被认为能解决真实采集效率和规模问题,真实世界数据则被认为包含传感器噪声、物理不完美和接触信息等难以替代的内容。

在智能问题上,Astra 触发了对通用大模型是否会“降维打击”具身智能公司的讨论。多位嘉宾认为,通用大模型在语义和空间理解上很强,但复杂物理接触、连续传感输入、底层高成功率技能,仍是具身智能公司的核心阵地。

在商业化问题上,嘉宾们普遍把“持续付费”“高成功率”“部署效率”“ROI”“系统工程能力”视为产业化关键。最后的展望中,嘉宾们认为数据量崇拜、训练技巧或供应链成熟度可能被高估,而具身智能对 AGI、物理世界生产和通用服务的长期价值可能被低估。

分段落总结

[00:00] 三类争议:数据、智能与场景

[事实] 主持人开场提出本期讨论三个话题:数据之争、智能之争和场景之争。

[事实] 主持人认为 2026 年的具身智能处在十字路口,仍有很多未收敛的路径等待探索。

[推测] 本期的核心并不是寻找单一答案,而是通过不同一线公司的判断呈现行业路线分叉。

[00:49] 仿真路线:规模化预训练离不开仿真

[事实] 韩正表示他们坚信要使用仿真,但也认为真实世界数据非常有用,并不是纯粹只用仿真。

[事实] 他提到,过去开源仿真器和现有工具在大规模预训练、强化学习和数据生成方面仍有局限,因此他们在 2024 年后重构了大规模数据和仿真管线。

[事实] 他称,在抓取、放置、组装等任务中,通过物体、环境和光线组合的泛化训练,某些技能可以在物体和环境几乎不受限时接近百分之百成功率。

[推测] 他的判断是,仿真最重要的价值不只是补数据,而是支撑可规模化的基础技能训练。

[03:52] 真实数据:传感器噪声和物理不完美难以替代

[事实] 沈宇军表示,灵波并不认为某一种数据必须选择或必须排除,不同数据在不同阶段有不同作用。

[事实] 他认为预训练阶段互联网数据和真实物理世界采集数据作用更大,而针对具体任务时仿真数据仍有价值。

[事实] 他强调机器人只能依赖自身传感器获得输入,而真实传感器存在误差,物理世界的不完美很难完全仿真。

[事实] 他用触觉传感器举例,真实传感器信号和仿真信号在频率、幅值和一致性等方面差异很大。

[推测] 这里的关键分歧不是 sim-to-real,而是 real-to-sim 是否能被规模化地完成。

[07:51] Astra 引发的智能之争

[事实] 主持人提到 GPT-6 的 Astra 发布后,社交媒体出现大量用 Astra 控制机械臂完成任务的视频,并引发“具身智能会被通用语言大模型降维打击”的说法。

[事实] 王前认为,Astra 能做这类任务并不奇怪,因为相关模型中加入了大量机器人的数据,OpenAI 和 Anthropic 也在采购、采集机器人数据并招募相关人才。

[事实] 他提出“智能的本体存在于数据里”,模型更多是训练时的蒸馏器和部署时的容器。

[推测] 他的观点把竞争焦点从“模型架构谁更强”转移到“谁拥有更好的数据、验证和基础设施”。

[10:36] 通用大模型不会天然解决具身问题

[事实] 王前认为,如果 OpenAI 或 Anthropic 要做具身智能,仍然需要现实世界数据、仿真器、验证基础设施、硬件和真实世界评估。

[事实] 他认为这些难度不会因为基础模型优势而降低,因此通用大模型公司进入后,本质上也会成为另一类具身智能公司。

[事实] 他指出,语言模型历史上并没有出现某个领域能力自然泛化解决另一个领域的情况,Coding、数学、3D 等能力都依赖相应数据和验证体系。

[事实] 他认为视频生成模型很强,但并没有天然转化为机器人动作控制能力。

[推测] 这说明具身智能的壁垒可能存在于“物理世界闭环”,而不只是模型参数规模。

[14:42] Astra 的强项与边界

[事实] 华哲表示,破壳在 Astra 可用当天就做了测试,认为它在语义泛化和空间泛化上很强,但物理泛化相对较弱。

[事实] 他提到 Astra 能识别桌面物体,能抓起筷子等难抓的小物体,也能把筷子立起来插入杯子。

[事实] 当任务涉及更复杂物理接触,如用筷子挑开东西、叠盒子、叠衣服时,Astra 表现不佳。

[事实] 他认为复杂接触任务仍是具身机器人公司的“最后阵地”。

[推测] Astra 更像是证明了上层语义和空间规划能力的跃迁,而不是证明机器人已掌握复杂物理操作。

[17:29] 大模型与具身模型需要连接成系统

[事实] 华哲认为未来大模型、具身模型和物理世界应连接成一个完整系统。

[事实] 他用真假菠萝举例:泡沫水果和真菠萝需要不同抓法,而多数具身模型缺少这种基于语义和物理反馈调整策略的能力。

[事实] 他认为 Astra 可以通过推理和反馈帮助判断物体类型,再指导具身模型采取不同动作。

[推测] 未来系统可能不是单个模型端到端解决所有问题,而是由大模型负责高层理解,具身模型负责稳定执行。

[19:05] 连续传感输入决定具身模型范式

[事实] 沈宇军认为,具身模型最终要部署到机器人上,必须持续接收传感器输入,并在推理过程中随时根据新输入改变策略。

[事实] 他指出,这与数字世界中轮式对话模型的工作方式不同,机器人不能在推理时中断外部输入。

[事实] 他认为具身模型可能会成为更高阶模型使用的工具,但需要自己的训练范式。

[事实] 他进一步提出,机器人从现实世界获得的多模态信息可能反过来成为大模型新的语料来源。

[推测] 具身智能可能不仅被大模型影响,也可能为大模型提供新的物理世界数据和交互方式。

[22:47] 上下分层与底层技能可靠性

[事实] 韩正认为,行业观点正在接近“上下分层”:上层负责抽象理解,底层负责技能执行。

[事实] 他强调,底层技能必须同时具备泛化性和高成功率,否则与上层模型衔接时会成为致命问题。

[事实] 他提到,他们此前做过通过语言交互和上层模型理解环境、拆解动作步骤,再依赖可靠底层操作完成任务的演示。

[推测] Astra 的出现让“上层推理加底层技能”的架构重新成为行业显性共识。

[24:42] 产业化指标:高成功率与泛化性

[事实] 主持人提出场景之争:外界质疑具身智能 demo 多、融资热,但真正可规模复制并持续付费的场景在哪里。

[事实] 韩正认为,科研和商业化对机器人要求不同,商业化首先需要高成功率。

[事实] 他表示,多数任务对成功率要求极高,很多场景几乎需要第一次或快速纠错后接近百分之百成功。

[事实] 他认为,与传统自动化设备相比,新一代机器人还必须对物体和环境具备一定泛化性,且不能依赖大量后训练成本。

[推测] 产业化不是单点 demo 的胜利,而是高成功率、泛化和低部署成本同时成立。

[26:48] 最终标准:客户持续付费

[事实] 王前认为,如果只看一个指标,那就是客户能持续付钱,并且付的钱越来越多。

[事实] 他指出,一些商业化方式可能只是特定历史阶段的做法,或延续上一代自动化、集成模式,天花板相对明确。

[事实] 他提到,他们在物流场景中已经做到传统机器人做不到的事情,并超过了人类 ROI 的水平。

[事实] 他认为公司需要赚钱,商业化和前沿模型推进可以形成相互促进的飞轮。

[推测] 具身智能公司要跨过泡沫质疑,关键是从项目收入走向可持续生产力价值。

[29:04] 两类商业化:后训练落地与大模型化

[事实] 华哲认为具身商业化可分为后训练类落地和基础模型式商业化。

[事实] 对后训练类场景,他认为核心指标是需要多少小时能稳定部署,以及能复制到多少个点位,逻辑接近传统机器人部署。

[事实] 他指出,语言大模型即使只有 50% 成功率,用户可以通过多轮对话得到好结果;机器人 50% 成功率却可能直接摔杯子,因此用户体感完全不同。

[事实] 他认为具身智能仍应追求大模型化,即面向全任务的成功率从 50% 提升到 60%、70%,直到 99.9%。

[推测] 短期现金流可能来自具体场景部署,长期想象力则来自通用基础模型能力跃迁。

[31:31] 五年回看:供应链可能被高估,稳定技能可能被低估

[事实] 韩正认为,中国供应链的先进程度可能被高估,选择很多,但距离具身智能需要的大工业制造水平仍有差距。

[事实] 他提到传感器、关键组件等散落在汽车、工业机器人等成熟行业供应链中,但进入具身智能场景后仍需提升成熟度。

[事实] 他认为大家不用对稳定可靠技能的出现过于悲观,未来一到两年可能看到某些大类任务在多个行业中被较快处理。

[推测] 供应链短板不会否定中国具身智能机会,但会影响从 demo 到规模制造的速度。

[33:20] 系统工程被低估,训练技巧被高估

[事实] 沈宇军认为,具身智能是复杂系统工程,大家低估了系统能力,把落地、成本和技术可行性过多归因于模型性能。

[事实] 他指出,真实落地要考虑商业逻辑、是否必须使用完整机器人、是否只用双臂即可、系统鲁棒性和整体成本。

[事实] 他认为行业可能高估了训练模型的技术,好像只要收集一批物理世界数据并复刻数字模型训练路线,就能训练出具身模型。

[事实] 他认为具身智能会走与数字世界相同的模式,但不会走相同技术路线,因为机器人需要边工作边推理并持续处理物理世界信息。

[推测] 具身智能的关键创新可能来自持续输入、实时决策和系统闭环,而不是简单复制语言模型训练配方。

[36:18] 具身智能可能是 AGI 与物理生产的缺失环节

[事实] 王前认为,五年后回看,大家可能会发现仍然低估了具身智能的重要性和潜力。

[事实] 他认为复杂物理交互、传感器噪声和物理世界不可控因素包含其他方式难以获得的智能能力。

[事实] 他提出,当前原模型不足以实现完整 RSI,因为物质重制造、自我增殖、更多芯片、电力和数据中心建设仍依赖物理世界劳动。

[事实] 他设想未来在具身智能和通用原模型辅助下,制造飞机等复杂工业流程可能像今天做 APP 一样被大幅简化。

[推测] 这一段把具身智能从“机器人应用”提升到“AI 影响现实生产力边界”的层面。

[41:17] 数据量被高估,通用服务进展被低估

[事实] 华哲认为,被高估的是行业对数据量的追求,包括百万小时、几百万小时数据等说法。

[事实] 他表示,目前一些用极大体量数据训练出的模型,并没有表现出显著超越预期,或明显优于几万小时数据训练的模型。

[事实] 他认为被低估的是具身智能模型的进展,并判断三年内具身智能可以在很多地方开始提供通用服务,而不只是后训练好的服务。

[推测] 他的判断强调数据质量、模型范式和通用能力进展,比单纯堆数据规模更重要。

播客点评/总结

这期的价值在于,它没有把具身智能讨论简化成“仿真 vs 真机”“大模型 vs 机器人公司”“demo vs 商业化”的二元对立,而是把每个争议拆成阶段、任务、系统和商业指标。嘉宾们的观点虽然不同,但都承认具身智能需要多层系统协同。

亮点是讨论非常贴近一线实践:仿真管线、触觉传感器、Astra 测试、筷子抓取、叠衣服、物流 ROI、后训练部署成本等例子,让抽象路线之争变得具体。尤其是对“高成功率加泛化性”的反复强调,能帮助听众理解为什么机器人 demo 和真实产业化之间仍有距离。

局限是转录中部分术语、人名和公司名存在识别误差,一些技术名词如 Astra、OpenAI、Anthropic、sim-to-real、real-to-sim 等需要结合上下文理解。[推测] 如果听众希望获得更严格的技术细节,仍需要对照原音频或相关发布材料。

[推测] 这期适合关注具身智能创业、机器人商业化、大模型与物理世界结合的人收听;不太适合只想听入门科普的听众,因为讨论默认听众已经理解预训练、仿真、泛化、ROI 和基础模型等概念。