当机器人学会认路,物理世界才真正接上了 AI
高德为什么下场做具身智能:从导盲机器狗到物理 AI 入口
概览
本期节目在世界机器人大会 2026 现场录制,围绕“高德为什么会出现在机器人大会”展开。嘉宾唐文斌是高德具身业务负责人,讨论重点不是展馆里大量机器人本身,而是机器人产业为什么走到今天这个节点。
节目先回顾机器人从工业机械臂、人形机器人早期探索,到 AI、强化学习和大模型推动运动控制突破的过程。核心结论是:今天机器人的热潮不是突然出现,而是机械结构、控制能力、算力和模型能力长期交替上升后的结果。
高德的切入点不是一上来做完整人形机器人,而是先做“移动”和“导航”。节目用导盲机器狗、末端配送、巡检巡逻等场景说明,机器人要真正有用,需要地图数据、视觉理解、任务拆解、室内外导航和执行能力一起工作。
分段落总结
[00:14] 现场开场与核心问题
[事实] 本期是“科技乱炖”在世界机器人大会 2026 现场与高德做的一场开放麦。 [事实] 嘉宾唐文斌介绍自己是高德具身业务负责人,公司内部昵称“子乔”。 [事实] 主持人提出,本期不重点聊展馆里“满坑满谷”的机器人,而是聊机器人为什么不是“一夜之间冒出来”的。
[01:26] 机器人不是突然爆发
[事实] 主持人强调,机器人概念从上世纪六七十年代甚至更早就有人在研究。 [事实] 嘉宾提到,机器人概念可以追溯到达芬奇的设计方案,工业机器人则在 1957 年左右由美国提出机械臂形态。 [事实] 日本后来推动工业机器人发展,中国则在七八十年代开始引入相关概念,九十年代通过合资等方式推动工业自动化。
[04:00] 算力与机器人早期探索
[事实] 工业机器人最初主要用于工厂、产线和专业领域。 [事实] 人形机器人概念也很早,日本公司在六七十年代已经做过多种人形机器人研究。 [推测] 主持人把早期机器人热情与 AI 早期发展类比,认为很多想法并不新,真正变化的是算力和基础设施逐渐成熟。
[06:00] 结构与计算交替上升
[事实] 嘉宾认为机器人是“结构和计算相辅相成”的系统,电机、控制技术和算法会交替推动彼此发展。 [事实] 节目提到纯机械双腿、单腿跳等例子,说明早期也存在不依赖复杂计算的结构式实现。 [事实] 简单循线机器人可以通过光敏二极管、单片机等低复杂度方式完成任务。
[08:18] 自由度与人形机器人的难度
[事实] 嘉宾解释,自由度是机器人领域的重要概念,工业机器人通常有六到七个自由度。 [事实] 人形机器人因为两条腿、两只手和更多关节,可能有四十多个自由度。 [推测] 人形机器人之所以被持续追求,一方面来自“机器人像人”的想象,另一方面因为人类社会的环境和工具主要按人的形态设计。
[11:55] E+X+N:专用设备与通用执行者
[事实] 节目讨论了“E+X+N”的设想:N 是微波炉、洗衣机、扫地机等专用设备,X 是轮式或四足等中间执行形态,E 是最终更接近人的形态。 [事实] 嘉宾承认专用设备通常最便宜、最有效,但这些设备仍需要有人去使用。 [推测] 高德当前做的四足机器狗更接近“X”,即先作为能驱动物理世界和既有设备的中间层。
[14:19] 物理交互是智能家居之外的难题
[事实] 音箱或网关可以控制空调、窗帘等智能设备,但它们不直接和物理世界发生交互。 [事实] 如果任务涉及开冰箱、拿东西、关窗户、捡纸团,就需要机器人具备自主规划和物理执行能力。 [事实] 嘉宾提到,中国已经是全世界最大的工业机器人消费国。
[15:24] 传统机器人走到预编程瓶颈
[事实] 嘉宾提到 ASIMO 和 Boston Dynamics 的机器人在传统控制角度已经很强。 [事实] 但这些机器人过去很大程度上依赖预编程动作,后续发展一度遇到不知道如何继续突破的问题。 [事实] 主持人观察到,展馆中不少机器人背后仍有人类操作手。
[17:10] 大模型与强化学习带来运动突破
[事实] 嘉宾明确表示,近几年机器人变多与大模型有“极大的关系”。 [事实] 通过强化学习和仿真环境,可以让大量机器人在虚拟环境中练习走、跑、跳,从而训练出稳定控制参数。 [事实] 嘉宾将这种能力对应为机器人的“小脑”,负责平衡、运动和身体协调。
[22:53] 大小脑架构:运动与决策分工
[事实] 小脑负责让机器人走、跑、跳并保持稳定,大脑则负责感知、理解和决策。 [事实] 有了大脑,机器人才能根据外部环境和人类指令,把复杂任务拆成一步步可执行的动作。 [推测] 节目中的“大小脑”框架,是把具身智能拆成低层运动控制和高层任务理解两套系统来讨论。
[24:38] 灵巧手和触觉的复杂性
[事实] 嘉宾认为灵巧手是机器人领域的重要概念,因为机器人要真正工作就需要操作能力。 [事实] 五指灵巧手灵活度高,但生活中九成以上任务未必需要五指完成。 [事实] 触觉传感会带来大量信息处理需求,一根手指上可能有几百个触觉点。
[30:17] VLA、世界模型与动作模型
[事实] 嘉宾解释,VLA 指 Vision Language Action,即基于视觉、语言理解和行动的模型。 [事实] 世界模型用于预测物体在物理世界中的结果,例如水瓶被推会倒下。 [事实] World Action Model 更关注“怎么执行动作”,例如如何拍、如何抓、抓哪里。
[34:06] 响应速度仍是人形机器人的瓶颈
[事实] 展馆中很多机器人操作缓慢,嘉宾认为关键原因不是硬件慢,而是模型大、计算慢、思考和执行之间存在延迟。 [事实] 大脑如果在云端思考,再把结果发给小脑执行,反馈链路会变慢。 [事实] 嘉宾认为人形机器人还需要很长一段路,高德因此先把落地重点放在移动能力上。
[37:43] 高德选择从移动切入
[事实] 高德是一家地图公司,积累了二十多年的时空数据。 [事实] 嘉宾认为,高德可以告诉机器人从 A 点到 B 点怎么走、过程中会遇到什么障碍以及如何处理。 [事实] 高德希望基于地图数据和导航模型,让机器人从室内展台走向真实环境。
[40:25] 导盲机器狗是第一个核心场景
[事实] 节目讨论了真实导盲犬对视障人士的帮助,包括提示门宽、障碍和熟悉路线。 [事实] 主持人在高德展台闭眼体验了导盲机器狗,提到手柄有震动,机器狗可以通过扬声器和耳机提示路线信息。 [事实] 嘉宾表示,中国现在只有三四百条导盲犬,而视障人群数量远高于这个规模。
[43:51] 机器狗的记忆、对话与导盲优势
[事实] 嘉宾称机器狗有长短记忆系统,一只狗熟悉的路线可以通过云端让其他机器狗复用。 [事实] 导盲机器狗可以通过自然语言明确告诉使用者前方情况。 [事实] 节目提到真实导盲犬有寿命、训练成本、匹配关系、情绪和场所准入等问题。
[46:25] 导盲的目标是让人走出家门
[事实] 嘉宾说,盲杖需要碰到障碍物后才知道哪里不能走,在广场等开放空间里容易失去方向。 [事实] 导盲机器狗可以根据目的地带视障人士去邮局、菜场甚至某个摊位。 [事实] 嘉宾强调,核心目标是让盲人融入社会生产生活,拥有尊严。
[49:05] 导盲为什么现在可做
[事实] 嘉宾认为过去导盲机器人难做,原因包括缺乏城市级地图、自动导航能力和足够强的大脑。 [事实] 现在机器人可以理解有人过来时如何闪避,也可以通过自然语言和耳机与主人沟通。 [事实] 导盲机器狗需要身份识别,只听主人的指令,避免被别人随意喊走。
[50:18] 末端配送与阿里生态
[事实] 嘉宾把末端配送作为从导盲延伸出的另一个场景,关联到阿里的物流和快递生态。 [事实] 老小区没有电梯、办公园区或高档小区外卖进不去,都是末端配送的痛点。 [事实] 机器狗背上可以放置物品,并把快递或外卖送到办公室、会议室或家门口。
[52:32] 买菜、咖啡与自主判断
[事实] 嘉宾提到,后续可以让机器狗去菜场买三斤黄瓜,并通过视觉模型判断黄瓜是否新鲜。 [事实] 节目举例称,机器狗去买瑞幸咖啡时发现门关了,会反馈附近有星巴克并询问是否替换。 [事实] 机器狗能结合视觉判断、地图信息和与主人的通信来调整任务。
[54:54] 宏观、中观、微观导航
[事实] 主持人把能力拆成微观的室内操作、宏观的城市导航,以及介于两者之间的中观环境理解。 [事实] 嘉宾说高德做的是纯视觉导航模型,现有地图多是车道级,而机器人需要人行步道级、园区级等更细粒度数据。 [事实] 节目提到,机器人需要知道天桥是斜坡还是楼梯、马路牙子是否有坡、通道宽度是否足够等信息。
[58:20] 足式形态与机器人专用导航
[事实] 嘉宾表示,机器人是否能通过某条路取决于它是轮式还是足式,因此需要机器人专用导航。 [事实] 高德选择足式机器狗,是为了让它跨过沟坎、进地铁、处理楼梯和站台缝隙,并上公交车或出租车。 [事实] 在园区内部,如果有梯控协议,机器人也可以控制电梯。
[60:54] 室内外融合与 A-BOT Navigation
[事实] 高德有一套 A-BOT 系列模型,其中 Navigation 已经到 1.5 版本。 [事实] 对办公室等更私密、更细粒度的环境,可以带着机器狗转一圈,让它记住工位、办公室、洗手间等位置。 [事实] 嘉宾提到这些数据可在机器狗之间复用,同时也会注意隐私安全。
[62:43] 商业化负反馈螺旋
[事实] 主持人提到,很多具身智能厂商面临“负反馈螺旋”:机器人造价高,客户难以用人工成本算出回本周期。 [事实] 嘉宾和主持人认为,产业链、供应链、软件和应用生态如果跟不上,机器人能力也难以规模化。 [推测] 场景一旦成立,哪怕只是送咖啡、送外卖、巡检这样的小场景,也可能帮助产业证明市场存在。
[66:00] 巡检巡逻和危险场景
[事实] 嘉宾说大场区巡检使用传统 SLAM 高精建图会遇到困难,空旷或环境变化时机器人可能定位失败。 [事实] 野外管线、管网、半山腰、森林巡护等场景路况差、环境变化大。 [事实] 高德希望机器人用于核电站、化工场区、野外巡检、巡林等人不愿意去或有危险的场景。
[70:54] 数据闭环与自进化系统
[事实] 嘉宾说高德有一套 AI 和 Data 的基础设施,机器人出去后会获取真实环境信息。 [事实] 机器人执行任务中的成功和失败经验会回传,并进入自进化系统分析原因、生成新能力。 [事实] 嘉宾将这套闭环类比为自动驾驶的数据回传和迭代机制。
[73:25] 高德作为 Physical AI 端口
[事实] 嘉宾提到,高德 CEO 郭宁提出高德要成为阿里的 Physical AI 物理 AI 端口。 [事实] 高德认为自己虽然相对其他具身公司下场较晚,但可以基于对数据和具身的理解,先把技术真实跑起来。 [事实] 嘉宾强调,高德不是一上来追求远期操作能力,而是希望先把技术下放到真实产业场景。
[74:08] 未来一年与产业生态
[事实] 嘉宾预计到明年这个时候,外界能够看到高德机器狗在更多地方出现,但开放环境大规模使用还涉及路权和安全问题。 [事实] 高德希望更多盲人使用导盲机器狗,也希望在小区、办公场所、封闭园区看到配送机器人。 [事实] 嘉宾说高德展台也展示了人形方向的前期探索,但进展快慢取决于整个产业界。
[77:17] 大会氛围与结尾
[事实] 主持人说现场背景较嘈杂,但这种氛围契合 AI 热潮。 [事实] 主持人把当前 AI 和机器人热潮类比为十几年前移动互联网刚兴起时的感觉。 [事实] 嘉宾提到,今年上海 WAIC 和 WRC 上,机器人被社会认可、认知,并作为国家战略级方向推动。
播客点评/总结
[推测] 本期最大的价值在于把“为什么机器人突然多了”拆成历史、硬件、控制、AI 模型、场景和商业化几条线,而不是停留在展会热闹或产品炫技上。
[推测] 节目亮点是高德的切入逻辑讲得比较清楚:它不直接从最难的人形通用操作开始,而是用地图、导航、实时数据和视觉模型切入移动场景,再连接导盲、配送和巡检。
[推测] 局限是嘉宾来自高德,讨论不可避免更偏高德方案和阿里生态视角;关于成本、量产节奏、安全验证和监管路权等问题,只给了方向性判断,缺少更具体的数据。
[推测] 这期适合关心具身智能、机器人商业化、地图数据如何变成物理 AI 基础设施的听众,也适合想理解机器狗为什么可能比人形机器人更早落地的人。