178: 与田渊栋聊 RSI:模型自进化如何到来?

2026-08-07 · Show: 晚点聊 LateTalk · 5343s · Source

与田渊栋聊 RSI:模型自进化如何到来?

概览

本期围绕 RSI(递归自进化)展开,讨论它为什么在最近成为硅谷 AI 圈的热门方向。田渊栋解释,Recursive Superintelligence 这家公司想探索的是用 AI 帮助 AI 自我进化,寻找新的模型、范式、训练逻辑和优化方法。

核心判断是:RSI 不只是更强的 coding agent。写代码和 agentic 能力是必要条件,但真正困难的是让 AI 具备研究员式的品位、抽象能力、方向判断和从少量样本中抓住关键联系的能力。

节目还讨论了一个关键分歧:如果智能提升是平滑的 Scaling Law 延续,领先大厂会越跑越远;如果智能提升存在阶段性平台和突破,那么创业公司、新方法和理论创新仍可能有空间。田渊栋更倾向于后者,并认为 Scaling Law 不是全部。

后半部分从 RSI 公司的首批成果、算子优化、数据和算力需求、安全与可解释性、AI 是否会成为科学等问题,延伸到田渊栋个人经历、研究品位和组织判断。

分段落总结

[00:00] 节目引入与核心问题

[事实] 主持人介绍,此前节目已讨论过 RSI,并在 6 月底采访了从去年开始探索该方向的创业者田渊栋。

[事实] 田渊栋参与创立的 Recursive Superintelligence 缩写也是 RSI,公司估值被提到已超过 46 亿美元。

[事实] 节目提出一个关键问题:率先达到 RSI 状态的公司,是否会把其他人越甩越远。

[03:00] Recursive Superintelligence 想做什么

[事实] 田渊栋说,这家公司希望找到用 AI 自我进化、自我迭代的方法,从而发现新的模式、范式、模型和训练逻辑。

[事实] 他认为公司名称中的 Recursive Superintelligence 和行业里讨论的 Recursive Self-Improvement 在意思上非常接近。

[推测] 公司定位不是单一产品或工具,而是试图搭建能持续改进 AI 研究流程的系统。

[05:00] 为什么 RSI 现在变热

[事实] 田渊栋认为,模型能力和 coding 能力提升后,AI 已经可以发现模型自身的问题,并参与研究员式工作。

[事实] 他强调,只有模型本身足够强,递归循环才可能跑起来;如果模型不够强,RSI 很难发生。

[事实] 他提到自己在去年用 GPT-5 合作完成一篇关于 Grokking 的文章后,意识到模型能力已强到可以替代部分实习生水平的研究辅助。

[08:00] AI 压缩科研反馈循环

[事实] 传统科研中,导师提出方向、学生执行实验、再反馈给导师,周期通常以天、周甚至月计算。

[事实] 有了强 AI 后,很多想法可以在几小时甚至几分钟内写代码、跑实验并返回结果。

[推测] 田渊栋把 RSI 的早期信号理解为科研迭代速度被 AI 显著压缩,而不是单纯聊天能力提升。

[13:00] 经验型研究员重新获得优势

[事实] 田渊栋认为,过去几年大模型发展中,年轻人的快速执行和高强度投入很有优势。

[事实] 当 coding agent 承担更多执行工作后,人类更重要的是判断、大方向把握、研究品位和逻辑指导。

[推测] RSI 时代可能让经验、直觉和技术品位重新变得更关键。

[15:00] RSI 与上一代 AutoML 的区别

[事实] 田渊栋说,上一代 AutoML 或 architecture search 主要由人定义搜索空间,再让算法在空间里找更优解。

[事实] 现在的大模型可以部分建模人类高层知识,对 AI 架构和问题本身有一定理解,因此可以参与定义问题和解空间。

[推测] 这一代 RSI 的变量不只是“自动搜索”,而是 AI 是否能参与研究问题的抽象与重构。

[17:00] 递归不等于完全自动化

[事实] 主持人提到 OpenAI 关于 AI intern 和自动化 AI 研究员的时间表,询问递归和自动化的关系。

[事实] 田渊栋认为,完全自动化不一定很快发生,但递归自进化可能先发生。

[事实] 他认为人仍会在 loop 中,只是人的工作层级会提高,需要做更高层次的判断。

[19:00] Anthropic 的案例是否算 RSI

[事实] 节目提到 Anthropic 文章中,Claude AI agent 独立完成开放式 AI 安全研究,并把 weak-to-strong 的性能差距缩小到 97%。

[事实] 田渊栋认为这个案例更多是提效,还没有达到他所理解的完整 RSI。

[事实] 他指出这些方法仍偏常规,需要有指标和分数来衡量模型是否变强。

[22:00] Coding agent 是支点但不是全部

[事实] 田渊栋认为 Anthropic 展示的许多工作更偏代码自进化,而 AI research problem 和 coding 之间仍有差距。

[事实] 他强调,从头写 Linux 或编译器这类任务有章可循,但突破性的 AI 研究问题往往连人都不知道怎么做。

[事实] 他明确说 RSI 比 coding agent 大得多,难度和可能路径也更复杂。

[23:00] 新公司与大厂的 RSI 竞争

[事实] 节目提到 Mirandale、Sakana AI 等新团队也在进入 RSI 方向。

[事实] 田渊栋认为这些团队在高层方向上接近,都是做递归自我进化。

[事实] 他认为 OpenAI 和 Anthropic 已经很大,并且可能优先把 coding agent 等眼前业务做好。

[推测] 他倾向于认为 RSI 这种更远期、更探索性的方向,创业公司可能更有组织和目标上的自由度。

[30:00] RSI 需要的研究员能力

[事实] 田渊栋说,RSI 除了 coding 和 agentic behavior,还需要研究员的品位、方向感、理解力和抽象能力。

[事实] 他把这种能力描述为从纷繁复杂的表象中抽取概念、总结思考,并应用到新问题上。

[事实] 他认为当前模型在这种少样本、开创性问题上的能力仍然不足。

[35:00] 低阶 RSI 已有实用价值

[事实] 田渊栋认为,RSI 不是无人车那种非零即一百的问题,而是有很多阶梯。

[事实] 低阶 RSI 已经可以做算法优化、性能提升等实际工作。

[事实] 更高阶目标是让 AI 像爱因斯坦或牛顿那样,从少量样本中获得深刻洞见。

[38:00] 强者恒强与平台期

[事实] 主持人提出,硅谷讨论 RSI 时常有一个假设:谁先达到递归自进化状态,谁就会把其他人越甩越远。

[事实] 田渊栋认为这个逻辑有一定道理,但智能提升可能不是平滑渐进的,而是阶段性突破。

[事实] 他用 S 型曲线描述:系统先快速上升,随后进入平台期,直到下一个突破出现。

[推测] 如果智能提升存在平台期,领先大厂的优势就不一定会线性扩大,创业公司仍可能通过新方法追上或切入。

[40:00] Scaling Law 不是全部

[事实] 田渊栋说,如果完全相信 Scaling Law,创业公司很难追上 OpenAI 和 Anthropic。

[事实] 他认为 Scaling Law 可能是对的,但需要指数级资源换取线性增长,而算力、数据和能源都会遇到现实限制。

[事实] 他认为需要更好、更有效的方法,而不只是继续堆计算资源。

[42:00] RSI 的远期想象

[事实] 田渊栋认为智能未来空间很大,人类现在只是刚看到一点星光。

[事实] 他设想如果 RSI 普及,很多世俗层面的需求和欲望都可能被 AI 满足。

[事实] 他也提到,如果人类失去动力,社会如何继续发展会成为大问题。

[45:00] 从 AI for AI 到自然科学

[事实] 田渊栋说,公司层面仍然聚焦把 RSI 这件事做成。

[事实] 他认为 AI for AI 是第一阶段,如果系统能在 AI 问题上形成新的架构、理论或优化算法,之后可能用于其他科学领域。

[推测] 他的路线是先在反馈更快、可验证性更强的 AI 研究中验证系统,再扩展到更广泛科学问题。

[46:00] RSI 首批成果

[事实] RSI 公司 6 月发布的技术博客题为 First Steps Toward Automated AI Research。

[事实] 田渊栋介绍,系统在 NanoChat 5 分钟训练、NanoChat speed run 和算子优化上取得结果,并且相关成果已开源。

[事实] 他强调三个测试使用的是同一个系统,目标是证明系统具备通用性,而不是为单个任务做特殊化。

[50:00] 小数字背后的难度

[事实] 田渊栋说,算子优化结果比第二名高约 10%,而第二名团队来自专业 GPU 和半导体背景。

[事实] 他表示 RSI 团队没有真正的 GPU 算子专家,却能通过系统取得更好效果。

[事实] NanoChat speed run 从 79 秒提高到 77 秒左右,看似幅度小,但这个 benchmark 已由社区优化两年,继续提升并不容易。

[53:00] 扩展到更大模型仍有 gap

[事实] 主持人指出 NanoChat 和 NanoGPT 都是较小规模测试,与主流大模型有差距。

[事实] 田渊栋承认迁移到更大模型和架构上会有 gap,团队还在继续做。

[事实] 他提到下一步会继续优化系统,让它覆盖预训练、后训练等更广泛方向。

[54:00] RSI 缺什么

[事实] 田渊栋说,RSI 需要的数据类型和方法目前还没有定论,行业仍在探索。

[事实] 他认为算力也是问题,因为 RSI 本身需要算力来探索和研究。

[事实] RSI 首轮融资被提到为 6.5 亿美元,田渊栋认为第一阶段还可以做一些事情,但距离大厂级别仍有差距。

[56:00] 可解释性与新方法

[事实] 田渊栋认为,要实现更深层 RSI,需要 Scaling Law 之外的新创新。

[事实] 他明确提到可解释性很重要,因为它能发现 insight、加快进展,并让模型更安全。

[推测] 在他的路线里,可解释性既是安全工具,也是提升模型能力和研究效率的技术路径。

[57:00] RSI 的安全问题

[事实] 田渊栋说,领域之外的人更常问 AI 自我进化后是否会失控,领域内的人反而没那么多这类问题。

[事实] 他认为 AI 训练信号主要是让 AI 服务人、帮助人解决问题,因此不容易自然进化出类似人的自我意识和欲望。

[事实] 他认为创造力和意识不是一回事,能力与欲求可以分开。

[59:00] AI 是否可知

[事实] 田渊栋承认自己可能是少数派,因为很多人认为大模型太复杂,已经无法真正理解内部机制。

[事实] 他相信一定存在好的 principle 能让模型运转起来,也能让模型更强、更安全。

[事实] 他把 AI 变成科学类比为炼金术变成化学,以及从第谷、开普勒到牛顿的科学革命过程。

[65:00] 未来的发现系统与人的乐趣

[事实] 田渊栋认为,未来的“牛顿”可能是 AI,也可能是人类加 AI。

[事实] 如果系统变成强大的 discovery system,它可能每隔一两个月就产生很重要的新结果。

[事实] 他认为即使 AI 发现越来越多,人类仍可以从理解、欣赏和感受其中的美中获得乐趣。

[68:00] 从工程经历到 RSI 判断

[事实] 田渊栋回顾自己在 Google X 无人车项目中的经历,当时想做深度学习,但受资源和级别限制,更多做工程和规则相关工作。

[事实] 他认为无人车有大量 corner case,需要漫长修补,较早意识到落地周期会很长。

[事实] 后来在 FAIR 做围棋相关系统时,他仍然大量搭工程系统,包括搜索和分布式强化学习系统。

[74:00] 一手实现与研究品位

[事实] 田渊栋说,即使 2019 年后更偏研究,他每年仍会做一作文章,保持一手写代码和实现的感觉。

[事实] 他认为只做高层方向、不做实现的人,容易把难问题、较难问题和非常难的问题混在一起。

[事实] 他区分了两类优秀研究员:一类提出好问题和方向,另一类既知道做什么也知道怎么做。

[80:00] 大厂组织与小团队

[事实] 田渊栋认为,现在这一波 AI 在组织上“反大厂”,因为大厂的激励、职级和岗位设计常常拖慢进展。

[事实] 他强调大模型研究需要 hands-on,一旦形成经理与执行者的二级结构,反馈速度就会下降。

[事实] 他认为团队超过约 150 人后,人际关系和信息流会发生明显变化,核心模型团队应保持小而精。

[83:00] 美感、数学与现实

[事实] 田渊栋说自己喜欢数学和精巧结构,本质上追求美。

[事实] 他也强调要意识到美的局限,不能陷入美的幻觉,还要做对世界、公司和用户有用的事情。

[推测] 这解释了他为什么同时重视理论原则、可解释性和工程可落地性。

[86:00] 节目收束与主持人补充

[事实] 主持人总结,本期讨论了 RSI 从小众方向到硅谷热门话题的变化,以及它与十年前类似尝试的区别。

[事实] 主持人补充,Kimi K3、算子优化、GPT Speed Run 等案例都指向一个事实:在具体模型训练任务上,某种 RSI 已经发生。

[事实] 主持人最后提出开放问题:未来更可能是强者恒强的平滑曲线,还是存在平台期、需要新方法加入的阶段性跃迁。

播客点评/总结

[推测] 这期的价值在于,它没有把 RSI 简化成“AI 自动写研究论文”或“coding agent 更强”,而是把问题拆成了执行、反馈、研究品位、抽象能力、可解释性、组织结构和资源约束等多个层面。

[推测] 节目的亮点是田渊栋同时站在创业者、研究员和工程实践者的位置谈 RSI,因此讨论既有第一阶段成果这样的具体 benchmark,也有 Scaling Law、科学革命和组织形态这样的长期判断。

[推测] 局限在于,涉及 RSI 系统细节、数据方法、新架构方向和商业化路径时,嘉宾多次表示不方便展开,所以听众无法从节目中判断其系统内部机制和可复制性。

[推测] 这期适合关注前沿 AI、AI research automation、模型训练效率、可解释性和 AI 创业的人;如果只想了解通俗 AI 应用,部分技术讨论会偏密集。