从蒸馏到合成数据到 RSI,模型竞争的下一个焦点是什么?|对谈 Evolvent AI 联创孟繁青

2026-08-08 · Show: 42章经 · 3570s · Source

从蒸馏到合成数据到 RSI,模型竞争的下一个焦点是什么?|对谈 Evolvent AI 联创孟繁青

概览

本期围绕模型竞争从后训练、数据、Bench、蒸馏一路谈到 RSI。孟繁青认为,当前模型训练流程和算法本身正在工程化、服务化,后训练研究员真正拉开差距的地方越来越集中在高质量数据、环境构造、评测设计和迭代效率上。

讨论中一个核心判断是:国内模型与海外模型的差距在缩小,国内在预训练架构创新上反而有特色,例如 Kimi 和 DeepSeek 在注意力机制、计算效率上的探索;后训练方面则更多受制于数据积累时间和组织能力。蒸馏被视为追赶的加速手段,但不是国内模型变强的决定性因素。

后半段重点转向 RSI、Self-evolving、Auto Research 等概念。嘉宾把它们形式化为:给模型一个环境和目标,让模型持续操作、接收反馈、修改策略并突破原有上限。他认为不存在单独的“RSI 基础模型”,RSI 能力更多会被基础模型在预训练和长上下文能力中内化,而创业公司的机会可能在模型厂和应用层之间搭建通道。

分段落总结

[00:19] 嘉宾背景与公司方向

[事实] 孟繁青介绍自己是 NUS 博士生,也是 Evolvent AI 联合创始人,主要关注 RSI 研究方向。

[事实] 他此前在 Kimi 有较长实习经历,做过 Agent、infra 相关工作,并参与过 Kimi 相关模型发版。

[事实] Evolvent AI 目前的大方向是聚焦 RSI。

[01:38] 从大厂到创业公司的差异

[事实] 孟繁青认为,在大厂做模型后训练已经相对工程化,训练和推理流程内部较稳定,研究员更多关注核心数据。

[事实] 创业公司不会直接去和模型厂拼基础大模型,而是需要寻找与模型厂正交、且更接近实际应用的切入点。

[推测] 这意味着初创团队更适合围绕数据、平台、Bench、Agent 环境等环节建立能力,而不是重复投入高成本基础模型训练。

[02:37] 为什么 post-training 创业者更多

[事实] 嘉宾认为 pre-training 更常涉及数据、模型架构、优化器等资源密集型工作,创业公司较难覆盖成本。

[事实] post-training 与核心数据、平台类能力、Agent Bench 更相关,离落地商业模式更近。

[事实] 他把新型 Bench 解释为让 Agent 在环境中长时间探索并完成任务,而不只是回答一道题。

[04:37] Bench 从做题变成环境评测

[事实] 传统 Bench 更像数学题,模型只需要输出答案;新型 Bench 会模拟白领工作软件等环境,让 Agent 操作工具完成任务。

[事实] 新型 Bench 不只测“大脑”的推理能力,也测与 Notion、飞书等工具交互的“动手能力”。

[事实] 环境评测的验证更复杂,需要确认模拟环境与真实环境行为一致,还要设计多维度得分点。

[推测] Bench 本身正在变成一种产品化基础设施,能同时服务模型评测、数据生产和应用落地。

[07:13] 后训练越来越像做数据

[事实] 嘉宾认可“post-training 很多时候是在做数据”的说法,因为模型厂内部训练服务化后,研究员只需提交数据和请求即可完成 SFT 等流程。

[事实] 他认为训练模型的门槛对普通算法研究员降低了,但 infra 构建者仍会遇到很多工程问题。

[事实] 他不认为做数据一定枯燥,因为数据构造需要大量 know-how,不同人做出的数据效果不同。

[事实] 他提到他们做过 RSI Bench,观察到 Agent 目前能修正格式错误等机械问题,但还难以提出真正的数据构造 insight。

[10:36] 数据质量如何判断

[事实] 数据质量最直接的评判方式,是看训练后模型能否在不作弊、不 hacking benchmark 的情况下提升效果。

[事实] 训练前评估数据质量较难,只能做正确性、是否作弊、难度是否适中等初筛。

[事实] 最终仍然需要训练模型验证,结果好就是好,不好就继续修改。

[事实] 在后训练中,嘉宾认为当前数据好坏比 infra 好坏更重要,因为 infra 已相对稳定。

[12:54] 国内模型竞争阶段

[事实] 嘉宾认为国内模型与海外模型的差距正在缩小,国内在计算资源少很多的情况下仍接近海外已发布模型水平。

[事实] 他认为国内模型厂的一个特点是被有限资源倒逼出预训练架构创新,例如 Kimi 的线性注意力、DeepSeek 的 Multi Latent Attention。

[事实] 他认为国内后训练相比海外稍弱,主要不是基础能力弱,而是海外模型厂在数据积累上更早。

[推测] 国内模型追赶并不只是“抄作业”或蒸馏,而是预训练效率、架构、数据和组织共同作用的结果。

[17:09] 模型厂会交替领先

[事实] 嘉宾判断,模型厂竞争大概率会呈现某家发布大版本后短期领先,几个月后被另一家新版本超越的局面。

[事实] 他认为 Kimi 做大参数模型对效果贡献很大,因为在当前数据规模下 scale 参数仍能带来收益。

[事实] 对 GLM Coding 领先的原因,他表示不太了解公司内部,但根据交流判断,可能是 coding post-training 数据做得较好。

[事实] 对字节追赶,他认为追上当前 frontier model 是时间问题,但能否进一步缩小与最新 frontier model 的差距不好判断。

[20:01] 竞争不只是拼卡,也拼组织

[事实] 主持人提出人才、数据、投入都能补齐后,长期是否拼卡;嘉宾认为拼卡是直接因素,但组织架构也很重要。

[事实] 他以混元为例,认为组织架构调整后进步明显。

[事实] 他提到多模态是否单独划分就是组织设计问题,并认为现在很多团队会把多模态与 pre-training 合并。

[推测] 当技术路径趋同后,团队如何划分、协作和快速迭代,可能会成为模型厂差异化能力之一。

[21:04] 下一阶段共识是 RSI

[事实] 嘉宾认为当前模型竞争下一阶段的共识是做 Auto Search,或者称为 RSI。

[事实] 主持人提到 Self-evolving、自动化、AFAI、RSI 等词;嘉宾认为这些本质上都是一件事。

[事实] RSI 的形式化定义是:给模型一个工作环境和目标,让它持续操作,拿到反馈后修改之前的操作,并尝试突破上限。

[22:35] RSI 的几层形态

[事实] 主持人把 RSI 拆成产品输出前自我检查、Harness 层自我迭代、以及模型自己训练 AI 三层。

[事实] 嘉宾认为这些都可以算 RSI,只是大众语境中 RSI 更偏“模型自己迭代自己,得到更强模型”。

[事实] Auto Search 更常指已有强模型在某个任务中持续迭代,例如写出更好的 GPU kernel。

[事实] 他认为从零复刻出自己,甚至复刻出超过自己的模型,是一个清晰的 RSI 过程。

[24:25] Harness 不会消失,但会变简单

[事实] 嘉宾不认为未来会没有 Harness,因为模型厂通常会将模型与自己的 Harness 配套发版。

[事实] 他解释,后训练时模型输出经过 Harness,反向传播会让模型越来越适配该 Harness。

[事实] 他判断 Harness 会越来越简单,但不会完全消失。

[事实] 对通用领域如 coding,第三方 Harness 的必要性较弱;对垂直场景,较小模型加简单 workflow 仍有价值。

[26:23] 垂直应用的价值与小模型自进化

[事实] 嘉宾认为强模型可以用来写垂直领域 Harness,但垂直场景背后的实际运行模型未必需要很强。

[事实] 他指出,普通用户已经越来越难感知前沿模型强度差异,很多 Bench 与日常使用脱节。

[事实] 对垂直领域,可以用强模型指导较小开源模型在特定场景迭代,得到一个好的垂直模型后长期使用小模型。

[推测] 垂直应用的壁垒可能不在调用最强模型,而在场景数据、成本、隐私和可持续迭代流程。

[28:03] 模型降价、开源竞争与隐私需求

[事实] 主持人提到基础模型会持续降价,甚至接近免费;嘉宾认为降价不只因成本下降,也有商业竞争和开源社区压力。

[事实] 嘉宾表示,如果未来出现一两家垄断,价格未必一直下降。

[事实] 他还指出,很多垂直领域有数据隐私需求,不一定愿意使用 Claude、GPT 这类外部模型。

[推测] 价格下降会削弱通用模型调用的壁垒,但不会完全消除本地化、私有化和垂直优化的需求。

[29:10] 创业公司做 RSI 的边界

[事实] 主持人提出,如果模型能自我研发,为什么不是直接做更好的基础模型,或为什么不是模型厂自己做。

[事实] 嘉宾认为“RSI 基础模型”这件事本身就是模型厂在训练的基础模型,创业公司直接做没有意义。

[事实] 他表示 Evolvent AI 不打算训练 RSI 基础模型,也不打算只做 RSI Harness,而是想做模型厂和应用层之间建模 RSI 的通道。

[推测] 在嘉宾视角里,RSI 创业机会更像中间层基础设施,而不是另一个基础模型公司。

[30:49] RSI 像更聪明的 DFS

[事实] 嘉宾把许多 Self-evolving 或 Harness 方法类比为更聪明版本的 DFS。

[事实] 例如写 GPU kernel 时,模型生成 kernel、评分程序给反馈,模型根据反馈回溯到某个节点并继续探索。

[事实] 与普通 DFS 不同,RSI 中的回溯和剪枝由 LLM 判断,从而把更多精力放在更可能有效的路径上。

[事实] 他认为这种剪枝本质上需要 World Model 和 Value Model,而这些能力已经在大模型预训练中被内化。

[32:49] RSI 能力来自模型内化与长上下文

[事实] 嘉宾认为不存在独立的“RSI 基础模型”,因为模型厂在预训练时已经把相关能力内化进基础模型。

[事实] 他认为 RSI 变强的来源包括 World Model 知识内化得更好,以及上下文窗口变得更长。

[事实] 更长上下文意味着模型能记住更多内容,并回溯到更远位置。

[推测] RSI 的进步可能会随基础模型能力和上下文长度自然提升,而不是完全依赖外部流程创新。

[33:49] 数据也可能自进化

[事实] 主持人问如果算法能自我迭代,数据是否会成为瓶颈;嘉宾认为数据也可以转起来。

[事实] 他提到他们最近的 RSI Bench 聚焦数据层面的自进化,观察到 Agent 已有一定自我合成更好数据的能力。

[事实] 主持人推演模型公司未来可能只需要十几二十人;嘉宾认为从结果上可能是,但现实会受多方面因素影响。

[推测] 如果数据生成、训练和评测都被 RSI 化,AI Lab 的人员结构可能会向更小、更工程化、更研究密集的团队演化。

[34:51] 合成数据与 RSI 的关系

[事实] 嘉宾认为,最终意义上的 RSI 是模型训练出更好的自己,过程中可能包括数据、算法、架构的改进。

[事实] 数据是 RSI 过程中的一个重要产物。

[事实] 他同意可以把合成数据理解为当前第三代大趋势:第一代是普通人标注,第二代是专家标注,第三代是合成数据。

[推测] 合成数据既是当下商业需求,也是通向更自动化模型迭代的中间环节。

[35:48] 专家数据、合成数据与真人数据

[事实] 嘉宾认为早期 ChatGPT 时代的数据更偏 raw data,噪声较多,现在需求不大。

[事实] 专家数据仍有需求,但比 2025 年初 O1 刚出现时减少,因为模型变强后,对专家出题能力和去重要求更高。

[事实] Agent 数据分为合成数据和真人数据:合成数据是在构造环境中让模型探索并保存轨迹;真人数据是人类在真实工作环境中的交互轨迹。

[事实] 真人数据噪声较多,需要清洗;合成数据更接近可直接训练的形式。

[38:24] 不同数据的大致价格

[事实] 嘉宾提到,贵的合成数据能卖到好几千,单位通常是一个非常长程的任务。

[事实] 做题类专家数据可能是一两千的量级。

[事实] 真人仓库轨迹类数据有时需要走量,不太按单条定价。

[推测] 长程任务型合成数据价格高,核心原因可能在于环境、任务、轨迹生成和验证成本都更高。

[39:06] 模型厂为什么外采合成数据

[事实] 嘉宾认为模型厂自己会造合成数据,但也会外采,因为数据多多益善,外部数据可以减少内部人员带来的分布 bias。

[事实] 他判断普通 Agent 数据订单以后会越来越少,因为高质量 Benchmark 越来越少且更集中,模型厂会更聚焦少数最重要 Bench。

[事实] 下一波短期需求可能是 RSI 数据,例如一个模型后训练另一个小模型并提升效果的完整轨迹。

[事实] 这种 RSI 轨迹生成可能需要跑十几个小时甚至一天,且需要模型训练背景。

[41:15] 个人 AI 使用数据难以直接售卖

[事实] 主持人问普通用户自己用 AI 产生的数据能否售卖;嘉宾回答卖不出去。

[事实] 他给出的原因包括数据太脏以及合规问题。

[推测] 个人使用轨迹若缺少清洗、授权、场景结构和可验证目标,很难成为模型厂可采购的数据资产。

[41:39] 数据行业进入筛选期

[事实] 嘉宾认为普通 Agent 数据这一波已接近尾声,数据行业变化非常快。

[事实] 过去依赖众包人力或专家标注的数据公司可能更难活下来。

[事实] 他认为数据公司需要有一线 hands-on researcher,才能追上数据需求变化。

[事实] Evolvent AI 也在往 RSI 数据方向走,并发布了 RSI Bench。

[43:02] 算法、数据和 infra 的互相转化

[事实] 嘉宾认为“算法就是数据,数据就是 infra,infra 就是算法”这句话有一定道理。

[事实] 他解释,算法会收敛到更简单形式,例如 RL 收敛到 PPO 后,差异就更多转向数据。

[事实] 数据会驱动 infra 变化,例如 RL 训练中长尾推理样本会造成资源等待,需要 infra 改进训练效率。

[事实] 当数据轨迹变得更长、推理需要一天甚至几天时,算法和 infra 都会随需求调整。

[45:11] 高质量数据仍会增长

[事实] 嘉宾认为合成数据不会变成无限数据,但数据量确实在提高,也不会毫无节制地提高。

[事实] 他判断高质量数据会一直有,并且持续增加。

[事实] 新来源包括 Agent 合成数据,以及 Agent 使用规模扩大后反哺更好的合成数据。

[事实] 模型尺寸增加也会推动数据数量和质量继续提升。

[46:12] 合成数据与蒸馏

[事实] 嘉宾解释,合成数据中需要 Agent 在环境中探索,探索 Agent 可以是外部模型如 Claude,也可以是内部模型。

[事实] 如果用外部模型生成轨迹,就会涉及大家所说的蒸馏。

[事实] 他区分了“硬蒸”和“有技巧蒸”:简单环境中抄老师答案更像硬蒸;复杂环境、高质量题目和评分体系本身就有难度,更像有技巧地生成蒸馏数据。

[事实] 他认为合成数据对落后模型价值更高,因为学习 margin 更大,但对领先模型也有用。

[48:20] 领先模型也能从自生成轨迹中提升

[事实] 主持人问领先模型用自己在环境中探索得到的数据训练自己,为什么还能提升。

[事实] 嘉宾认为,只要环境、题目和评分足够复杂,模型自己探索出正确轨迹后再训练自己,也可以提点。

[事实] 他把这件事归为 RL 做的事,即不断强化的过程。

[推测] 这里的提升并不依赖外部更强老师,而依赖可验证环境中的探索、筛选和强化信号。

[48:49] AI Lab 当前仍有增长空间

[事实] 嘉宾认为 coding 从年初到现在一直是最重要的发力方向,因为 coding 是模型智力的基础之一。

[事实] 他认为 coding 的 pipeline 已相对稳定,因此 AI Lab 也在探索 Auto Research 等新技术路线。

[事实] 他提到 Claude、OpenAI 都在做 Auto Research,可能服务于 AI for Science。

[事实] 他认为 AI for Science 一方面是体现模型智力的手段,另一方面也是较直接的应用方向。

[51:13] 模型增速存在,但 researcher 溢价未必维持

[事实] 嘉宾认为模型厂的模型增速一直存在。

[事实] 但他也指出,背后是否还需要那么多 researcher,以及 researcher 的高薪能否维持,不一定。

[事实] 主持人总结许多路径已相对确定,嘉宾认可 coding 等方向在一定程度上是在既有路线继续推进。

[推测] 当技术流程稳定后,岗位价值可能从提出路线转向高质量执行、系统建设和组织效率。

[51:41] 初创 AI Lab 与大厂的长期比较

[事实] 嘉宾更偏好初创公司这一类,认为技术会在公司之间流通,技术水平差异不会特别大。

[事实] 他认为最终可能回到组织形态:当大家都懂技术时,公司如何作为整体跑得更快很重要。

[事实] 主持人提到大厂卡和资源多;嘉宾认为最终未必只是拼卡。

[推测] 初创公司的优势可能来自更快决策、更聚焦目标和更紧凑的组织协作。

[52:51] 多模态与主线智力的关系

[事实] 对“多模态不在智力主线”的观点,嘉宾认为这种说法有点绝对。

[事实] 他认为多模态重要,也应该放到主线上,只是目前受资源限制,不能做全模态优化。

[事实] 他指出,多模态发展比文本慢,因为文本信息高度压缩,而多模态噪声更多。

[事实] 他认为 AI 要进入物理世界,就不只是视觉,还会涉及听觉、触觉等多种输入。

[53:59] 蒸馏不是国内模型变强的决定性因素

[事实] 嘉宾认为蒸馏不是国内模型变强的决定性因素。

[事实] 他认为国内模型变强一方面来自底层架构创新,而智力基础主要来自预训练。

[事实] 他把蒸馏视为国内公司的加速手段,而不是没有就做不出来的必要条件。

[事实] 他认为即使所有蒸馏门路被封掉,国内模型追赶仍会继续,只是更费劲。

[55:49] 不蒸馏的理由

[事实] 主持人问为什么有些公司不愿蒸馏,并对外强调不蒸馏。

[事实] 嘉宾认为蒸馏相当于抄近道,可能导致团队忽视主路上的 insight。

[事实] 主持人总结蒸馏是工具,关键在于如何用好;嘉宾认可这一点。

[推测] 对模型厂而言,是否蒸馏不只是技术效率选择,也涉及长期能力积累和外部叙事。

[56:16] Evolvent AI 的当前工作

[事实] 嘉宾介绍 Evolvent AI 是一家初创公司,运行约半年,团队主要由 00 后 researcher 构成。

[事实] 公司当前主要做两块:一是合成数据合作和商单,过程中也会做 Bench;二是长期做 RSI。

[事实] 他们不聚焦 RSI 专用基础模型,也不只是做 RSI 方法,而是想桥接模型厂与应用公司。

[事实] 他们最近发布了 RSIbench-data,用于在平台内对 data 进行 RSI 的初步探索。

[58:02] 招聘画像

[事实] 嘉宾表示公司一直开放招聘,有兴趣可以联系他。

[事实] 对 researcher,他不太看论文数量、引用量等量化指标。

[事实] 他更看重工程能力,并认为工程能力好的人比单纯学术能力强的人更适合他们。

[推测] Evolvent AI 需要的是能亲自搭环境、做数据、跑训练和快速验证假设的研究型工程人才。

播客点评/总结

本期的价值在于把几个容易混在一起的概念拆清楚了:后训练、Bench、合成数据、蒸馏、Harness、RSI 并不是孤立话题,而是围绕“如何让模型在环境中持续迭代并产生可训练信号”展开的一条链路。

亮点是嘉宾给出了不少一线视角,例如 post-training 的核心逐渐变成数据,Bench 正从静态题目变成环境任务,蒸馏只是加速手段而非决定性因素,以及 RSI 更可能由基础模型能力和长上下文自然增强。

[推测] 局限在于部分判断来自嘉宾个人经验和与朋友交流,例如国内外模型强弱、各家模型厂组织结构、某些公司 coding 领先原因等,并非都有公开证据支撑。因此更适合作为行业一线观察,而不是确定性结论。

[推测] 本期适合关注 AI Lab 竞争、模型后训练、合成数据业务、Agent Bench、RSI 和 AI 创业机会的人;如果只想了解应用层产品或普通用户使用技巧,信息密度可能偏技术和产业侧。