179: 蒸馏风暴:一场无人公开谈论的技术竞赛

2026-08-16 · Show: 晚点聊 LateTalk · 2974s · Source

蒸馏风暴:一场无人公开谈论的技术竞赛

概览

本期《晚点聊》围绕大模型行业里的“蒸馏”展开:它到底是不是“抄答案”、为什么近两年突然变得更重要,以及为什么许多从业者关注却很少公开谈论。

节目把蒸馏拆成技术、组织、合规和商业四个层面。核心结论是:蒸馏不是简单复制答案,而是一套需要数据、算力、训练方法和运营能力的系统工程;它能以较低成本、较高确定性提升模型能力,但也可能带来合规风险、组织惰性和长期创新能力受损。

讨论还延伸到字节跳动不做或少做蒸馏的选择、美国闭源模型公司对中国公司的指控、如何判断一个模型是否蒸馏、以及蒸馏是否会改变前沿模型公司的商业逻辑。

分段落总结

[00:58] 节目背景与蒸馏定义

[事实] 主持人说明本期没有外部嘉宾,信息主要来自编辑部近期与多家公司从业者、研究员交流得到的观察。 [事实] 蒸馏被描述为:先准备一批问题,向更强的教师模型提问,得到回答或推理过程,再用这些数据训练学生模型,使学生模型的输出行为接近教师模型。 [事实] 主持人强调,蒸馏不是简单“抄答案”,因为它仍然需要训练、算力、数据和方法技巧。 [推测] 用“抄作业”类比容易降低技术精度,但能帮助非技术听众理解蒸馏的直观含义。

[04:35] Agent 轨迹蒸馏与环境概念

[事实] 节目提到,随着推理模型和 Agent 发展,蒸馏对象不再只是题目、推理过程和答案,还可以扩展到智能体完成任务的完整轨迹。 [事实] “环境”被解释为让 Agent 真正跑起任务的一整套条件和系统,例如代码库、终端、编辑器、编译器、测试工具和单元测试。 [事实] 更强模型可以用来造题、造环境、生成任务轨迹,也可以用来评估学生模型在环境中的表现。 [事实] 如果只是用更强模型评估学生模型并辅助强化学习,不一定属于典型蒸馏。

[06:35] 用户协议与灰色地带

[事实] 节目指出,不只是典型蒸馏,凡是利用闭源模型输出优化竞争模型,都可能违反 Anthropic、OpenAI、Google DeepMind 等公司的用户协议。 [事实] 这些协议通常宽泛限制用户利用其服务提升或优化竞争模型。 [事实] 对于用户协议是否具有明确法律效力,节目认为需要专业律师判断,目前更像灰色地带。 [推测] 蒸馏争议的核心不只在技术行为本身,也在商业竞争、平台规则和法律边界尚未稳定。

[08:16] O1 与 R1 推动蒸馏热度上升

[事实] 节目把 2024 年 9 月 OpenAI 发布 O1 视为关键节点,因为它揭示了后训练中大规模强化学习可让模型学到推理策略。 [事实] O1 还展示了测试时间投入更多算力、生成更长思维链可以提升模型表现,这让可蒸馏的数据原料更丰富。 [事实] 第二个关键节点是 2025 年 1 月 DeepSeek R1 发布,并同时发布了 6 个小型蒸馏模型。 [事实] 这些小模型以 R1 为教师,底座来自 Qwen 2.5 和 Meta Llama 3,用来验证大模型能力是否能压缩进小模型。

[10:22] 从压缩到变强

[事实] 节目回顾说,蒸馏最早的主流目的偏向模型压缩,即把大模型能力压到更小、更快、更便宜的模型里。 [事实] 自动驾驶、手机、汽车、机器人等端侧场景需要更小模型,因为这些场景对延迟、算力和成本更敏感。 [事实] Qwen 等开源模型经常发布多个尺寸版本,也体现了小模型和压缩需求。 [事实] 近来的讨论则更多聚焦“为了变强的蒸馏”,即用强模型输出提高自家模型能力。

[12:22] 中国开源模型逼近闭源模型后的争议

[事实] 节目认为,2025 年以来蒸馏规模明显变大,2026 年初 Anthropic、OpenAI、Google DeepMind 等公司在公开文章和信件中更多提到中国公司蒸馏。 [事实] 另一个背景是中国开源模型表现明显逼近美国闭源模型,K3 被节目称为一个里程碑。 [事实] 美国公司对中国模型进步的反应,使蒸馏话题被推到风口浪尖。 [推测] 蒸馏成为焦点,既因为技术实践增多,也因为中美 AI 竞争下模型能力差距缩小引发了更强政治和商业敏感性。

[13:46] 字节跳动与张一鸣的反蒸馏表态

[事实] 节目提到,张一鸣在 SEED 内部会上表示不允许字节做蒸馏。 [事实] 报道中的理由包括:蒸馏短期能改善模型表现,但本质是在复制 Claude 已有能力,最多逼近对方,很难实现真正超越。 [事实] 张一鸣希望 SEED 从更底层维度构建 AGI 壁垒,而不是依赖蒸馏这种捷径。 [推测] 字节作为全球化公司,可能也会更重视合规和海外公司如何看待它。

[17:16] 蒸馏能否超越教师模型

[事实] 节目提到,多数受访从业者认为学生模型通过蒸馏超过教师模型并非技术上绝无可能,但这是一个研究问题。 [事实] 可探索的方法包括学习多个教师模型、多教师蒸馏,以及在特定任务上超过教师模型。 [事实] 但蒸馏也会让学生模型学到教师模型的错误、局限和行为风格。 [推测] 张一鸣“很难超越”的判断,可能不只是技术判断,也包含对组织资源分配和人性惰性的判断。

[18:33] 组织代价与人才选择

[事实] 节目认为,蒸馏成本较低、确定性较高,容易吸走组织对长期探索和不确定项目的资源与认可。 [事实] 顶尖研究员需要创新研究能被鼓励、被看到的环境。 [事实] 节目提到,张一鸣表态后,SEED 内部有少数人产生离开想法,因为个人职业生涯有限,希望参与做出最强模型。 [推测] 同一个反蒸馏决策,可能同时劝退追求短期成果的人,也吸引认可长期主义的人。

[22:35] 不蒸馏之后要补的数据能力

[事实] 节目认为,如果不依赖外部领先闭源模型输出,字节需要自己构造高质量数据。 [事实] 节目提到有报道称字节从 6 月开始重组数据团队,并成立与 SEED、Flow 平行的 AI 数据与安全部门。 [事实] 该团队负责人王英磊此前在 TikTok 负责直播,并与相关管理者共事过。 [推测] 字节把数据能力抽成更高层级组织,可能是为了建立不依赖外部模型的数据生产和安全能力。

[24:07] 第三方数据与技术上的蒸馏定义

[事实] 节目讨论了通过第三方数据公司或中转方式获得数据的情况。 [事实] 节目认为,如果训练目标是让自家模型逼近更强模型的输出和行为,技术上仍可视为蒸馏。 [事实] 至于这种做法在法律上或用户协议上能否绕开限制,节目认为存在很多操作空间。 [推测] “是否蒸馏”在技术定义、合规定义和公司对外表述之间可能并不完全一致。

[24:54] 行业点名与公开证据

[事实] 节目提到,Anthropic 在 2 月点名 DeepSeek、Kimi、MiniMax,6 月又点名阿里 Qwen。 [事实] OpenAI 曾称 DeepSeek 有疑似蒸馏行为。 [事实] 节目强调,这些美国公司并没有展示完整证据,也不能据此断言哪些公司一定蒸馏。 [事实] 智谱没有被节目提到的美国公司公开点名。

[27:06] 如何判断一个模型是否蒸馏

[事实] 节目认为,模型身份混淆不能作为蒸馏证据,例如非 GPT 模型说自己是 GPT,并不能证明它蒸馏了 GPT。 [事实] 节目引用一项 2024 年 11 月的研究:研究者测试 27 个模型和 77 个问题,发现身份混淆很常见。 [事实] 更合适的判断方式是大规模比较模型输出分布、拒答方式、代码风格等行为是否接近。 [推测] 对普通用户来说,模型是否蒸馏未必影响使用;但对投资人、求职者或公司评估长期能力时可能更重要。

[29:09] 蒸馏的真正难点

[事实] 蒸馏难点包括稳定高频访问强模型的账号、用户运营、高质量真实提问、数据筛选、扩增、改写、纠错和数据配比。 [事实] 节目提到行业中有人通过中转站让高质量用户使用领先模型,从而获得真实问题和回答数据。 [事实] 使用中转站也可能被坑,例如某模型发现自己蒸馏到的其实是自己的输出。 [事实] 节目总结,蒸馏是一套复杂的数据管线和系统工程,不是简单把答案复制一遍。

[31:44] 隐藏蒸馏与反制措施

[事实] 节目认为,多模型混合、筛选和重写可能削弱某个教师模型的痕迹,但不能完全隐藏调用闭源 API 的过程。 [事实] Anthropic 声称建立了识别蒸馏流量的分类器和行为指纹系统,可发现跨账号协同、重复提问和套取思维链行为。 [事实] Anthropic 还会加强教育、研究、创业公司账号的身份认证。 [事实] 蒸馏会带来合规风险,也受成本和平台反制限制,不可能无限扩张。

[35:03] 蒸馏的好处与上限

[事实] 节目认为,蒸馏的直接好处是低成本、较高确定性地接近更强模型。 [事实] 多教师蒸馏可能用于合并不同方向专家模型的能力,也可能成为提升学生模型的技术路线。 [事实] 在特定任务上,学生模型有可能超过教师模型,但这不等于整体泛化能力和通用能力都超过教师模型。 [推测] 靠蒸馏短期成为第一或许有可能,但要持续领先,仍需要自身创新能力。

[37:58] 后发优势与 AGI 竞速风险

[事实] 节目讨论说,蒸馏让后发者可以利用更新、更强模型的数据缩短与领先者差距。 [事实] 但如果 OpenAI、Anthropic 等公司实现更强自进化,让 AI 优化 AI 的速度变快,领先者可能把后发者甩得更远。 [事实] 节目认为,非常依赖蒸馏可能只是阶段性状态,模型公司仍会组合多种方法。 [推测] 如果 AGI 进展出现加速度,短期跟随能力可能不足以弥补真正的前沿突破差距。

[39:10] 蒸馏是否有“原罪”

[事实] 节目认为,“原罪”这个说法过重,蒸馏更像灰色地带。 [事实] 蒸馏肯定可能违反闭源模型公司的用户协议,但违反用户协议不必然等于法律侵权。 [事实] 节目提出红线:黑客攻击、侵入系统、通过黑客方式破解思维链等明显违法或违反通行规则的做法不可接受。 [事实] 对模型公司而言,蒸馏只是优化模型的众多方法之一,而不是唯一问题。

[41:12] 蒸馏与训练数据争议的双标问题

[事实] 节目讨论到,OpenAI、Anthropic 等公司训练模型时也曾使用大量书籍、网页、视频或爬虫数据。 [事实] Anthropic 近期有一起 15 亿美元集体诉讼和解,案情涉及从盗版图书网站下载大量书籍。 [事实] 节目认为,美国公司批评中国公司蒸馏时确实存在双标,但两种行为并不完全一样。 [事实] 节目提到,加州法院曾认为购买书籍后用于模型训练不构成侵权,但盗版下载本身显然是不同问题。

[43:17] 蒸馏未来与商业模式冲击

[事实] 节目认为,三年后的 AI 行业太难预测,但蒸馏与反蒸馏之间的博弈会持续。 [事实] 蒸馏不太可能肆无忌惮蔓延,因为它受账号、法律、平台反制和成本约束。 [事实] 如果蒸馏越来越容易,可能影响投入巨资训练 frontier model 的商业模式和市场预期。 [事实] 节目提到,Anthropic、OpenAI 的估值和 IPO 预期可能受到短期市场讨论影响,但闭源模型公司也可能很快发布更强模型改变预期。

[45:19] 智能供给、需求与“够用”问题

[事实] 节目讨论 V4、Grok 4.6 等高性价比模型对商业逻辑的冲击,尤其是定价策略。 [事实] 一位生产力应用创始人告诉节目,用户 10 个任务里可能 8 个都能被 DeepSeek V4 Flash 解决,而且它便宜、速度快。 [事实] 节目认为,更大的问题是智能供给与需求之间是否匹配:很多白领工作可能已经被当前模型满足。 [推测] 如果多数真实任务对更强模型需求增长不够快,前沿模型继续堆高能力的商业回报会受到挑战。

[47:51] 结尾与信息边界

[事实] 节目总结,蒸馏不是非黑即白的问题,涉及技术历史、公司选择、代价和行业竞争。 [事实] 主持人特别说明,编辑部并不是直接做蒸馏的一线从业者,文章和播客更像抛砖引玉。 [事实] 节目邀请听众分享更多关于蒸馏方法、观察和态度,未来可能做更完整的 2.0 版本。 [推测] 这一结尾降低了结论的绝对性,也说明本期更偏行业观察和问题梳理,而非最终定论。

播客点评/总结

本期的价值在于把“蒸馏”从一个容易被道德化或标签化的词,拆成了具体流程、数据管线、组织选择、合规风险和商业后果。它既解释了为什么蒸馏不是简单抄作业,也没有把蒸馏包装成纯粹中性的技术动作。

亮点是讨论非常贴近行业语境:字节与张一鸣的选择、Anthropic 和 OpenAI 的指控、中国开源模型逼近闭源模型、第三方数据和中转站等内容,让听众能看到蒸馏背后的真实竞争结构。

局限也很明确:节目自己承认信息来自采访和行业交流,而不是一线蒸馏实践者的完整复盘;许多判断仍停留在“可能”“很难证明”“需要法律专业判断”的层面。

[推测] 这期适合关心大模型竞争、AI 公司战略、模型训练数据合规和技术商业化的人收听;如果听众期待严格技术教程或法律结论,本期更像高质量行业导览,而不是操作手册或法律意见。