E246|何谓蒸馏?聊聊硅谷如何看中国开放模型逼近前沿
E246|何谓蒸馏?聊聊硅谷如何看中国开放模型逼近前沿
概览
本期围绕 Kimi K3 开放完整模型权重引发的硅谷讨论展开。主持人与王铁镇、Keith Zhai 讨论了中国开放权重模型为什么在短时间内逼近前沿闭源模型,以及这件事对 API 售卖智能的商业模式造成了什么冲击。
节目把“蒸馏”作为核心争议拆开:技术意义上的蒸馏、使用闭源模型输出训练、互联网数据污染导致模型身份混乱,是不同层次的问题。两位嘉宾都认为,目前不能简单把 Kimi K3 或中国开放模型的能力归因于蒸馏,模型架构、数据工程、强化学习、推理优化和算力受限下的效率创新同样关键。
随后节目讨论了 Kimi K3 的商业授权模式、开放模型如何影响云厂商和推理服务商、OpenRouter 等中间层为什么受益,以及闭源实验室在估值、利润率、价格战和生态控制上的压力。
最后,节目回到安全问题。嘉宾认为,强模型开放权重确实会带来新的治理挑战,但闭源模型同样存在滥用、不可审计、服务随时变更和由商业公司单方定义安全边界的问题;更合理的方向是透明监管、社区验证和对训练数据及部署场景的具体评估。
分段落总结
[00:00] Kimi K3 引发开放权重模型讨论
[事实] 开场指出,前沿 AI 实验室常见商业模式是把智能封装成 API,并按 token 向用户收费。 [事实] 主持人提到,月之暗面在 7 月 27 日发布 Kimi K3 完整模型权重,而 K3 自 7 月 16 日 API 上线以来已经在硅谷保持高热度。 [事实] 节目提出三个核心问题:中国开放模型为什么快速逼近前沿、蒸馏到底能解释多少能力、开放模型压低 token 价格后会如何冲击闭源实验室和 agent 生态。 [推测] 本期把 Kimi K3 当作观察开放权重模型商业、技术和安全争议的集中案例。
[01:44] 硅谷为何对 Kimi K3 感到意外
[事实] Keith 认为,硅谷对中国模型的关注经历了 DeepSeek、GLM 等阶段,Kimi K3 则在成本、模型主权和开源能力提升的背景下进一步放大了讨论。 [事实] 王铁镇认为,过去一年闭源模型相对开源模型保持领先,但最近几个月开源模型重新逼近,Kimi K3 在某些场景接近或超过前沿闭源模型。 [事实] 硅谷讨论集中在两个问题:强能力模型开放是否安全,以及中国模型是否在短时间内通过蒸馏获得能力。 [推测] Kimi K3 的冲击不只是性能榜单变化,而是让闭源模型的“代际领先”护城河变得不再稳固。
[06:35] 企业从“多用 AI”转向成本和所有权优化
[事实] Keith 表示,不同行业对中国开放模型的接受度不同,政府、敏感行业或部分国家会受到更多限制。 [事实] 他认为,早期企业更关心如何用上最好的模型,成本问题通常在大规模使用后才变得突出。 [事实] Coding 场景带来了 token 消耗的快速增长,一些公司在短时间内从积极使用 AI 转向关注账单和成本优化。 [事实] Keith 还强调,除成本外,模型所有权也很重要:如果能力完全依赖第三方闭源服务,政策或供应变化可能导致服务突然不可用。 [推测] 开放权重模型的价值在企业侧不仅是便宜,也包括可部署、可控和降低供应商依赖。
[10:16] 开放模型为何可能更便宜
[事实] 王铁镇把闭源模型成本拆成硬件推理成本和闭源模型溢价,而开源模型推理服务商主要承担硬件和服务成本。 [事实] 他指出,中国开源模型长期关注 scaling efficiency,即在扩展模型能力时尽量降低训练和推理成本。 [事实] 他提到 Kimi K3 通过模型架构演进,在模型更大的同时提升效率,并举出 KDA、RWKV-A、linear attention 等优化方向。 [事实] 嘉宾认为,中国模型出生在算力受限环境中,因此天然更重视训练和推理效率。 [推测] 算力限制并不只是一种短板,也可能倒逼模型公司在架构和工程效率上更激进创新。
[13:24] 蒸馏的技术含义与争议用法
[事实] 王铁镇解释,技术意义上的蒸馏是让小模型学习大模型能力,传统做法包括学习大模型输出 token 的概率分布。 [事实] 闭源模型通常不暴露 logits,因此外部无法按经典蒸馏方式完整学习其概率分布。 [事实] 现在讨论中的“蒸馏”更多指使用闭源模型生成文本,再让开源模型学习这些文本输出。 [事实] 他指出,开源模型如 DeepSeek R1 对蒸馏更开放,甚至支持他人使用其输出、数据集或 logits 做蒸馏。 [推测] “蒸馏”在公共讨论中被扩大为接近“抄袭”的指控,但这和机器学习里的中性技术概念并不等同。
[16:31] 模型身份混乱不等于蒸馏证据
[事实] 王铁镇提到,有人把开源模型回答“我是 Claude”或“我是 ChatGPT”视为蒸馏证据,但他认为这更像数据污染。 [事实] 他举例说,闭源模型在去掉 system prompt 后,也可能在中文提问中把自己误认为其他模型。 [事实] 他认为,各种模型输出已经大量存在于互联网上,预训练时会导致模型学到混杂身份。 [事实] 他判断 Kimi K3 很难在十多天内收集足够语料并完成对前沿闭源模型的有效蒸馏。 [推测] 模型“自我介绍错误”最多能说明训练数据环境混杂,不能直接证明系统性蒸馏。
[18:33] 闭源实验室的蒸馏指控与商业动机
[事实] 王铁镇认为,蒸馏指控未必来自基础研究圈,可能服务于商业竞争或舆论预设。 [事实] 他提到闭源厂商曾关闭大量被怀疑蒸馏数据的账号,这也说明厂商能够观察用户调用行为。 [事实] Keith 强调,蒸馏是标准技术,OpenAI、Google、xAI 等公司也会用大模型蒸馏小模型。 [事实] Keith 认为,把强模型能力完全归因于蒸馏是误解,因为强化学习、数据工程、架构创新和基础设施同样重要。 [事实] 他把争议拆成是否存在未授权大规模调用、是否能证明 K3 靠蒸馏某个模型获得核心能力,以及蒸馏是否抹消开源模型自身贡献三个层面。 [推测] 嘉宾整体倾向认为:可能存在一些未授权数据抓取行为,但这不等于 Kimi K3 的核心能力来自蒸馏。
[24:04] Kimi K3 授权协议与开源商业化
[事实] 主持人介绍,Kimi K3 License 对 model-as-service 公司设置了商业授权条件,包括收入门槛和额外协议要求。 [事实] 王铁镇认为,能赚钱的开源模型才是可持续的开源模型,并以 Stable Diffusion 和 Qwen 的商业化挑战作对比。 [事实] 他指出,Kimi 的授权模式让云厂商和推理服务商不能完全 free ride,也能通过官方认证建立更清晰的合作关系。 [事实] 他认为,推理服务商和云厂商反而可能欢迎与 Kimi 建立付费和认证关系,因为这能证明 token 服务的准确性、性能和官方合作身份。 [推测] Kimi K3 的 license 尝试是在开放生态和模型公司收入之间寻找平衡。
[28:07] 授权落地的难点与可行性
[事实] Keith 认为,Kimi 的授权设计面对云厂商和终端应用方,但跨境执行、收入识别和自觉申报都存在灰色地带。 [事实] 王铁镇认为,中国企业对 license 付费的意识近年有所提升,开源办公室、基金会和人员流动也让大型使用更难隐藏。 [事实] 他指出,Kimi K3 模型规模很大,真正能大规模、高性价比服务该模型的机构并不多,因此大型商业使用不容易完全隐藏。 [事实] 他判断,如果 license 路径能走通,会比 Kimi 自己大量购买算力做推理更有利。 [推测] 对开放模型公司而言,授权收入可能成为比单纯 API 推理更轻、更可扩展的商业模式。
[34:19] 开放模型对闭源实验室估值和收入的压力
[事实] 王铁镇认为,开放模型首先会冲击闭源实验室的估值体系,因为“垄断智能”的稀缺性会被削弱。 [事实] 他表示,当聪明模型变成更可流通、更基础的服务后,市场会重新追问 OpenAI、Anthropic 等公司的商业化能力和利润率。 [事实] 他认为,Neo Cloud 可以依靠开放模型与闭源 API 厂商竞争,并把 token 价格压低。 [事实] 他提到,闭源厂商已经开始采取更商业化的获客和价格手段,例如发放额度或降低封号强度。 [推测] 开放模型越多,闭源 API 厂商越难只靠“最强模型”维持高溢价。
[37:26] 开放权重公开信与各方利益分化
[事实] 主持人提到,美国多家科技公司和机构签署了支持开放权重和美国 AI 领导力的公开信,NVIDIA 的黄仁勋也参与推动相关讨论。 [事实] Anthropic 没有签署该公开信,并由 Dario Amodei 发表文章解释其对开放权重的立场。 [事实] Keith 认为,芯片和基础设施公司希望更多人搭建模型,从而销售更多算力;而闭源模型厂商则更希望保住 API 护城河。 [事实] 王铁镇认为,NVIDIA 长期受益于 CUDA 周边的开源生态,支持开放权重符合其生态利益。 [推测] 开放权重争论表面是安全和技术路线,底层也包含芯片、云、模型 API 和应用层之间的利益重组。
[43:07] 从中国模型开源到 Thinking Machines
[事实] 主持人指出,中国模型公司并非从一开始都选择开源,Kimi 早期模型也是闭源路线。 [事实] 王铁镇用 Linux 类比,认为只要开放生态能形成可持续赚钱模式,公司没有必然理由拒绝开源。 [事实] Keith 补充说,开放模型已经从商业竞争扩展到地缘政治博弈,实验室自身的商业计划可能不再是唯一决定因素。 [事实] 主持人提到 Thinking Machines 发布开放权重模型 Inklin,并参考了 DeepSeek 架构。 [事实] 王铁镇认为,Thinking Machines 开放模型可能与其 Tinker 后训练服务有关,开放基础模型有助于用户使用其训练服务。 [推测] 美国公司重新参与开放模型,部分反映了美国学界和产业界对开源主导权转移的反思。
[47:00] 企业部署开放模型的现实考量
[事实] Keith 认为,企业是否使用中国开放模型取决于垂直行业和应用场景,政府端和某些国家会更谨慎。 [事实] 他表示,开源模型理论上不拿用户数据,但在当前大背景下仍可能被纳入安全和政治考量。 [事实] 他认为,大多数美国公司未必特别在意模型是否来自中国,但是否具备调教和部署自己模型的能力是另一回事。 [事实] 他指出,很多企业希望使用 AI,但不知道如何部署、如何选型,因此产生了微调、部署和咨询服务机会。 [推测] 开放模型能力增强后,会扩大企业本地化部署、微调和模型适配服务的市场。
[50:24] OpenRouter 与多层生态分工
[事实] Keith 认为,OpenRouter 等公司受益于开放模型生态,因为过去“只用最强闭源模型”的叙事限制了中间层价值。 [事实] 他提到,过去几个月 OpenRouter 等公司的估值和收入快速增长,与中国开放模型带来的模型多样性有关。 [事实] 王铁镇认为,模型、推理、企业服务各层分别由擅长者竞争,有助于行业更高效地迭代。 [事实] 他把这种分层生态与一体化厂商模式对比,认为充分竞争的市场结构当下带来更多机会。 [推测] 开放模型让 AI 产业从少数闭源 API 入口,转向更多模型、路由、推理和服务层并存的结构。
[51:54] Agent 生态的机会从应用转向基础设施
[事实] Keith 认为,agent 是宽泛概念,如果指应用层工作流,很多 agent application 公司未来可能被模型或平台吃掉。 [事实] 他认为,单纯靠 API 售卖最强模型、随意定价且不重视客户服务的模式正在被拆解。 [事实] 他指出,模型厂商会把更好的 harness、vertical 调整和 agent 能力变成新的护城河。 [事实] 王铁镇认为,agent workload 与传统 chatbot 或 RAG 不同,常见特征是长输入、短输出和高 prefix/KV cache 复用率。 [事实] 他认为,围绕 KV cache 生命周期、推理调度、硬件和软件协同优化,未来仍有大量降本空间。 [推测] Agent 时代的核心机会不一定在薄应用层,而可能在推理基础设施、工作流控制和成本优化层。
[55:36] 强开放模型是否安全
[事实] 主持人提出,Kimi K3 这类接近前沿能力的开放权重模型是否应该开放,是硅谷评论者和从业者的重要批评点。 [事实] Keith 提到,Kimi K3 在网络攻防相关测试中的得分低于前沿闭源模型。 [事实] 他区分了两个问题:开放模型整体是否安全,以及 Kimi K3 是否存在已知具体安全问题。 [事实] 他认为,目前没有看到 Kimi K3 存在可证据化的已知安全问题。 [推测] 开放权重确实会降低更多人调试强模型的门槛,但不能因此自动推出某个具体模型已经危险。
[58:24] 闭源模型也会制造安全困境
[事实] 王铁镇提到 Hugging Face 被 OpenAI 测试智能体意外攻击的例子,用来说明闭源 agent 也可能造成现实安全问题。 [事实] 他认为,闭源模型在协助安全分析时可能因安全过滤拒绝提供帮助,反而让防守方处于不利位置。 [事实] 他质疑为什么网络安全等重要判断要交给少数前沿模型公司,让它们同时充当参与者和裁判。 [事实] 他认为,打着安全旗号要求所有人只相信闭源公司本身也可能是不安全的。 [推测] 安全问题不只是模型是否开放,还包括谁有权定义安全、谁能审计模型、谁能在事故后复现和分析。
[61:01] 透明监管与训练数据安全
[事实] 王铁镇认为,社区需要有能力验证模型到底安全还是危险,而不是简单把智能水平等同于危险程度。 [事实] 他推测 Kimi K3 可能没有使用大量攻击性网络安全语料,因此即使在某些能力上很强,也未必具备同等攻击能力。 [事实] 他建议,监管不应只看模型对用户的最终行为,还应关注模型训练使用了哪些语料。 [事实] 他认为,从训练数据中去除生物安全、网络攻击等高风险语料,可能比单纯过滤用户输入更稳妥。 [推测] 本段核心立场是,安全治理应前移到数据、训练和透明评估环节,而不是只依赖闭源服务的运行时过滤。
[63:04] 模型主权也是安全问题
[事实] Keith 提到,某些闭源模型服务突然不可用或访问权限变化,会让企业意识到依赖第三方 API 本身也是安全风险。 [事实] 他认为,闭源模式把关键能力交给别人,而开源模型可以下载到自己的硬盘和环境里运行,从而减少这类风险。 [事实] 王铁镇指出,许多关于开源模型不安全的质疑,同样可以套用于闭源模型,甚至闭源模型因为能力更强、使用更方便,滥用门槛可能更低。 [事实] 他认为,攻击者使用大型开放模型还要面对算力、部署和能力补齐成本,不一定比攻破闭源模型过滤器更容易。 [推测] “安全”在这里不仅指滥用风险,也包括供应连续性、可控性、审计能力和企业部署自主权。
[64:04] 开源模型的可控性与监管抓手
[事实] 王铁镇提到,有技术人员认为中国开放模型本身可用,但公司法务和内部政策可能禁止部署。 [事实] 他认为,如果把开源模型放在受控机器中,并严格限制输入输出,理论上可以比闭源模型更可控。 [事实] 他反驳了“开源模型可能有后门”的担忧,认为闭源模型在何时输出什么内容同样不可见,甚至更难了解。 [事实] 他指出,目前强开放模型权重仍然很大,需要复杂推理环境,因此算力拥有者本身可以成为监管抓手。 [推测] 嘉宾认为,现在就断言开放模型一定不安全还为时过早。
播客点评/总结
[推测] 本期的价值在于,它没有停留在“Kimi K3 很强”或“开源冲击闭源”的表层判断,而是把技术路线、成本结构、license、云厂商利益、agent 基础设施和安全治理放到同一条产业链上看。
[推测] 节目的亮点是对“蒸馏”的拆解较清晰:传统技术蒸馏、用模型输出训练、身份数据污染、商业条款违规和核心能力来源,是几件不同的事。这个拆分能帮助听众避免把所有中国开放模型进步都简单归因为蒸馏。
[推测] 局限在于,讨论主要基于嘉宾观察和行业判断,对 Kimi K3 具体训练细节、license 实际收费效果、以及安全基准的完整数据没有展开验证。因此部分商业影响和政策趋势仍属于趋势判断。
[推测] 这期适合关注 AI 模型商业模式、开源生态、企业部署、推理基础设施和 agent 行业变化的听众;如果只想听模型评测或具体上手教程,本期更偏产业分析而非产品使用指南。