152. 领读Kimi K3技术报告:从架构创新聊起,注意力美学、多教师蒸馏和开源MoE

领读 Kimi K3 技术报告:架构创新、多教师蒸馏与开源 MoE

Episode guide Published 张小珺Jùn|商业访谈录 2 hr 4 min

概览

本期是一集 Kimi K3 技术报告领读,核心问题是:Kimi K3 如何把 MoE 模型有效扩展到 2.8T 总参数、约 100B 激活参数,并支持 1M 上下文,同时在训练、推理和开源形态上保持可用性。

嘉宾孙宇涛从自己的 LLM 架构与训练研究经历切入,把 Kimi K3 放进线性注意力、混合注意力、MoE、优化器、长上下文、后训练和 Infra co-design 的历史脉络中讨论。节目不只是逐段复述论文,而是解释 K3 的很多设计为什么会走到现在这个形态。

主要结论是:K3 的亮点不在单个“横空出世”的范式创新,而在于把过去几年多条架构和工程线索综合到一个有效 scale 的大模型中。嘉宾认为模型 size 和有效 scaling 仍然是能力上限的关键,同时也指出未来大模型可能更多是改良式推进。

分段落总结

[00:03] 开场与嘉宾定位

[事实] 主持人介绍本期是 Kimi K3 技术报告学习播客,K3 被描述为有效扩展到 2.8T 总参数并全量开源的 MoE 模型。 [事实] 嘉宾孙宇涛的研究方向是 LLM 架构与训练,尤其关注推理效率;主持人说明他会串联十多篇相关论文来讲 K3。 [推测] 这期节目面向的听众更偏技术研究者或工程实践者,而不是只想了解模型榜单结果的泛听众。

[02:26] 从推理效率出发的研究脉络

[事实] 孙宇涛介绍自己从 2023 年开始研究大模型架构,重点围绕推理阶段的低效性展开。 [事实] 他认为大模型时代架构研究的重心从单纯提升性能转向提升效率,因为参数量对能力影响更大,而架构差异会显著影响部署和推理成本。 [事实] 他提到 RetNet、chunkwise recurrent、混合注意力等工作,说明线性注意力需要在性能、长上下文能力和 GPU 计算效率之间做平衡。

[08:53] YOCO 与推理三大瓶颈

[事实] 嘉宾解释 YOCO 的出发点是:如果全文 KV cache 无法从 token 维度省掉,就从层间维度省,只保留一份 KV cache。 [事实] 他把模型推理开销归纳为 prefill 时间、decode 开销和 KV cache 存储三部分,并指出 YOCO 主要解决 prefill 和 KV cache,而不是 decode。 [事实] YOCO 在 prefill 阶段可以跳过全注意力计算,只获得后续 decode 需要的 KV cache。

[11:53] Loop Language Model 与 YOCO Universal

[事实] 嘉宾讨论 loop language model:在固定参数量下通过多次迭代增加 FLOPs,以获得强于同参数模型的效果。 [事实] 传统 loop language model 的问题是省参数但不省计算,decode 成本和 KV cache 成本都可能变大。 [事实] YOCO Universal 把 loop 集中在线性注意力部分,试图在较小存储和 KV cache 增量下获得稳定的能力提升。

[16:19] 从 K3 出发展开历史脉络

[事实] 嘉宾说明自己的讲解方式不是只读 K3 论文,而是把每个贡献背后的 related work 和历史原因展开。 [事实] 他认为 Kimi K3 的模型架构部分脉络清晰,很多组件都能对应到前人的工作和 Kimi 自己此前的论文。 [事实] 节目强调 K3 不是单家公司凭空产生的结果,而是吸收行业多项工作的综合成果;嘉宾也肯定 Kimi 在论文中较客观地呈现前人贡献。

[19:02] K3 的定位与有效 Scaling

[事实] 嘉宾认为 Kimi K3 的关键卖点包括模型大小 scaling 和上下文长度 scaling;K3 做到 2.8T 总参数、约 100B 激活参数、1M 上下文。 [事实] 他强调“有效 scaling”区别于只是把模型数字做大,真正重要的是在大规模下仍能获得能力收益。 [事实] 相比 K2,K3 不再主要沿用 DeepSeek V3 风格结构,而是在架构上引入更多新的设计元素和细节调优。

[21:35] Kimi Delta Attention 的历史来源

[事实] 嘉宾从线性注意力、RetNet、Mamba、DeltaNet、Gated DeltaNet 讲到 Kimi Delta Attention,说明每一项公式背后都有历史来源。 [事实] RetNet 引入与 token 位置有关的衰减项,DeltaNet 提升线性注意力的上下文容量,Gated DeltaNet 把更高容量和衰减结合。 [事实] Kimi Delta Attention 在 Gated DeltaNet 基础上把衰减从标量扩展为 channelized decay,使每个 channel 可以有不同衰减系数。

[27:36] KDA 的能力与 Kernel Co-design

[事实] 嘉宾认为 channelized decay 在表达能力上严格更强,但会提高 kernel 实现难度。 [事实] KDA 通过 lower-bound decay 等设计,把衰减控制在特定 tile/chunk 的 BF16 动态范围内,以支持更高效的 kernel 计算。 [推测] 这里体现了 K3 架构设计的典型风格:不是单纯追求公式更强,而是让算法形式服务于可实现的高效训练和推理。

[33:15] Gated MLA 与 MLA 取舍

[事实] K3 沿用了 K2 的 MLA,并在此基础上加入 gated attention,以提升训练稳定性。 [事实] 嘉宾认为 gated attention 的最大价值是训练稳定性,因为大规模预训练中稳定性往往比小幅能力差异更重要。 [事实] 他指出 MLA 本质上接近“大号 MQA”的等价形式,不一定会成为长期共识;DeepSeek V4 没有继续沿用 MLA,部分原因与 Sparse Attention 等设计有关。

[39:18] Attention Residue 与深层连接

[事实] 嘉宾把 Attention Residue 放在 ResNet、Pre-LayerNorm/Post-LayerNorm、HyperConnection、DenseNet 的脉络里讨论。 [事实] 他认为 HyperConnection 的核心思想是在 residual 分支上用更大容量表示模型深度方向的状态,从而提升表达能力。 [事实] Attention Residue 类似把 DenseNet 式跨层连接带入 attention 时代,并通过 block attention 等方式降低深度交互开销。

[46:24] Latent MoE 与通信效率

[事实] 嘉宾指出 MoE 的一个核心挑战是 expert parallel 下的 all-to-all dispatch 通信开销。 [事实] Latent MoE 的思路是减小 dispatch 的 hidden state 维度,再通过更大的 FFN intermediate dimension、更多 expert 或更多激活来补回参数量。 [事实] 如果设计得当,Latent MoE 可以在接近不损失模型能力的情况下减少通信;嘉宾认为这对推理 latency 的收益尤其明显。

[51:17] C2-GLO、Muon 与 Outlier 控制

[事实] 嘉宾解释 C2-GLO 可以理解为用 tanh 一类 soft clip,把 FFN/MLP 中间可能 unbounded 的激活值限制住。 [事实] 他提到低精度和 Muon 优化器相关场景更容易出现 activation outlier,Kimi 通过架构侧约束来控制中间激活。 [事实] 他将这一思路与 Kimi K2 中的 QK Clip、Moonlight/Muon 相关讨论联系起来,认为从模型架构上限制数值范围是更本质的方案。

[56:34] Quantum Balancing 与 MoE 负载均衡

[事实] Quantum Balancing 主要面向 MoE expert 负载均衡,延续 loss-free routing 中用 bias 而非辅助 loss 控制负载的思路。 [事实] 相比 loss-free routing 的启发式 bias 更新,Quantum Balancing 试图用更 principled 的方式直接推导 bias,并在下一步使用以避免信息泄漏。 [事实] K3 论文还给出基于值域分桶和 histogram 的工程实现,用更可扩展的方式近似求分位数。

[62:24] Vision Encoder 与原生多模态训练

[事实] K3 在视觉部分讨论是否使用已有 vision encoder;嘉宾概括为直接用 SigLIP 等 encoder 训练更快,但 from scratch/native training 兼容性更好。 [事实] 节目提到原生训练可能多用算力,但不会明显损害结果,并可能带来更稳定的 gradient norm。 [推测] K3 选择原生方式,可能是为了让视觉模块与整体优化器和训练 recipe 更一致。

[64:06] 为什么 K3 没用 Sparse Attention

[事实] 嘉宾认为 Sparse Attention 在 decode 中的 index 选择开销很高,尤其在 Blackwell 等硬件上可能抵消计算收益。 [事实] 要让 Sparse Attention 真正加速,往往需要跨层共享 index;但 K3 的 hybrid attention 层间隔着线性注意力,使跨层复用不够直接。 [事实] 另一个原因是 Sparse Attention 通常更适合 post-train 从 full attention 转化,而不太适合直接 from scratch 预训练。

[67:16] 架构取舍与“忒修斯之船”

[事实] 嘉宾用“忒修斯之船”比喻 Transformer:从 2017 年的 attention、residual、stacked layer 出发,许多部件不断被替换,但大家仍称其为 Transformer。 [事实] 他认为 K3 是偏综合性的工作,单点创新包括注意力、MoE、优化器、连接方式等,真正难点在于把这些组件规模化跑出来。 [事实] 主持人与嘉宾都提到 K2 到 K3 的变化体现了战略节奏:K2 先把 base model pipeline 做稳,K3 再做更精细的架构优化。

[72:19] 预训练学习率策略与 Scaling 结果

[事实] 嘉宾讨论 WSD 与 cosine decay,认为 WSD 的优势是可以把 data schedule 和 learning rate schedule 联动,也便于中途调整训练 token 数。 [事实] K3 论文选择更简单的 cosine decay,因为它超参更少,更容易找到合适设置;嘉宾认为这是在多数团队用 WSD 时的一个不同选择。 [事实] K3 相比 K2 总参数从约 1T 到 2.8T,论文给出相对 K2 约 2.5 倍的 scaling efficiency 综合结果。

[79:03] 1M 长上下文与 NoPE

[事实] K3 原生支持 1M 长上下文;嘉宾重点讨论在 hybrid attention 中全注意力部分去掉 RoPE、使用 NoPE 的做法。 [事实] 他认为线性注意力部分已经引入位置信息,因此 full attention 部分去掉位置编码可以让长上下文扩展更自然,不需要随长度调整 RoPE 参数。 [事实] 嘉宾强调 RoPE 更主要提供 recency bias,对长上下文能力本身没有帮助,甚至可能有负面影响。

[82:21] 后训练、QAT 与多教师蒸馏

[事实] K3 先用高精度做大规模训练,再在 SFT 阶段引入低精度 QAT;嘉宾认为这从项目管理上更保险,技术上也未必损失效果。 [事实] OPD/on-policy distillation 被解释为让学生模型自己生成推理过程,再由教师模型逐步纠正,而不是只学习教师答案。 [事实] 嘉宾认为多教师蒸馏可以把不同 RL reward、不同专项能力简化成多个教师模型,再做模型层面的合并,从而降低 post-train 管理复杂度。

[89:23] Draft Model、MTP 与 D-Flash

[事实] 嘉宾讨论 draft model 和 MTP,指出早期 speculative decoding 用独立小模型,而 MTP/EAGLE 类方法会利用大模型中间 hidden state 提高接受率。 [事实] D-Flash 被描述为把 diffusion language model 的快速单用户推理优势与传统 language model 结合,用于提升 draft model 加速比。 [事实] 他认为 draft model 与预训练阶段关系很大,预训练需要给 MTP 提供接口,后续还可用 KL loss 等方式提升对齐和接受效率。

[93:29] Infra Co-design:KDA、EP、Offloading 与 PP

[事实] 嘉宾指出 KDA 的 context parallel 可以利用线性注意力 chunk 可任意拆分的特性,形成跨机器大 chunk 和机器内小 chunk 的双层 chunk 计算。 [事实] K3 的 dynamic EP 通过少量冗余 expert 和 online planning,让每张卡处理的 token 数趋于均衡,减少等待和通信前置协调。 [事实] K3 还使用 FP8 offloading、shared expert overlap 通信、PP rank 间转移 memory 压力,以及针对 vision encoder 的 PP 排布优化。

[110:31] RL/Inference 工程与评测

[事实] 嘉宾把 Infra 分为 pretrain、RL 和 inference 三部分;RL 需要管理大量 sandbox/docker,因为不同 trajectory 可能对应不同运行环境。 [事实] K3 在 RL 中复用 gradient buffer 给 non-policy/reference model forward 使用,以减少内存占用。 [事实] 推理部分的难点包括线性注意力的 prefix caching、hybrid attention 在 vLLM 等引擎中的适配,以及 decode 阶段的专门 kernel 配置。

[115:07] K3 的亮点、团队方式与未来判断

[事实] 嘉宾认为 K3 最让他意外的是激活参数规模做到了约 100B,比预期更大;他把这视为团队和战略选择,而不是单一技术动作。 [事实] 他认可 Kimi 的研究方式较科学,尤其强调模型内科、训练 trace、稳定性归因和 collapse 归因。 [事实] 对未来,他判断模型 size 还会继续扩大,但纯 language model 的范式创新可能不多,更多会是改良式推进;如果 AGI 被清晰定义在语言模型范围内,他认为达到目标的问题不大。

播客点评/总结

[推测] 这期的最大价值在于把 Kimi K3 拆成一组可追溯的技术脉络:线性注意力如何演化到 KDA,MoE 如何从通信瓶颈走向 Latent MoE,后训练如何从单教师蒸馏走向多教师合并。对想理解“为什么这样设计”的听众,比单看论文摘要更有帮助。

[事实] 节目包含大量具体架构、训练和 Infra 细节,包括 Gated MLA、Attention Residue、Quantum Balancing、NoPE、QAT、OPD、MTP、dynamic EP 和 PP/offloading 优化。内容密度很高,嘉宾语速也被主持人在开场提醒过。

[推测] 局限是后训练和评测部分展开相对少,很多判断依赖嘉宾个人经验与技术直觉;不熟悉 LLM 架构论文的听众可能需要配合原论文和相关工作反复听。更适合大模型研究者、训练/推理工程师,以及希望理解开源 MoE 前沿架构取舍的人。