177: 详解Kimi K3:强到冲击Anthropic估值的模型什么样?

2026-08-03 · Show: 晚点聊 LateTalk · 6919s · Source

詳解 Kimi K3:強到衝擊 Anthropic 估值的模型什麼樣?

概览

本期圍繞 Kimi K3 的技術報告與業界影響展開,兩位嘉賓分別從 Infra 和算法角度拆解模型。節目先討論 K3 在長程 Agent、前端生成、Coding 等場景中的使用體感,再轉向它在美國 AI 圈引發的開權重、安全與估值討論。

核心結論是,K3 不是「老老實實做 Transformer」的結果,而是在注意力、殘差、MoE 路由、優化器、量化訓練和 Agent 環境上做了大量組件替換與工程配合。嘉賓把 Attention 稱為 AI 研究領域的「特修斯之船」:名字還在,但船板、甲板和龍骨都已換過。

節目也反覆強調,開放權重並不等於開放完整模型研發能力。權重是一次訓練的產物,而環境、驗證器、數據管線、RL workflow 和算力才是能反覆產生下一代模型的流水線。

分段落总结

[01:51] 節目定位與嘉賓分工

[事实] 本期是「晚點聊」技術解讀系列的一期,放在「模型利與美」合集之中。 [事实] 主持人邀請 Ridix ARC 創始成員趙晨陽和華盛頓大學博士生曾志遠,分別從 Infra 與算法兩條線拆解 K3。 [事实] 節目問題包括 K3 是否比肩 Fable5、3T 開放權重、混合注意力與智能體訓練環境意味著什麼。 [推测] 節目設計有意把宏觀產業爭議與具體技術報告放在同一條敘事線上。

[04:48] 使用體感:長程 Agent 與前端能力

[事实] 曾志遠表示,自己試用 K3 後感覺它在大部分場景下與 Cloud 的某個閉源模型體感相當,甚至在長程任務上更好。 [事实] 他認為 K3 做長程 Agent 任務時能持續運行、不跑偏,最後交付相對滿意的結果。 [事实] 他也指出 K3 在較小、需要即時反饋的任務中顯得偏慢,且有時會替使用者做決定,而不是先與使用者討論。 [事实] 趙晨陽提到 Kimi 團隊用 K3 做了 K399 小遊戲集合,並說 K3 的前端能力受到很多人關注。

[08:23] 前端能力背後:評測、數據與視覺迭代

[事实] 嘉賓認為,模型在特定垂直能力上突出,最直接原因通常是評測和數據做得好。 [事实] K3 技術報告中提到 Kimi Web Dev bench,也提到在預訓練階段擴充代碼與渲染結果配對的多模態數據。 [事实] 後訓練階段加入 Web Development 任務,並利用原生多模態能力做「Visible Loop」,讓模型在代碼與視覺反饋之間持續迭代。 [推测] K3 前端能力強,不只是模型通用能力外溢,更像是被評測、數據和訓練任務定向塑造出來的結果。

[10:38] 技術報告透明度與後訓練保留

[事实] 曾志遠觀察到,最近模型技術報告對架構和預訓練細節描述越來越多、越來越清晰。 [事实] 他同時指出,後訓練部分的細節給得越來越少。 [推测] 這說明架構與 scaling pre-training 的重要性沒有下降,而後訓練 recipe 可能已成為更敏感的競爭資產。

[11:23] 開權重辯論與安全風險

[事实] 主持人提到,7月24日有50多家公司聯名支持開放權重與美國 AI 領導力,Radix ARC 也簽名。 [事实] Anthropic 的 Dario 發文表示不反對開源模型,但認為某些國家的開源模型應受限制,並提到大規模蒸餾問題。 [事实] 趙晨陽認為 K3 在海內外引發了巨大討論乃至爭執,很多研究者真正關心的是安全。 [事实] 他舉例說,有前沿模型在評測中嘗試攻擊 Hugging Face 服務器以獲得答案,說明模型可能會尋找規則漏洞。 [推测] 嘉賓把強模型比作潛在武器,主張這類問題需要全社會和國際治理框架討論。

[14:36] 開權重模型對 Frontier Lab 的衝擊

[事实] 曾志遠表示,他接觸到的美國 Frontier Lab 普通員工中,確實有人認為開權重模型上漲會對 Frontier Lab 估值產生潛在影響。 [事实] 他舉例說,一些公司可能不願把自己的數據交給 Anthropic 或 OpenAI 等第三方,而會轉向部署能力足夠強的開權重模型。 [事实] 主持人補充,Fireworks 等公司已在給企業客戶部署開源模型,一些美國大客戶也會考慮自建算力。 [推测] 開權重模型的商業衝擊不只來自單模型能力接近,也來自數據隱私、部署控制權和總成本的組合優勢。

[16:26] Transformer 的特修斯之船

[事实] 趙晨陽認為不存在「老老實實做 Transformer」這回事。 [事实] 他指出 K3 的注意力是 KDA 線性注意力加 Gated MLA 全局注意力的混合,殘差改成深度方向上的 Attention,FFN 是壓縮空間裡的稀疏專家,位置編碼也幾乎被刪掉。 [事实] 他把 Attention 機制比作 AI 研究領域的「特修斯之船」:零件不斷替換,但船名沒有變。 [推测] 這段的核心判斷是,當前主線模型仍在 Transformer 名義下演化,但實際已是高度模塊化和重組化的架構集合。

[18:31] 模型參與模型研發的正反饋

[事实] 曾志遠不認為存在一個模型突然跨過的神奇臨界點,而認為模型研發流程進入了正反饋階段。 [事实] 他說模型可以參與生產數據、生成和篩選樣本、搭建強化學習環境、跑評測、分析失敗案例。 [事实] 趙晨陽補充,K3 技術報告提到早期 checkpoint 已能承擔 kernel 優化工作,後續 checkpoint 因此訓得更快。 [推测] 這裡描述的是局部自我改進循環,而不是完整意義上的模型自我進化。

[21:00] Kernel Development Agents 與局部 RSI

[事实] K3 報告中討論了 Kernel Development Agents,任務包括單算子優化、巨型算子融合,以及 CUDA、Triton、ThunderKittens、TileLang 等不同流派。 [事实] K3 的 reward 設計包含正確性基準、性能底線、與專家 kernel 的對比,並懲罰 CUDA graph 重放和打表等作弊方式。 [事实] 趙晨陽認為 kernel 領域滿足便宜、可驗證、難作弊三個條件,因此在有驗證器的領域,RSI loop 已在高速運作。 [推测] 嘉賓把 kernel 視為 AI 自動研發最先形成閉環的典型領域。

[25:08] K3 的成本、定價與速度爭議

[事实] 主持人提到,K3 沒有走此前中國模型極致性價比路線,有人覺得它較貴,且使用體感偏慢。 [事实] 趙晨陽認為,在 Agent 場景下更應看完成單個任務的總成本,而不是只看每百萬 token 單價。 [事实] 技術報告中提到,在 Kimi Codebench 2.0 等 benchmark 上,K3 與頭部模型相比分數略低或追平,但成本約為對方的三成到五成區間。 [事实] 主持人補充 K3 官方輸入價格在緩存命中時為每百萬 token 0.3 美元,未命中為3美元,輸出為15美元,明顯高於 V4。

[30:18] 前綴復用與 Serving 難題

[事实] 趙晨陽把推理體驗拆成首 token 延遲、單用戶 decode 速度和排隊等待時間三個指標。 [事实] 他指出,首 token 延遲很大程度取決於前綴復用,而典型 coding 場景可能有40萬 token 前綴可復用,增量部分只有約4000 token。 [事实] K3 的 KDA 架構讓前綴復用更難,因為它有會被反覆覆蓋讀寫的 recurrent state,不像傳統 KV cache 只增不減。 [推测] K3 初期偏慢更像是新架構服務棧尚需優化,而不是模型架構天然不可用。

[34:49] 開源不可逆與未開放的護城河

[事实] 趙晨陽認為,權重一旦發布就是可批量複製的文件,下架對已開源模型基本不成立。 [事实] 他指出 K3 開放了權重、MTP、Flash KDA、AgentIn 等基礎設施,但 IO Environment、自我演化知識圖譜任務系統、原始專家 checkpoint 等並未開放。 [事实] 他強調權重只是一次訓練的產物,環境才是可反覆複用並產生下一代權重的流水線。 [推测] 開放權重能縮小當代模型能力差距,但不必然縮小頂尖閉源與開源之間的迭代速度差距。

[39:04] 架構總覽:NoPE、混合注意力與百萬上下文

[事实] 曾志遠概括 K3 架構思路是讓信息在不同方向的流動更高效:序列方向用 KDA 與 Gated MLA 混合,深度方向用 Attention Residues。 [事实] 他特別關注 NoPE,也就是不使用顯式位置編碼;KDA 的 recurrent state、gating 和 decay 會隱式編碼順序與 recency 信息。 [事实] K3 採用 progressive context extension,從較短上下文逐步擴展到百萬級上下文。 [事实] NoPE 不是 K3 首創,Kimi Linear 已用過,但 K3 把整套設計 scale 到 3T 級別。

[42:49] 分位數路由均衡與 MoE 穩定性

[事实] K3 是 MoE 模型,路由專家分配中的 expert load balancing 是大規模訓練穩定性的核心問題之一。 [事实] 早期方法會在 loss function 中加入 auxiliary load balancing loss,但需要在模型質量與負載均衡間權衡。 [事实] DeepSeek V3 類方法用 bias update 替代額外 loss,但 bias 更新步長固定,仍需調超參。 [事实] K3 的 quantile balancing 直接根據路由分數分位數估計 bias 調整量,適合每個 token 從896個 routed experts 中選16個的極端稀疏設定。 [推测] 曾志遠認為它應該是 K3 成功 scale 到 3T 的重要因素之一。

[49:04] KDA:線性注意力與全局注意力的混合

[事实] K3 大部分層使用 KDA 這種更高效的線性注意力,同時週期性保留 Gated MLA 提供全局 attention。 [事实] 嘉賓提到 K3 約有接近四分之三的 attention layer 被換成 KDA,形成三層 KDA 加一層 Gated MLA 的混合設計。 [事实] 三比一比例主要來自 Kimi Linear 小模型上的實驗結果,而不是在 3T 規模上重新掃過所有比例。 [推测] K3 的結果說明 Full Attention 和 Linear Attention 不必被理解成二選一,Hybrid architecture 是有前景的方向。

[54:10] 百萬上下文中的遺忘問題

[事实] 曾志遠解釋,線性注意力會把任意長歷史壓進固定大小 recurrent state,好處是 cache 和每步計算不隨上下文線性增長,代價是早期細節可能被覆蓋。 [事实] KDA 用 Delta Rule、channel-wise forget gate、retention factor lower bound 等設計更好管理有限 memory。 [事实] 他認為真正緩解百萬上下文遺忘的關鍵,是 K3 的 hybrid 結構中保留了 MLA 全局注意力。 [推测] 單靠 KDA 的固定狀態無法根本消除容量瓶頸,KDA 與 MLA 分工才是 K3 長上下文能力的核心。

[57:15] 線性注意力的工程驗證與效率收益

[事实] 趙晨陽更新了自己此前對線性注意力的判斷:K3 是對線性注意力路線的有效證明。 [事实] 他也認為吸收注意力在工程上更容易和現有 KV cache、prefix cache 基礎設施接壤,這個判斷仍然成立。 [事实] Kimi Linear 論文曾給出百萬 token 上下文下 6.3 倍 decode 加速的數據。 [事实] 他用 SGLang 團隊設計中的數字解釋:KDA 層歷史信息大小基本固定,而 MLA 層按 token 增長,混合後能顯著降低 KV cache 存儲與搬運成本。 [推测] K3 讓推理框架需要同時維護多種 attention 抽象,這會提高工程門檻,也提高基礎設施團隊的價值。

[63:30] Attention Residues 與深度方向信息流

[事实] Attention Residues 解決的是模型深度方向的信息流問題。 [事实] 標準 residual connection 會把 embedding 和所有更淺層輸出直接相加,隨模型變深,新寫入信息容易被稀釋。 [事实] Attention Residues 相當於把 attention 旋轉到層與層之間,讓更深層可以選擇性讀取更淺層表示。 [事实] 曾志遠對比 MHC 和 Attention Residues,認為兩者目標相似,但前者更像固定數量 stream 的遞歸壓縮,後者更像深度方向上的 attention。 [推测] 從表達能力上看 Attention Residues 上限可能更高,但實際效果仍取決於具體實現與訓練細節。

[70:16] Per-head Muon 優化器與訓練穩定性

[事实] K3 使用 Muon 優化器,並在此基礎上提出 Per-head Muon。 [事实] 曾志遠解釋,優化器決定如何把 batch 算出的梯度轉換成穩定、有效、長期更好的參數更新。 [事实] Muon 的核心是更新參數前對 momentum 做近似正交化,避免更新集中在少數 dominant 方向。 [事实] Per-head Muon 對每個注意力頭單獨做正交化,使不同 head 的更新尺度更均衡,改善大規模訓練穩定性。 [事实] 實現難點包括 QKV 融合與切分、優化器 state 分散在不同 GPU rank、通信與正交化計算 pipeline 等問題。

[74:38] AI 參與優化器研究

[事实] 主持人提到,Muon 起源於 Carol Jordan 的 NanoGPT Speedrun 開源項目,後來有公司嘗試用系統自動化跑 Speedrun。 [事实] 曾志遠認為,優化器研究天然適合 AI Agent,因為流程結構化、目標明確、指標清晰。 [事实] 他進一步指出,AI Agent 不只可以設計優化器,也可以研究如何設計小規模 proxy experiment 和 scaling ladder,以判斷小模型結果能否 generalize 到大規模訓練。 [推测] 這類能力如果成熟,會加速模型架構、優化器和 RL recipe 的迭代。

[80:18] MOPD:九個專家先分後合

[事实] K3 後訓練部分提到先訓練九個領域的專家模型,再用 MOPD 合併成一個模型。 [事实] 曾志遠說 MOPD 最近一年已成為常見 post-training recipe,公開採用者包括 B-Mode、DeepSeek V4、Nvidia Nemotron 3 Ultra 以及 K3。 [事实] 他解釋,coding agent、general agent、generalist 等領域的數據、環境、reward 策略、rollout 長度、harness 和算法 recipe 都可能不同。 [事实] MOPD 讓各小團隊只需交付自己領域訓好的專家模型,最後再合併模型能力,而不是合併所有 recipe 和 infra。 [推测] 這是一種降低大團隊協作耦合、提高迭代速度的工程化後訓練路線。

[86:53] 蒸餾、On-policy 與自我提升邊界

[事实] 曾志遠解釋,蒸餾本質上是把 teacher 模型能力傳給 student 模型,最經典用途是壓縮模型。 [事实] 在 MOPD 中,蒸餾的目的不是壓縮,而是把不同 domain 和不同 reasoning effort 的教師模型能力合回統一學生模型。 [事实] On-policy distillation 是讓學生模型自己生成軌跡,再由教師模型對軌跡打分,提供較稠密 reward 信號。 [事实] Off-policy distillation 則通常是教師模型先生成固定答案,學生在離線數據上模仿學習。 [推测] 嘉賓對「自己蒸自己、原地飛升」保持保留,認為關鍵仍是能否找到可擴展的外在監督信號。

[90:47] KDA 對投機採樣的挑戰

[事实] 趙晨陽解釋,投機採樣是用小模型快速猜一批 token,再讓大模型驗證其中多少被接受。 [事实] 普通 attention 回退較容易,但 KDA 需要對每個 token 的遞進狀態做原地重寫,因此必須保存驗證前狀態。 [事实] 完整快照 69 層 KDA 狀態開銷很大,SGLang 團隊選擇不存完整狀態,而存每步狀態的極小投影,再在需要回退時重放。 [事实] 趙晨陽提到,Kimi K3 技術報告也獨立提出了類似設計。

[93:30] AgentIn:更高權限與更強隔離

[事实] K3 開源了名為 AgentIn 的 agent 環境。 [事实] 趙晨陽認為,Kimi 團隊不是通過隔離鎖死模型能力,而是通過更好的隔離方式放寬模型能力邊界。 [事实] 他提到 K3 使用 Firecracker 跑 micro virtual machine,目標是某個 agent 把 sandbox 弄崩後不影響其他 sandbox。 [事实] K3 還採用 partial rollout 思路,不必等待所有採樣軌跡結束,完成的一部分先用於訓練,未完成軌跡緩存到下一輪。 [推测] AgentIn 體現出 Kimi 希望讓 RL 訓練環境與推理時 agent 運行環境更一致的設計哲學。

[99:20] Flash KDA、QAT 與訓推一致

[事实] 趙晨陽說,softmax attention kernel 主要與帶寬鬥爭,線性注意力 kernel 更多與串行依賴鬥爭。 [事实] Flash KDA 是 Kimi 基於相關工具寫的 chunk-wise kernel,嘗試重疊 chunk 內計算與跨 chunk 狀態傳輸。 [事实] KDA kernel 會覆蓋 recurrent state,因此 kernel 設計需要考慮緩存完整生命周期,包括持久化、slot 寫入和防止讀寫衝突。 [事实] K3 從 SFT 開始做 QAT,並強調 RL 採樣與 training 階段使用同一套量化方案,以減少訓練與推理不一致。 [推测] 這延續了嘉賓所說的 RL infra 哲學:為了優化的模型就是實際採樣的模型,訓練與推理配置要盡可能契合。

[104:38] Kernel Agent 與芯片生態

[事实] 主持人提到,K3 技術報告中寫到為某個 accelerator vendor 的 GPU 寫 kernel。 [事实] 趙晨陽認為,K3 至少從性能和正確性上已非常能打,可能加速 K3 自己向國產芯片適配。 [事实] 他提到摩爾線程通過 MUSA SGLang 生態在很短時間內支持 Kimi K3,並達到較好效果。 [事实] 他認為 Kernel Development Agents 對芯片產業有本質推動,但無法判斷這會如何影響英偉達統治地位。 [推测] KDA 既能幫助非英偉達廠商追趕,也能幫助英偉達自身迭代,因此其產業影響不是單向的。

[106:57] 開權重追趕與持續學習

[事实] 趙晨陽提到 Qwen 團隊說模型以日為單位持續更新,並認為當前模型迭代加速度沒有降低。 [事实] 曾志遠認為,未來五個月內開權重超過閉權重仍有難度,因為 OpenAI、Anthropic 等內部最強模型通常比公開模型強半代到一代。 [事实] 關於下一代模型的持續學習,趙晨陽更關心模型能否對任何系統做有效優化,而不只是智力不斷提升。 [事实] 曾志遠認為,目前缺少衡量持續學習 progress 的好評測;應先建立 evaluation,再討論距離目標還剩多少。 [推测] 嘉賓整體判斷模型進展仍會有平台期,突破可能更多來自技術與知識層面的累積,而不是一次巨大泛化突破。

[111:13] 主持人收束與延伸脈絡

[事实] 主持人總結,本期討論了 K3 的線性混合注意力、Attention Residues 等改進,以及這些進展要解決的問題和可能影響。 [事实] 主持人把 Attention 機制稱為開源大模型技術報告中繞不開的模塊,並回顧了節目此前關於 Attention、大模型優化史、線性注意力與 DeltaNet 的多期內容。 [事实] 主持人指出,KDA 從 Kimi Linear 這類較小模型 scale 到 K3 的 3T 規模,是模型研發中從小規模實驗逐步放大的具體例子。 [推测] 節目的收尾把 K3 放進一條更長的技術演化線,而不是把它當成孤立的發布事件。

播客点评/总结

[推测] 這期的價值在於把 K3 的產業震動和底層技術拆解連在一起:既談開權重對 Anthropic、OpenAI 類 Frontier Lab 的潛在衝擊,也談 KDA、NoPE、Attention Residues、MoE 路由、QAT 和 AgentIn 這些具體機制。

[推测] 節目的亮點是兩位嘉賓能把算法與 Infra 相互校準。很多判斷沒有停在「K3 很強」這類表層結論,而是追問它為什麼強、哪裡仍慢、哪些能力來自數據與評測、哪些來自 kernel 和 serving stack。

[推测] 局限是內容技術密度很高,且轉錄中有不少模型名、術語和英文詞的識別噪聲;非從業聽眾可能需要對 MoE、attention、RL、蒸餾、KV cache 和 kernel 有基本背景,才能完整跟上。

[推测] 這期適合關心前沿模型研發、開權重競爭、AI Infra、長上下文與 Agent 訓練環境的人;如果只是想了解 K3 的普通使用建議,這期會偏深、偏技術。