148. 对游凯超3小时访谈:开源Infra、和模型Co-design 、“如果vLLM失败,我们会后悔一辈子”

2026-07-28 · Show: 张小珺Jùn|商业访谈录 · 10827s · Source

对游凯超3小时访谈:开源 Infra、模型 Co-design 与 vLLM 的开源使命

概览

本期围绕凯超的个人路径、vLLM 的开源社区演化、Infract 的公司化选择,以及大模型时代模型结构、推理系统、硬件和 Agent Harness 之间的联合设计展开。

核心结论是:在后摩尔定律时代,算法能否真正留下来,越来越取决于它能否被系统高效实现;开源推理引擎的价值不只是某个算法优化,而是长期承接模型、硬件、负载不断变化的复杂性。

访谈后半段把 vLLM 放进更大的产业格局中讨论:凯超认为中国开源模型已经对全球格局产生深远影响,并判断开源模型最终会赢;Infract 则希望围绕 vLLM 成为 AI 推理领域类似 Linux 的基础设施。

分段落总结

[00:00] 开场与核心议题

[事实] 主持人介绍凯超是 Infract 联合创始人兼首席科学家,vLLM 从伯克利校园开源项目演化为社区与公司化运营。 [事实] 本期讨论开源项目商业化后的抉择,以及 AI Infra、模型结构和 Harness Engineering 共同设计的问题。

[02:17] 个人背景与早期学习

[事实] 凯超介绍自己本科和博士均毕业于清华,现在主要维护以 vLLM 为核心的开源大模型推理引擎生态。 [事实] 他从学堂在线接触大学物理、微积分和 Python,不喜欢重复刷题,更偏好学习新知识。

[07:19] 清华经历与学习观

[事实] 凯超认为高考分数只是 admission,进入清华后应关注大学阶段真正要做的事。 [事实] 主持人提到他曾发大量邮件请教老师、阅读大量资料、36 门课获 4.0;凯超将其解释为享受学习后的自然结果。

[09:28] 从算法研究转向系统工程

[事实] 凯超认为 AI 学术会议规模扩张过快,审稿质量下降,投稿越来越像抽彩票。 [事实] 他意识到大规模实验、机器学习系统和数据往往决定算法成果能否成立,2022 年与工业界朋友交流复杂硬件和软件挑战也加深了这一判断。 [推测] 这段经历让他把“发论文”转向“做有真实影响的软件系统”。

[15:00] 本科到博士的研究轨迹

[事实] 他本科做数据稀缺场景下的高效学习,后来发现这类方法常常只是提升 1%-2%,较依赖别人已有任务。 [事实] GPT-3 出现后,他因算力有限转向大模型微调,但也发现更大的预训练模型替换本身往往比算法改进收益更大。

[19:00] 伯克利机缘与系统意识萌芽

[事实] 2019 年他在 Berkeley RiseLab 交流,接触 Michael Jordan 和 Ion Stoica 两位老师,也认识了后来 vLLM 的发起人之一李卓翰。 [事实] Ion Stoica 曾鼓励他说“好的软件总会有人用”,这成为他转向机器学习系统的重要影响因素。

[37:00] vLLM 的伯克利传统与诞生

[事实] 凯超把 vLLM 放在伯克利开源软件传统中理解,提到 BSD、RISC-V、RAID、Spark、Ray 等项目。 [事实] vLLM 起源于 PagedAttention 论文;他认为 PagedAttention 思路本身不复杂,但做得早、实验扎实,并最终开源成推理引擎。

[40:00] 加入 vLLM 与开源动机

[事实] 凯超认为博士中后期、毕业压力相对小且愿意投入工程的人,更适合长期维护开源项目。 [事实] 他加入时 vLLM 缺人,Simon 是较早全职投入者之一,凯超自称大概是第四位主要维护者。 [推测] 团队凝聚力来自对开源、技术和意义感的共同追求,而不只是职业收益。

[50:00] 2024 重构与 2025 中国社区

[事实] 2024 年 vLLM 的主旋律是从 V0 到 V1 的重构,以适应模型和硬件复杂度变化,同时保持用户侧接口尽量稳定。 [事实] 2025 年 DeepSeek V3/R1 和一批中国开源模型爆发,凯超回国后搭建 vLLM 中文社区,并走访 DeepSeek、Kimi 等使用方。

[63:00] 基金会、公司化与开源承诺

[事实] vLLM 被捐给 PyTorch 基金会,主要是为了让商标和项目长期属于开源社区,并保证项目不会闭源。 [事实] 基金会不参与日常技术治理;Infract 则承担商业化、技术运维和社区推进角色。

[70:00] 创业决策与诱惑

[事实] Ion Stoica 很早就推动团队成立公司,理由是 Linux、Kubernetes、PyTorch、Spark 等项目背后都有公司长期支持。 [事实] 凯超和 Simon 较早决定创业,Wusuk 曾因外部机会犹豫,团队用“如果 vLLM 失败会不会后悔”这个问题说服他。 [事实] 公司成立前,有顶级大厂给四位创始人各开出年薪两千万美元的邀请,但他们拒绝了。

[93:00] 为什么必须成立公司

[事实] 开源社区无法稳定调配人力,也难以签 NDA、获取大规模集群资源,这些问题在 2025 年大模型大规模部署时变得突出。 [事实] 一些投资机构在公司成立前已资助 vLLM 开源项目;正式决定创业后,融资过程相对顺利。

[80:00] 开源治理与 Coding Agent 冲击

[事实] vLLM 采用分级治理,有“仁慈独裁者”、核心维护者、committer 和社区贡献者。 [事实] 凯超提到曾强硬删除 beam search 等不适合主流大模型推理负载的功能,以控制复杂度和维护优先级。 [事实] Coding Agent 让垃圾 PR 变多,维护者需要更重视真实反馈、机构贡献和核心维护者判断。

[104:00] Infract 的商业模式与组织变化

[事实] Infract 探索 Endpoint Service、BYOC、战略客户合作等模式,希望按创造的 token 价值或节省成本收费,而不是卖工程师时间。 [事实] 公司已有 30 多人、接近 40 人;从开源社团变成公司后,可以做季度规划、招聘专职人员并配置机器资源。

[113:00] 模型与 Infra 的 Co-design

[事实] 凯超用电力类比:硬件像自然资源,模型像发电机,推理引擎像电力系统,co-design 决定发电效率。 [事实] 他用 hardware lottery 解释后摩尔时代的专用化:算法如果不能利用硬件特性,就吃不到硬件红利。 [事实] RoPE 与 FlashAttention 的兼容性被用作模型结构和系统实现互相成就的例子。

[119:00] DeepSeek 作为 Co-design 案例

[事实] 凯超认为 DeepSeek 的 Infra 团队是全球顶级,算法同学也懂一部分 Infra,因此能更快探索 MOE、投机解码等方向。 [事实] 他认为 DeepSpark 延续 Deflash 路线,算法新颖性不是最高,但工程实现扎实,体现了 DeepSeek 的推理优化能力。

[127:00] 好的 Infra 是设计出来的

[事实] 随着推理需求爆发、算力和电力有限,模型设计必须在训练阶段就考虑推理效率。 [事实] 凯超认为模型团队和 Infra 团队各干各的模式没有前途,理想状态是共同办公、互相理解。 [事实] 他强调第一性原理:不理解 continuous batching、GPU 性能测试、FlashAttention 等基础,就很难判断技术是否真的有用。

[135:00] 模型结构、Token 与 MOE 挑战

[事实] vLLM 会提前支持全球主流开源模型;凯超观察到欧美模型更重视效果,中国模型更重视效率。 [事实] 推理引擎最关心注意力机制,因为不同 attention 设计决定状态管理方式;vLLM 已支持两三百种模型结构,同时也在删除不用的结构。 [事实] MOE 给推理带来细粒度专家、动态路由、专家并行和通信三类挑战,DeepSeek 在这些方向提出了一系列方案。

[140:00] Test-time Scaling 与 Harness Co-design

[事实] 凯超把 test-time scaling 分为多次采样集成、长思考 token、Agent 与环境多轮交互等不同形态。 [事实] Coding Agent 场景下,前缀缓存非常重要;频繁变化的 system prompt、日期时间戳和工具列表会破坏缓存。 [推测] 未来推理效率不只取决于模型和引擎,也取决于 Agent Harness 是否为缓存和负载特性做过设计。

[148:00] 芯片、效率与未来预测

[事实] 凯超认为模型结构和芯片架构会越来越耦合,因为通用算力增长放缓,芯片正为矩阵乘法等特定负载优化。 [事实] 他以 H100 的 FP8、DeepSeek 的分块量化和累加设计为例,说明模型结构需要贴合芯片能力。 [推测] 他给出的 hot take 是:面向人与任务交互的模型,上下文需求大概率停留在百万级,少数自然科学场景可能需要千万级以上。

[158:00] 开源模型、中美格局与 vLLM 定位

[事实] 凯超认为美国顶级模型公司主要走闭源路线,中国顶级模型更多走开源路线,并判断开源模型最终会赢。 [事实] 他认为模型不同于核电技术,模型一旦大规模服务用户,用户数据会积累成训练飞轮,模型能力难以长期隐藏。 [事实] 他把 vLLM 定位为 AI 推理领域的 Linux,并提到 Red Hat 已在投入 vLLM。

[167:00] 个人底色、写作与结尾

[事实] 凯超认为自己的开源倾向来自成长时代:学习技术时自然先搜索、使用和参与开源。 [事实] 他把技术写作也视为开源的一部分,并认为写不清楚说明理解还不够。 [事实] 快问快答中,他说伯克利是印象深刻的地点,关键 bet 是“开源模型最后会赢”。

播客点评/总结

[推测] 本期最大价值在于把 vLLM 放进个人成长、伯克利开源传统、社区治理、商业化和 AI Infra 技术演进的连续脉络里,而不是只把它当作一个推理优化项目。

[推测] 技术部分的亮点是类比清晰:Token 与电、硬件与自然资源、模型与发电机、推理引擎与电力系统,让非纯系统背景的听众也能理解 co-design 为什么重要。

[推测] 局限是访谈跨度很大,从个人经历到基金会治理、融资、DeepSeek、MOE、Harness、芯片和 AI 历史观都有涉及,单个技术点很难展开到实现细节级别。

[推测] 这期适合关注开源基础设施、AI 推理系统、模型公司组织方式、DeepSeek 式 Infra 能力,以及想理解“为什么系统越来越决定算法上限”的技术从业者。