快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互视频

2026-07-19 · Show: 十字路口Crossing · 2462s · Source

快一点!再快一点!快到世界能实时生成

概览

本期围绕 Vidu S1 和“实时交互视频生成”展开:如果未来人眼看到的视觉内容都由 AI 实时生成,核心瓶颈不只是堆硬件算力,还包括模型、算子、部署和调度层面的推理加速。

张金涛介绍了 Vidu S1 的能力:用户上传一张角色图、选择或克隆声音,就能像视频通话一样与角色聊天,并用语音实时控制角色表情、动作和肢体语言。S1 被描述为支持 540P、约 25 帧以上的长时间流式生成。

讨论从 SAGE Attention、TurboDiffusion 等推理加速工作,延伸到实时视频生成的技术挑战、中国 AI 视频模型的优势、AI 创业浪潮,以及张金涛个人在科研、管理和工程实践中的经历。

分段落总结

[00:00] 实时生成世界与 Vidu S1 开场

[事实] 主持人用“未来人眼看到的一切都可能是生成的”引出算力和实时生成问题。 [事实] 嘉宾张金涛在生数科技负责流式视频生成与推理部署相关工作。 [事实] Vidu S1 支持用图片创建角色、选择或克隆声音,并通过语音实时控制角色的视频表现。

[01:29] 张金涛的背景与职责

[事实] 张金涛 26 岁,清华大学博士在读。 [事实] 他在生数科技除 S1 项目外,还负责模型推理加速、集群部署、流式视频生成模型从数据到训练算法、推理工程化和评测的链路。 [事实] 加入生数前,他主要在清华做推理加速科研,并曾在 UC Berkeley 访问半年。

[02:40] SAGE Attention 的起点

[事实] 张金涛称,SAGE Attention 是他较早的重要工作,本质是一个更快的 Attention 算子实现,可替换大模型中的 Attention 计算。 [事实] 他认为早期语言模型中的 Attention 更多受 memory bound 限制,因此单纯加速计算收益不明显。 [事实] 多模态模型尤其视频生成模型中的 Attention 更偏 compute bound,因此 Attention 计算速度会直接影响模型速度。 [事实] 低比特 Attention 加速面临底层 GPU kernel 编写和精度敏感两类挑战。

[06:05] 从算子到模型再到部署的推理加速

[事实] 张金涛把推理加速概括为三个层面:算子层加速、模型计算复杂度降低、工程化和集群部署优化。 [事实] 模型层方法包括部署蒸馏、把 diffusion 生成步数从 50 步降到 4 步、稀疏 Attention 等。 [事实] 工程层涉及多卡并行、通信与计算 overlap、用户请求调度和大集群部署。

[08:23] TurboDiffusion 的定位

[事实] TurboDiffusion 被张金涛归为模型层面的加速工作,建立在 SAGE Attention 和更快线性层算子之上。 [事实] 它通过蒸馏、稀疏 Attention 微调等训练方法降低 diffusion 模型复杂度。 [事实] 张金涛称该工作当时基于开源视频生成模型和少量微调数据完成,GitHub star 有 3600 多个。

[10:34] SAGE Attention 的行业采纳

[事实] 张金涛称 SAGE Attention 已成为事实上的行业标准。 [事实] 他提到 NVIDIA、AMD、华为昇腾、摩尔线程、沐曦等硬件厂商都实现了自己的版本。 [事实] 他还称生数科技、字节、腾讯、Google 等多模态公司都在使用相关技术。

[11:18] 流式视频生成不只是“更快”

[事实] 张金涛强调,流式视频生成和普通视频生成范式不同:每一帧都要实时生成,生成速度必须超过播放速度。 [事实] 他认为核心挑战包括保证画质、长时间生成不漂移不崩坏,以及对实时输入作出正确反馈。 [事实] 他称 Vidu S1 能无限长生成,而他了解的先进基础模型通常最长只能生成 30 秒视频。 [事实] S1 被描述为可做到 540P、25 到 42 FPS,并能在消费级显卡上达到相应效率。

[13:56] S1 的取舍与收费

[事实] 张金涛说,S1 的首要目标是实时交互生成,因此必须优先保证生成效率。 [事实] 在效率前提下,团队再优化画面质量、输入响应准确度、长时间质量和一致性。 [事实] 如果必须排序,当前阶段画质会相对更容易让步。 [事实] 网页和 App 平台当时免费开放,API 平台收费,价格被描述为每分钟约两三元。

[15:13] 实时交互视频的需求判断

[事实] 张金涛把视觉娱乐分为离线生成视频和在线实时交互视频两类。 [事实] 他认为实时交互类视觉娱乐包括对话、恋爱、游戏和日常生活场景,需求比预制离线视频更大。 [事实] 他判断未来视觉娱乐信号会被 AI 生成内容充斥或替换。 [推测] 这一判断意味着他把 S1 视为面向个体化、独立 session 的新型娱乐基础设施,而不只是视频生成工具。

[17:21] 首批用户玩法与视频理解

[事实] 张金涛提到,S1 发布后已有用户上传宠物图片,与自己的小狗进行聊天和交互。 [事实] S1 支持视频理解,可以打开摄像头或输入视频信号。 [事实] 他举例说,有用户把游戏画面传给 S1,让虚拟角色陪自己玩游戏并根据画面反馈。 [事实] 主持人进一步提出把电脑桌面或 coding 界面作为视频流输入,张金涛确认模型可以看到画面和文字并给出反馈。

[19:55] 推理加速的领域版图

[事实] 张金涛认为,不考虑芯片设计时,推理加速既包括让算子在特定硬件上跑得更快,也包括降低模型本身的计算复杂度。 [事实] 降低复杂度的方法包括稀疏 Attention、MoE 架构、模型蒸馏和采样步数蒸馏。 [事实] 他提到 vLLM 更偏调度和管理,TurboServe 面向自回归流式视频生成模型的集群部署和调度。 [事实] 他还提到语言模型和 diffusion 模型中若干稀疏 Attention、线性 Attention、开源框架相关工作。

[24:34] 推理加速的未来:底层与上层

[事实] 张金涛认为单个算子在硬件上的优化会逐渐收敛,未来更重要的是更底层和更上层。 [事实] 底层包括通用高性能芯片,或针对某一类模型的定制化但仍有一定通用性的芯片。 [事实] 上层指算法层降低模型计算复杂度,让不同请求不必完整计算每一层和每个算子。 [事实] 他认为优秀的推理加速工作需要硬件和算法 co-design,只做算法层壁垒相对不足。

[28:17] 中国 AI 视频模型的优势解释

[事实] 张金涛认为 Transformer 之后建模方式趋于收敛,数据变得更本质。 [事实] 他强调数据量、数据质量、是否对齐人类偏好、以及数据是否以易学习的方式构造,都会影响视频模型能力。 [事实] 他认为美国视频生成公司的数据在数量、质量、偏好对齐和构造方式上不如国内公司。 [事实] 他还提到抖音、小红书、直播电商等行业发展,为国内积累了更多视觉娱乐相关数据和动机。 [推测] 他的解释更偏向数据工程、应用生态和文化需求共同塑造中国视频模型优势。

[31:19] AI 创业、管理与世界领先

[事实] 张金涛认为 AI 不是泡沫,因为它能满足大量人类需求,方向本身是正确的。 [事实] 他认为 AI 创业热潮合理且会持续很久,也不是一家公司能把所有事情做完。 [事实] 他同时强调,不是所有技术强的人都适合创业,管理、协调和判断同样重要。 [事实] 他把“世界领先”理解为知道正确方法,并把每个环节、每一行代码都正确实现到极致。

[35:25] 个人成长与科研快乐

[事实] 张金涛说自己小时候数学强、语文相对弱,后来意识到沟通、表达和理解情绪的重要性。 [事实] 他很享受把复杂问题讲清楚,尤其是在论文中凝练 motivation、challenge、solution 和 contribution。 [事实] 他回忆做 SAGE Attention 时,曾将模型中的 Flash Attention 替换为 SAGE Attention,生成结果像素级一致,但推理速度快了一倍多。 [事实] 他感谢朱军老师和陈建飞老师,也提到自己现在带团队时有类似创业的感受。

播客点评/总结

[推测] 这一期的价值在于,它不是只介绍一个新产品,而是把 Vidu S1 放进“实时生成世界”的技术链条里讨论:算子、模型、部署、调度、芯片和应用场景之间的关系都被串了起来。

[推测] 节目的亮点是张金涛对推理加速的分层讲解比较清楚,尤其说明了为什么实时交互视频不能简单理解成“普通视频生成更快一点”。

[推测] 局限是许多关键技术细节没有展开,例如 S1 如何具体解决长时间不漂移、噪声强度控制和 Attention 设计等问题,更多停留在方向性描述。

[推测] 本期适合关注 AI 视频生成、多模态模型部署、推理加速、AI 创业和技术团队管理的听众;如果只想了解普通用户玩法,也能从 S1 的应用案例中快速获得直观印象。