AI 不只比智商,WAIC 和 Kimi K3 透露了什么新竞争
AI 不只比智商,WAIC 和 Kimi K3 透露了什么新竞争
概览
本期从 WAIC 的“云看展”聊起,核心问题是 AI 行业正在从“谁的模型更强”转向“谁能真正落地、变现、进入产业流程”。主播认为,今年的展会观感和去年相近,但更明显地集中到应用化、产业化和商业闭环。
节目用具身智能、生态馆小应用、Kimi K3 实测、开源与开放权重争议、AI 编程和语音转文字服务几个案例,讨论了 AI 落地的现实约束:壁垒、客户、稳定性、成本、路由、工程优化和生态选择。
关键结论是:顶级模型仍有价值,但不应成为所有场景的默认答案。真正的竞争不只在模型“智商”,还在能否用合适的模型组合、工程系统和成本结构,把 AI 放进真实业务里持续运行。
分段落总结
[00:15] 开场与 WAIC 信息来源
[事实] 本期由两位主播讨论 WAIC,原计划邀请看完整个 WAIC 的听友李辰,但对方因生病未能参加。 [事实] 主播结合李辰的公众号观感、自己去年参会经历以及相关报道来讨论今年 WAIC。 [推测] 本期不是现场报道,更像是基于展会反馈和产业观察展开的评论节目。
[02:12] WAIC 的主线转向落地
[事实] 主播认为今年 WAIC 与去年观感差不多,但更明显的趋势是寻求落地、变现、产业化和应用化。 [事实] 节目提到,AI 宣传和真实落地之间存在很大 gap,外界讨论常在“万能”和“傻子”两个极端之间摇摆。 [推测] AI 行业正在从模型能力展示期进入商业验证期。
[03:30] 大厂、算力与展馆观感
[事实] 大厂展区多以产品展示、展板和屏幕为主,难以让观众深入理解具体能力。 [事实] 算力馆中,华为展示了集群,但主播认为真正能买单的公司并不多。 [推测] 展会热闹不等于产业成熟,很多展示仍停留在“可看见”而非“可购买、可部署”的阶段。
[05:23] 具身智能仍离自主工作很远
[事实] 主播认为具身智能机器人相比去年进步不大,很多仍是遥控或单一行为演示。 [事实] 李辰文章中提到,具身馆约 200 家企业里 150 家是遥操,不足 5 家具备自主任务规划能力。 [事实] 节目也提到,机器人零部件国产化率已经较高,约 75% 基本国产。 [推测] 具身智能的供应链进展快于自主能力进展。
[08:26] 生态馆暴露 AI 应用壁垒问题
[事实] 主播提到生态馆里有许多小格子展位,展示小型初创企业和应用项目。 [事实] 他们认为很多 AI 应用壁垒不高,因为能用 AI 做出来的东西,别人也可能用 AI 复制。 [事实] 节目强调行业 know-how、数据积累和客户理解才是核心壁垒。 [推测] AI 降低了开发门槛,也同时压低了很多应用的护城河。
[11:47] AI 更擅长提效,不擅长替你找方向
[事实] 主播认为,如果一个问题过去投入大量资源也找不到最优解,不应指望 AI 必然找到最优解。 [事实] AI 编程被认为可以让有经验开发者达到约 1 比 10 的效率提升。 [事实] 生态馆项目仍常回答不了“客户在哪”,融资也不像早年 App 创业那样容易。 [推测] 没有客户和商业闭环的 AI 应用,更可能只是工具生意,而不是高增长 VC 项目。
[15:01] Kimi K3 实测:用 Agent 写 Agent
[事实] 主播购买了 Kimi K3 套餐,并让它写一个面向播客主播的对话 Agent。 [事实] 这个 Agent 目标包括根据播客话题做新闻搜索、生成调研报告、再进一步产出提纲。 [事实] 主播称 K3 没有误读需求,还主动提出了多话题提纲冲突如何处理等问题。 [事实] 这个任务约用了 3 小时,消耗约 25 万 token。
[18:02] K3 的优点、短板和成本
[事实] 主播认为 K3 最大问题是慢,完成同样任务消耗 token 也比其他模型多。 [事实] 主播认为它能力略低于顶级 GPT 模型,但已经够用,并且在不同层面与其他模型各有所长。 [事实] 节目提到 K3 的 token 价格大约是 Claude 一类模型的六七折,不像 DeepSeek 那样便宜。 [推测] K3 更适合能容忍慢速、但希望完成复杂工程任务的场景。
[20:33] 模型差距缩小,规划比迷信模型更重要
[事实] 主播试过多个国内外模型,认为只要架构、分层、模块和约束写清楚,多数模型都能完成互联网应用开发。 [事实] 模型差异主要体现在速度、推理链长度、前端效果、bug 数量和需要来回修正的轮次。 [事实] 节目提到某些偏门场景,如嵌入式或特定 UI 开发,不同模型差异会更明显。 [推测] AI 编程的核心竞争力正在从“选唯一最强模型”转向“把任务定义清楚”。
[24:09] 多模型协作与慢模型的后台价值
[事实] 主播介绍了“一个模型写、一个模型 review”的工作方式,并限制昂贵 review 模型的输出以控制成本。 [事实] K3 因为慢,被用来在后台整理历史项目、补文档、补注释、做架构分析和问题报告。 [推测] 慢模型不一定没价值,只要任务不要求实时返回,就可以承担批处理和维护类工作。
[29:21] 开放权重与开源争议
[事实] 节目提到 K3 将在 7 月 27 日开放权重,并解释“开放权重不等于开源”。 [事实] 主播认为开放权重意味着可下载和自部署,但不是开放训练代码、训练素材和完整流程。 [事实] 节目讨论了 OpenAI 相关人士主张监管开源模型、限制美国企业使用中国模型的观点。 [推测] 国产开放模型追近后,会削弱闭源厂商的定价权和垄断叙事。
[36:16] AI 落地要先看稳定性、成本和路由
[事实] 主播认为真正做 AI 应用时,首先要考虑稳定性、模型调用效率和服务成本。 [事实] 他们提到一种常见做法:先用小模型判断用户意图,再把任务路由到不同模型或工具。 [事实] 对播客 Agent 来说,系统要区分用户是要写提纲、做备调还是事实核查,并按复杂度选择模型。 [推测] 成熟 AI 产品更像一套多模型工程系统,而不是简单调用一个最贵 API。
[40:50] 顶级模型的价值在泛化和造工具
[事实] 主播认为写代码时会用顶级模型,不只是因为参数量,而是因为泛化能力和解决未知问题的能力。 [事实] 当模型不知道某个硬件或库时,它可以搜索文档、学习后再给出答案。 [事实] 主播认为 SOTA 模型未来更适合写代码、自举、造工具和处理难题,工具运行时不一定需要调用最贵模型。 [推测] 未来产品可能是“开发时用顶级模型,交付时用便宜模型组合”。
[44:42] 知识库与 AI 记忆
[事实] 主播会让模型在一天工作结束后总结当天工作,并写入 knowledge 文件夹。 [事实] 这样模型下次遇到类似问题时,可以回看之前的资料和踩坑记录。 [事实] 节目提到,现在模型一旦上下文被删除就容易忘记,仍需要显式知识沉淀。 [推测] 长期记忆和项目知识管理会成为 AI 编程工具的重要能力。
[55:38] 工程优化成为新竞争焦点
[事实] 主播认为近半年工程优化能力越来越重要。 [事实] 节目提到 DeepSeek、Kimi 等模型都强调通过工程优化提高效率、降低训练成本。 [事实] 主播认为只堆参数、秀肌肉而不考虑成本,难以支撑真实商业落地。 [推测] AI 竞争正在从“更大模型”转向“更低成本地完成足够好的任务”。
[63:45] 语音转文字案例说明降本价值
[事实] 主播分享了自己做语音转文字服务的经历,曾做微调、后训练和工程优化。 [事实] 他发现数据标注和模型微调成本较高,而工程优化能更直接降低成本。 [事实] 转写一小时音频的成本从约六毛钱降到不到一毛钱,后续还可通过批量处理继续优化。 [推测] 在真实产品中,用户有时更在意便宜、稳定、够用,而不是单点准确率极限。
[70:02] 企业 Agent、国产模型和生态竞争
[事实] 主播认为通用工作智能体可用于写 PPT、总结等白领 paperwork,但企业业务还需要专用 Agent、API 或定制模型。 [事实] 节目认为开源模型即使不能完全赶上闭源,只要能完成 80% 工作,就会改变用户选择和定价权。 [事实] 主播还讨论了国际 AI 合作组织、新兴市场、AI 原生用户、中国模型和国产 GPU 生态的潜在影响。 [推测] AI 竞争不只发生在模型榜单,也发生在标准、价格、开发者、硬件和国际市场生态中。
播客点评/总结
[推测] 这一期的价值在于把 WAIC、Kimi K3 和 AI 编程体验串到同一个问题上:AI 到底怎么从演示变成生产力。它没有停在模型排行,而是反复追问成本、稳定性、客户和工程系统。
[推测] 节目的亮点是案例具体,尤其是 K3 写播客 Agent、用慢模型整理历史项目、语音转文字降本这些经验,让“AI 落地”不只是抽象判断。
[推测] 局限是部分外部判断来自主播观察、朋友圈反馈和他人文章,严格事实核验不足;但作为行业观察节目,它适合正在做 AI 应用、AI 编程或企业内部智能体落地的人听。