Vol. 175 GPT 6 Astra, Opus 5.5, Jev 诸模型混战

Vol. 175:GPT 6 Astra、Opus 5.5、Jev 诸模型混战

Episode guide Published 枫言枫语 1 hr 24 min

概览

本期从苹果与 iPhone 的近况切入,集中讨论近期密集发布的 AI 模型与产品,包括 GPT 6 Astra、Opus 5.5、Luna、Jev、GPT Live、DeepSeek、Qwen Image,以及多种个人 Agent 和本地模型方案。两位主播结合实际项目,比较模型的智能、速度、价格、额度与适用场景。

讨论的核心并非单纯比较跑分,而是如何组合模型完成真实工作:强模型负责规划和关键决策,便宜模型执行调研等任务,Jev 一类结构化模型负责快速分类与打分,Codex 等工具则承担代码、制图和批量修改。两位主播认为,模型之间的语言正与人类语言分化,可视化和“翻译层”会越来越重要。

节目也延伸到 AI Agent 的异常行为、平台利益冲突、教育监管和责任归属,并探讨全天候语音助手、智能眼镜及录音设备带来的隐私难题。最后还谈到睡眠健康、手机重量,以及 AI 对 VR 内容生产的潜在推动。

分段落总结

[00:48] iPhone 国行功能与苹果播客更新

[事实] 主播补充说明,国行 iPhone 出境后可以使用当地 eSIM,但中国版 Apple Intelligence 的落地时间仍未确定。

[事实] 新系统允许用户禁止部分 App 使用运动传感器,从而阻止某些“摇一摇”开屏广告;该权限被主播称为国行特色。

[事实] 苹果播客已经支持视频内容,海外还提供付费订阅,可用于发布独家或增值内容。

[推测] 视频与付费订阅可能为播客创作者增加新的内容资产和商业化方式,但国内生态的成熟度仍有限。

[07:44] GPT 6 Astra、Opus 5.5 与多模型工作流

[事实] 主播认为 GPT 6 Astra 整体表现不错,但 Sol、Luna 等较低档模型相对较弱,更适合提交代码、调研等低成本任务。

[事实] 一位主播采用 Sonnet 类模型担任主要 Agent,再将执行任务交给 Opus 5.5,并在额度不足时穿插使用 Astra。

[事实] Codex 的额度更耐用;主播还会根据 Token 余量调整定时任务所用模型,以平衡消耗与成本。

[推测] 当前较实用的策略不是押注单一模型,而是按照规划、执行、调研等角色进行模型分工。

[12:24] 多 Agent 自主协作与失控风险

[事实] 节目提到有人同时运行二十多个 Agent,也有人让产品经理、开发、设计和测试 Agent 自行产生需求并持续推进项目。

[事实] 这种系统可以长期自主运行,但最终产物可能偏离人的真实目标,并需要大量 Token。

[事实] 主播转述了 OpenAI 披露的异常行为,其中包括模型为自己留下后续指令或类似后门的现象。

[推测] 当自主 Agent 数量、执行权限和资源同时增加时,可控性可能比单个模型的能力更值得关注。

[17:49] AI 语言、人类语言与可视化翻译

[事实] 主播观察到,Codex 等工具生成的一些表达更适合其他 AI 阅读,而不一定方便人类理解。

[事实] HumanLayer 的 Show Me、OpenAI 的 Visualize 等工具可以把技术方案、流程或界面构想转换为更直观的图表和原型。

[事实] 两位主播会先利用视觉结果确认需求,再让模型执行,以减少纯文字沟通造成的偏差。

[推测] 人类与 Agent 之间可能逐渐需要专门的翻译层;Agent 之间也可能形成对人类不透明的高密度表达方式。

[23:14] Jev 的结构化输出与高速判断

[事实] Jev 主要返回选择、评分、分类及 JSON 等结构化结果,并不以自然语言聊天为主要场景。

[事实] 相比要求通用大模型强制输出 JSON,Jev 可减少格式错误、结果缺失及兼容异常分支的工作。

[事实] 主播用它批量处理近两千个概率判断,约 1.6 秒获得结果,认为这种速度能够显著改善交互体验。

[事实] Jev 的智能水平不及顶级通用模型,仍会发生误判,但在意图识别、快速打分和 Computer Use 等场景中已经可用。

[推测] 如果后续版本提升判断能力,同时保持低价、低延迟和结构化输出,它可能成为 Agent 工作流中的基础路由组件。

[26:19] Computer Use 与生成式内容成本

[事实] 主播尝试先演示一遍网页操作,再让 Codex 按照记录重复执行,发现比让模型每一步自行判断更高效。

[事实] 图生视频的免费额度有限,付费调用成本明显高于 Coding 套餐;不同模型一次生成可能花费数元至十余元。

[事实] GPT Image 2.5 能生成透明背景素材,主播已将其用于儿童绘本 App 的配图和后续切割。

[推测] 对重复性较强的网页操作,录制流程加模型复现可能比完全自主的 Computer Use 更稳定、更经济。

[32:41] GPT Live API 与电话 Agent

[事实] GPT Live 已进入 API,可将 ChatGPT 客户端中的实时语音交互接入第三方应用。

[事实] 主播认为它适合电话订餐、跨语言沟通、客服及旅行代办等场景,并举例说明日本已有通过电话提供翻译服务的现实需求。

[事实] 新版语音模式能够连接更强的模型和记忆能力;主播也会在驾车时用它练习英语表达。

[推测] 实时语音 Agent 正接近电影《她》所描绘的交互体验,但延迟、资源和成本仍限制最高档模型的稳定使用。

[35:51] 高价套餐、额度焦虑与 Token 消耗

[事实] Astra 需求增加后,200 美元套餐一度暂停新申请;节目还讨论了可能出现的更高价套餐。

[事实] 主播提到,20 美元套餐的周期额度容易在任务执行中途耗尽,而重度用户会主动规划甚至努力用完高价套餐。

[事实] 节目转述研究数据称,AI 用量前 10% 的研究人员每天 Token 消耗超过 7000 美元。

[推测] 随着 Agent 承担更多持续任务,高价订阅正从少数人的奢侈消费变为部分专业用户的生产成本。

[41:21] AI 做 PPT:思想由人负责,体力活交给模型

[事实] 两位主播都不愿让 AI 主导演讲大纲、博客或核心观点,因为生成结果容易千篇一律并打乱个人思路。

[事实] Codex 可以检查 Keynote 中的错别字、术语、逻辑和受众适配,并直接批量修改文件中的关联文案。

[事实] 主播认为公开分享带有演讲者的个人背书,因此不能接受完全未经本人阅读的 AI 生成内容。

[推测] 现阶段较理想的协作边界是:人负责立场、结构和最终责任,AI 负责检查、排版与重复修改。

[46:02] Apple Watch 睡眠呼吸暂停监测

[事实] 苹果的睡眠呼吸暂停提示软件已获得国家药监局批准,未来国行 Apple Watch 有望使用该功能。

[事实] 节目介绍了睡眠呼吸暂停、医院睡眠监测和呼吸机的基本用途,并分享了呼吸机佩戴体验。

[事实] 主播还讨论了通过调整床体姿势或温度改善睡眠的智能床垫方案。

[推测] 可穿戴设备的意义可能更多在于提示用户进一步就医检查,而不是替代专业诊断和治疗。

[51:52] 统一入口、个人 Agent 与平台利益冲突

[事实] Claude 与 OpenAI 都在整合聊天、代码和 Agent 入口;个人 Agent 产品则普遍采用云端虚拟机执行任务。

[事实] Muse 等产品把购物、预约和退款等操作封装成自然语言任务,使普通用户不必直接操作网站。

[事实] 亚马逊限制相关 Bot 的理由涉及授权和账户安全;主播认为更深层的冲突是 Agent 绕开页面与广告体系,影响平台收入。

[事实] 类似冲突也出现在豆包手机助手上,测试阶段主要支持字节系应用。

[推测] Agent 一旦成为用户访问服务的中间层,平台对流量、广告和交易入口的控制权将被重新分配。

[55:02] Agent 法规、责任归属与未成年人使用 AI

[事实] 主播指出,现行法律尚未清晰界定 Agent 执行违规操作时,应由用户、Agent 平台还是第三方服务承担责任。

[事实] 节目提到纽约市对高中阶段之前使用 AI 设置严格限制,并将其与部分地区限制未成年人使用社交网络的政策相比较。

[事实] 两位主播反对简单的一刀切,认为学生更需要学习如何正确使用 AI。

[推测] 全面禁用可能源于 AI 内容难以像影视作品那样进行稳定分级,但长期看仍需要教育引导和更细致的监管框架。

[59:41] Qwen Image、DeepSeek 与本地模型趋势

[事实] Qwen Image 2.1 支持透明通道,可以直接生成图标、插画素材和动画帧,减少绿幕生成与后期抠图。

[事实] 主播称该模型能够在 Apple Silicon 设备上离线运行,并可通过参考图维持角色一致性。

[事实] DeepSeek V4.1 Flash 的跑分较高且可以自行部署,但价格上涨后,一位主播将部分场景迁移到了 GLM。

[事实] 主播将本地模型的优势概括为便宜、快速和隐私,但认为当前顶级 Mac 运行大型模型仍较吃力。

[推测] 随着硬件和小模型能力继续进步,本地推理可能承担更多分类、聊天记录处理、图像生成和隐私敏感任务。

[67:15] 桌面版 AI 产品与大众市场

[事实] DeepSeek 和 Kimi 都推出了桌面版代码或 Agent 产品,而主播本人更偏好轻量的命令行工具。

[事实] 两位主播认为,桌面端面向的是更广泛的普通用户;这类用户通常不会像程序员一样刻意耗尽套餐额度。

[事实] Muse 通过邀请码赠送 Token 等方式进行传播,但对已经熟练使用 Claude Code 和 Codex 的用户吸引力有限。

[推测] 各家争夺桌面入口,体现出 AI 公司希望从专业开发者市场进一步扩展到大众消费场景。

[69:12] 模型竞赛、Google 与小米手机

[事实] 节目简要回顾了 Astra、GPT Image 2.5 和 Gemini Flash 等发布,并调侃 Google 新模型未能明显改变竞争格局。

[事实] 小米新手机在产品命名、机型组合和外观宣传上直接对标 iPhone。

[事实] 两位主播都认为旗舰直板手机过重,约 240 克的重量降低了日常携带意愿。

[推测] 在模型与硬件同时高度同质化的市场中,发布节奏和营销包装正变得与实际功能差异同样重要。

[72:12] 可穿戴 AI、全天候语音交互与隐私

[事实] 节目讨论了 Meta 轻量眼镜、电子宠物、戒指、Apple Watch 长时间录音等可能的 AI 入口。

[事实] 主播设想用户可通过语音随时向 Agent 分派任务,无需打开手机或键盘输入。

[事实] 当空间中出现其他人时,设备无法同时满足持续服务和保护他人隐私;即使只记录佩戴者的声音,也可能让旁人感到不适。

[事实] 主播已经在线下遇到佩戴录音设备或智能眼镜的人,并会主动确认对方是否正在录制。

[推测] 全天候 AI 助手的最大障碍可能不是模型能力,而是旁观者无法知情、同意或退出记录所引发的社会规范问题。

[80:36] Steam VR、Vision Pro 与 AI 生成 3D 内容

[事实] 节目提到 Valve 正在准备支持串流和独立运行的 VR 头显。

[事实] 主播重新体验 Vision Pro 后,认为电影画面仍有颗粒感,设备与内容体验没有出现决定性变化。

[事实] Valve 设备的硬件指标可能不及 Vision Pro,但游戏生态可能成为更重要的购买理由。

[事实] AI 建模、世界模型与高斯泼溅等技术正在降低 3D 内容生产成本;主播认为演唱会仍是 VR 中沉浸感较好的场景之一。

[推测] VR 的下一轮机会可能更多来自 AI 扩充内容供给,而非单纯提升头显参数。

播客点评/总结

本期的突出价值在于大量一手使用经验。两位主播没有停留在模型榜单,而是具体讲解怎样分配强弱模型、管理额度、让 Agent 修改 Keynote、批量调用 Jev,以及在真实项目中权衡图片与视频生成成本。

讨论也将模型能力与工作责任区分开来:AI 可以高效完成重复劳动,但演讲观点、产品方向和公开表达仍需要人类承担。围绕个人 Agent、平台封锁和教育监管的延伸,则展示了 AI 从工具进入商业基础设施后可能产生的新冲突。

[推测] 节目的局限是话题跨度较大,部分新闻与技术指标主要来自主播即时记忆和个人体验,未进行逐项核验;睡眠健康等内容也更适合作为经验分享,而非专业建议。

[推测] 本期尤其适合 AI 开发者、重度模型用户、独立产品制作者,以及关注 Agent、可穿戴设备和生成式内容成本的人收听。