E255|模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔
模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔
概览
本期围绕一个核心落差展开:大模型在通用榜单上的成绩不断接近满分,但这种进步并未等比例转化为用户在真实商业经营中的效率提升。张阔认为,编程任务高度数字化、结果容易验证,而电商经营涉及多平台数据、供应链协作、长期反馈和开放式决策,因此商业 Agent 仍处于早期阶段。
阿里国际站尝试让 Accio Work 从搜索工具扩展为覆盖市场调研、产品设计、供应商匹配、物流、商品发布和经营分析的垂直 Agent。其关键不只是接入更强的模型,而是同时优化模型、执行系统与业务上下文,并根据任务难度在不同模型之间进行路由。
为了衡量 Agent 的实际能力,团队从真实经营数据中整理出 107 个电商任务。最前沿模型在该评测中的通过率只有约 61%,说明通用榜单成绩不能直接代表商业任务完成能力。讨论最终落在人机分工上:AI适合承担重复执行、信息整理和持续监测,但采购、产品品味、资源配置与长期经营目标仍应由人决定。
分段落总结
[00:00] 模型进步为何没有变成用户可感知的进步
[事实] 新模型不断刷新各类榜单,但用户在实际工作中未必感受到同等幅度的提升。
[事实] 从产品创意到全球销售,电商经营需要完成市场研究、寻找工厂、比较报价、物流安排、多平台上架和利润核算等一系列工作。
[事实] 本期讨论的核心,是AI目前能够接手这些工作的哪些部分,以及会在哪些环节遇到障碍。
[01:48] 编程 Agent 与商业 Agent 的能力差距
[事实] 张阔估计,AI编程工具在研发人员中的渗透率已经非常高,而其他垂直工作场景远未达到类似水平。
[事实] 编程任务完全数字化,训练数据丰富,并且可以通过编译和测试快速验证结果。
[事实] 商业经营的数据更加多元,缺少统一流程,不同企业对结果好坏的定义也不相同。
[事实] 商业结果往往需要数天、数月甚至一年才能验证,反馈闭环明显长于编程任务。
[推测] 商业 Agent 的主要瓶颈不只是模型智力,还包括目标定义、结果验证和长期反馈机制。
[04:26] 从AI搜索走向完整的电商经营链路
[事实] 产品最初主要解决AI搜索问题,让买家通过自然语言或多模态方式表达采购需求。
[事实] 张阔称,平台整体搜索增长约20%,多模态搜索增长约130%。
[事实] 搜索能力随后向前延伸到市场调研和产品设计,向后延伸到供应商沟通和交易完成。
[事实] Accio Work进一步尝试管理多平台经营、供应链以及企业员工的日常表现。
[推测] 产品定位正在从回答问题的搜索入口,转向能够跨系统执行任务的经营工作台。
[06:21] 从产品创意到全球销售的案例
[事实] 一位名为Edward的商家希望开发能够反馈植物状态的消费电子产品,但从创意到可制造的设计方案存在较高门槛。
[事实] Agent可以协助制作设计方案、匹配广州和深圳的电子产品厂商,并处理船期、海关编码和物流管理等跨境环节。
[事实] 产品完成后,Agent还可以协助生成社交内容,并管理Amazon、eBay、Shopify和TikTok等平台的商品发布、定价与用户反馈。
[事实] 传统供应商筛选可能需要维护包含约20列信息的表格,并花费一个多月反复沟通;张阔称,Agent可将部分流程缩短至约24小时。
[推测] 这类 Agent 的价值不仅是节省搜索时间,还在于把模糊创意转换成供应商能够理解和执行的结构化需求。
[10:50] 中美企业软件生态与AI产品形态
[事实] 美国已经形成CRM、广告、法律和医疗等领域的成熟垂直SaaS生态,中国则更多由大型平台集成多种经营功能。
[事实] 张阔认为,通用AI难以直接理解每家企业不同的经营目标、组织关系和业务上下文。
[事实] 传统SaaS掌握企业经营流程和上下文,接入更好的AI后也可能获得更好的结果;现阶段更可能出现AI与既有软件互相集成的过程。
[事实] 中国和美国电商在独立站、平台经营及客户关系管理方式上存在差异,但最终向商家交付的价值相近。
[推测] 垂直 Agent 的竞争优势可能更多来自对既有业务系统和数据的嵌入,而不是单纯拥有某个模型。
[15:21] Agent能力是模型、执行系统与上下文的乘积
[事实] 张阔将 Agent 概括为“模型 × Harness × Context”,任何一项缺失都会显著影响最终效果。
[事实] Harness需要连接工具、管理记忆与用户授权,并保障系统能够持续执行长程任务。
[事实] Context包括企业经营数据、买卖双方的历史沟通、平台积累的行业信息和趋势。
[事实] 不同国家接入的工具、平台和经营环境不同,因此Harness和Context仍需进行区域化适配。
[事实] 阿里长期积累的跨境电商、采购和供应链数据,被视为其构建垂直 Agent 的上下文优势。
[18:02] 垂直 Agent 需要全栈协同优化
[事实] 团队目前同时投入模型、Harness和Context,而不是只依赖通用前沿模型。
[事实] 电商经营可能连续数月执行,系统需要持续跟踪任务并根据结果不断优化。
[事实] 模型训练、推理服务和Harness需要联合优化,才能同时改善准确率、效率和成本。
[事实] 张阔认为,垂直 Agent 并非在通用模型上增加简单提示词就能获得理想结果。
[推测] 垂直 Agent 的壁垒更接近一套持续运行的业务系统,而非某个静态模型或单一功能。
[20:40] 107个真实任务揭示榜单与经营能力的落差
[事实] 团队基于阿里巴巴国际站上百万条真实经营数据及产品问答数据,整理出107个电商任务,并将评测集开源。
[事实] 一些通用榜单成绩已经接近99分,但这些成绩与模型能否完成电商任务并没有很强的相关性。
[事实] 张阔称,当前最前沿模型在该评测中的通过率只有约61%。
[事实] 任务按L1至L4划分,任务越长程、结果越开放,能够通过的模型越少。
[事实] 约61%的通过率指无人干预情况下的完整任务完成率,并不意味着工具在有人协作时不可使用。
[24:43] 评测覆盖采购、物流与纠纷处理
[事实] 一类任务要求模型从多份供应商报价中识别有效信息和钓鱼内容,计算含物流、税费在内的到手价,并选出合适供应商。
[事实] 另一类任务要求模型根据起止点和交期在船运公司网站完成订舱,只有成功执行才算通过。
[事实] 纠纷任务要求模型判断买卖双方材料是否完整、是否需要补充信息,以及赔付结论是否合理。
[事实] 评测共覆盖七大类任务,并会持续加入更复杂的问题,以避免产品升级后旧有能力退化。
[事实] 张阔将“商业领域的AGI”定义为:在预算和供应链条件相同的情况下,Agent经营能够比人完成日常操作获得更多收益。
[27:40] AI负责高频执行,人保留关键决策
[事实] 采购付款等需要对经营结果负责的最终操作,仍必须由人确认。
[事实] Agent适合汇总多个平台的投入、收入、退换货和利润数据,形成实时经营报表。
[事实] Agent可以根据不同平台的规则批量发布、更新商品,执行促销操作,并由商家选择审核后发布或授权自动发布。
[事实] AI还可以分析客服对话、识别更有效的回复方式,并对可能流失的B2B订单提前预警。
[事实] 产品创意是否解决真实问题、目标客户是否愿意付费、库存和广告如何分配,以及产品品味和市场节奏,仍需要人的判断。
[31:24] 能力提升也会不断抬高商家预期
[事实] 产品上线初期,用户主要提交问答类的L1任务,随后逐步转向执行任务、复杂任务和经营判断相关任务。
[事实] 商家希望把更多重复工作和经营数据交给AI,让它持续执行并辅助判断。
[事实] 尽管任务复杂度不断上升,张阔仍强调最重要的商业判断需要由人完成。
[推测] 用户对模型升级“没有感觉”的另一原因,是模型能力提高的同时,用户交付给AI的任务也在迅速变难。
[33:44] 模型路由与“用得起的AI”
[事实] 系统会根据任务难度和模态要求,将工作路由到小尺寸、高性价比或更强的前沿模型。
[事实] 经过后训练的小尺寸模型,在部分任务上的效果可以接近顶级前沿模型,更适合承担大量简单工作。
[事实] 张阔认为,日常经营使用的AI必须具备可承担的成本,否则难以大规模落地。
[事实] 团队通过模型路由、集中采购以及Harness和Context优化来降低执行成本,并建议用户使用自动模型选择。
[事实] 新模型在3D或计算机操作等单项能力上的突破,并不代表其商业 Agent 能力同步增强,仍需通过专业评测验证。
[37:34] 垂直流程、Agent冲突与经营目标
[事实] 垂直 Agent 会先明确不能触碰的红线,但不会把完成任务的路线完全固定,而是围绕目标持续优化执行流程。
[事实] 不同平台的 Agent 给出不同建议是正常现象,因为各自掌握的上下文和优化目标不同。
[事实] Accio Work希望站在商家整体账目的角度优化多平台投入,而不是只优化某一个平台的表现。
[事实] 商家需要先明确追求毛利、规模还是速度,再判断不同 Agent 的建议是否符合整体目标。
[事实] 最终的商品判断、问题优先级和商业节奏仍由经营者决定,AI主要用于释放重复劳动。
[40:06] 云端运行不等于真正的长程能力
[事实] 张阔认为,上云主要解决记忆同步、跨设备操作和持续在线等基础需求,本身不构成显著的技术差异。
[事实] 商业长程任务包括每日定时生成经营报告、根据供应商新回复持续推进沟通,以及跨季度复盘产品是否盈利。
[事实] 电商 Agent 需要持续检查员工工作、销售和客服对话、用户反馈及售后问题。
[事实] 单纯让模型连续运行数天而不崩溃没有意义,关键是它能否在特定场景中持续解决经营问题。
[推测] 衡量长程 Agent 的重点应从“运行了多久”转向“是否保持目标、利用新信息并产生可验证结果”。
[42:51] AI与全球供应链降低中小企业创业门槛
[事实] 张阔称,洛杉矶CoCreate活动约有1.5万人注册到场,并认为美国用户对AI和Agent产品理念的接受度较高。
[事实] 他举例称,一位15岁的英国创业者利用相关工具寻找供应商、开发降温产品系列,年销售额约为100万英镑。
[事实] 另一位创业者开发测量设备,从产品构想到寻找供应链均借助阿里国际站,其客户包括施耐德电气和SpaceX,生意规模达到数千万美元。
[事实] 张阔认为,中小企业过去的主要限制是资源和经验不足,AI与全球供应链结合可以帮助它们从创意走向规模化经营。
[推测] 如果这些能力能够以足够低的成本稳定交付,小团队可能获得过去只有大型企业才具备的跨境协作和运营能力。
播客点评/总结
本期最有价值的部分,是把“大模型是否更强”转化为“它能否在无人干预下完成真实任务”。107个电商任务、约61%的前沿模型通过率,以及按难度分层的评测方式,为理解榜单成绩与实际生产力之间的差距提供了具体框架。
讨论也清楚指出,商业 Agent 的落地依赖模型、执行系统和业务上下文的共同作用。模型路由、长程任务管理、跨平台数据整合与成本控制,都是用户最终能否感受到价值的重要条件。
[推测] 本期的局限在于,案例和成本数据主要来自产品提供方,缺少独立评测、失败案例及商家长期使用效果的对照,因此部分效果仍需更多外部数据验证。
这期内容适合关注AI Agent、电商平台、跨境供应链、企业软件和模型经济性的产品经理、创业者与投资者,也适合希望判断AI究竟能在经营流程中承担多少工作的商家。