E253|谁在给大模型出题、卖题、判卷?聊聊AI数据行业的野蛮生长

谁在给大模型出题、卖题、判卷?聊聊AI数据行业的野蛮生长

Episode guide Published 硅谷101 58 min

概览

本期节目讨论大模型数据行业如何从传统人工标注,转向专家评分标准、真实工作流和强化学习环境。随着模型开始操作软件、调用工具并完成长程任务,数据供应商交付的不再只是问答样本,而是包含任务、工具、沙盒和验证机制的一整套训练环境。

两位嘉宾重点拆解了 rubric、RL environment 和 benchmark 之间的关系:rubric 用于描述成果应满足的条件,环境提供执行空间,验证器则判断任务是否完成。评测既能揭示模型与目标能力之间的差距,也可能诱发数据污染、榜单刷分和奖励投机。

讨论进一步延伸到数据采购、垂直行业和商业模式。医疗、药物研发、芯片设计、游戏开发等领域的核心障碍,不只是缺少标注人员,还包括私有数据库、商业软件版权、真实项目以及高水平专家的知识难以获得。嘉宾认为,数据公司的长期竞争力将取决于采购、研发和持续发现新任务的能力,而非依赖某一种数据产品长期获利。

分段落总结

[00:00] 大模型数据生意为何受到关注

[事实] 随着模型能力提升,模型公司对训练数据的要求变得更加复杂和具体,硅谷出现了一批快速增长、估值高昂的数据公司。

[事实] 数据工作已从图片标签和回答打分,扩展到邀请行业专家设计任务、编写 rubric,并搭建可供 AI 操作软件和接受反馈的强化学习环境。

[事实] 本期希望回答数据公司究竟出售什么、模型公司为何愿意付费,以及榜单分数提高究竟代表能力提升还是单纯刷分。

[03:34] 嘉宾与 Agent’s Last Exam

[事实] 何韵中在 Scale AI 从事后训练和评测研究,将公司的部分工作概括为向大模型行业提供数据和研究方法。

[事实] 孙一游在加州大学伯克利分校从事智能体评测研究,参与 Agent’s Last Exam 项目。

[事实] 该项目当时公开了约150个任务,覆盖50多个细分行业,并计划在后续版本中扩展到1000多个任务。

[05:02] 数据公司的不同出身与组织模式

[事实] 嘉宾将市场参与者分为招聘平台转型者、传统众包数据公司、合成数据团队、垂直行业公司和版权数据经纪商等类型。

[事实] 大型供应商试图覆盖多类需求,小团队则可能专注代码、工具调用或某个垂直行业。

[事实] 全职团队通常质量更稳定但灵活性较低;依赖众包网络更容易快速扩张,却需要更强的人员筛选和质量控制。

[推测] 数据公司的组织基因会影响其核心优势:有的擅长招募专家,有的擅长工程合成,有的则掌握行业关系或私有数据。

[07:41] 从人工标注转向 Agentic Data

[事实] 嘉宾观察到,行业兴趣在一年多时间里迅速从 rubric data 转向 RL environment。

[事实] 预训练仍然重要,但在推理模型和强化学习取得进展后,研究者开始把更多注意力放在可验证的后训练任务上。

[事实] 代码和数学具有相对清晰的正确答案,因此较早成为强化学习训练的主要领域;医疗、金融和指令遵循等任务的答案则更难结构化。

[09:57] Rubric、弱监督与强化学习环境

[事实] Rubric 是专家提前写出的评分规则,使较弱的模型也能依据这些规则检查更强模型的答案,这被嘉宾称为 weak-to-strong supervision。

[事实] 当任务从生成文本发展到操作工具时,验证范围会扩展到数据库是否被修改、变量是否正确变化、文档是否生成等状态。

[事实] 完整环境通常包括任务说明、工具、执行沙盒以及与任务相关的验证方式;验证既可能是程序检查,也可能使用 rubric 或人工偏好。

[事实] 不同项目尚未形成统一方案,有的只接受程序化验证,有的则需要多种验证机制结合。

[12:24] Agent’s Last Exam 与“有意义的刷分”

[事实] Agent’s Last Exam 的目标是把代码领域中“任务可验证、提升可衡量”的思路推广到更多职业和工程领域。

[事实] 孙一游认为,只要榜单中的任务对应真实且有价值的工作,针对榜单优化也可能带来实际能力提升。

[事实] 两位嘉宾澄清,静态文本 rubric 的市场需求可能相对减弱,但大量行业知识和主观判断仍未被有效表达。

[事实] 对游戏、文章或工程成果的评价经常存在多种正确答案,无法简单地与单一标准答案进行匹配。

[15:34] 主观质量如何被验证

[事实] 随着模型能力增强,验证器也可以处理更复杂、更模糊的评分标准。

[事实] 嘉宾提出,rubric 与验证器合计拥有的知识和判断能力,应当超过被训练模型,否则难以发挥监督作用。

[事实] 图像生成可以把“是否包含指定对象、文字是否正确”等要求交给明确规则和 OCR,同时用专门模型评价“是否可爱、是否美观”等主观质量。

[推测] 高度主观的任务可能需要规则、专用奖励模型和人类偏好相结合,而不会由单一验证方法解决。

[17:35] 人负责决策,Agent 负责执行

[事实] Rubric 与环境并非对立关系:环境承载任务执行,rubric 和其他验证器负责评价执行结果。

[事实] 当前常见分工是人类负责决策、Agent 负责执行;指令越明确,输出越固定,也越容易采用确定性评分。

[事实] 如果未来希望 Agent 接管公司经营等高层决策,就会遇到任务每天变化、样本稀少、奖励模型难以训练的问题。

[事实] 嘉宾认为,可以通过收集专家过去完成的项目及其决策过程,尽量回溯和保存这类稀缺知识。

[20:05] Benchmark 与卖数据的利益边界

[事实] Benchmark 用来衡量模型与理想能力之间的差距,而训练数据用于缩小这一差距,两者角色不同但高度相关。

[事实] 评测项目的创建者通常对相应领域理解较深,因此容易获得出售相关训练数据的权威性。

[事实] 孙一游强调,不能出售评测集本身;把用于评测的数据卖给模型公司会污染榜单,损害评测公信力。

[事实] 嘉宾将 benchmark 概括为“面向未来”,将训练数据概括为“解决当下问题”。

[23:10] 什么时候 Benchmaxing 有意义

[事实] 如果训练数据没有直接污染评测集,而且评测任务与真实用户体验高度相关,针对榜单优化不一定是贬义行为。

[事实] 嘉宾认为,模型公司更应该提升能够同时改善多个评测的共同能力,而不是只优化一个榜单。

[事实] 好的评测通常至少满足两个条件之一:能反映核心认知能力,或能对应用户真正关心的应用场景。

[事实] 某些垂直评测即使不具有普适性,也可以帮助产品团队发现工具链和工程系统的问题。

[26:04] 榜单分布、权重与偶然性

[事实] 综合榜单会给不同 benchmark 分配权重,但权重是否符合真实用户需求,本身带有主观性。

[事实] 头部模型公司倾向于建立内部评测体系,第三方评测则有助于对外展示结果并增强说服力。

[事实] 某些小游戏可以被小模型通过特化方式解决,因此高分未必代表广泛的智能能力。

[事实] 一个 benchmark 是否被综合榜单采用、是否出现在技术报告中,可能受到发布时间、模型表现和行业传播等偶然因素影响。

[29:04] 真实用户体验为何难以成为标准答案

[事实] 理想评测分布应接近真实用户任务和用户反馈,类似让多个模型同时回答,再由用户比较结果。

[事实] Agent 长程任务可能持续数小时,用户很难同时运行多个 Agent 并逐一评价,因此难以建立聊天问答式的低成本比较平台。

[事实] 离线 benchmark、线上 A/B 测试和用户主观偏好可能产生不同结论;用户也可能偏爱表达形式或迎合性内容,而非事实质量。

[事实] 大型模型公司通常以内部评测为主,规模较小的实验室则更依赖外部 benchmark。

[33:30] 数据采购与垂直行业机会

[事实] 新兴 RL environment 公司大量使用合成方法,通过工程能力快速生产训练环境。

[事实] 代码领域拥有丰富公开资料,从业者也普遍具备软件能力,因此小团队较容易生成和验证数据。

[事实] 后训练数据业务可以拆分为采购与加工:先取得真实项目、代码、软件或数据库,再把它们加工成可供模型训练的任务环境。

[事实] 芯片设计可能涉及商业设计软件,DevOps 可能需要云服务模拟器,不同垂直领域都有专门的版权、工具和环境问题。

[推测] 当行业从公开代码转向专业工作流后,数据采购和授权能力可能比通用合成能力更稀缺。

[36:08] 私有数据、版权与行业覆盖不足

[事实] 药物发现等领域既需要专家知识,也依赖私有数据库;医疗数据还涉及病例隐私与敏感信息。

[事实] Agent’s Last Exam 通过众包邀请专家提交过去做过的项目,同时会筛除不合规或包含敏感材料的内容。

[事实] 嘉宾举例称,获取一款规模并不大的移动游戏源码,报价也可能达到数百万元人民币,显示真实项目采购成本很高。

[事实] 项目团队将生物学工作流展开到约3000个细分节点后,发现现有生命科学和生物领域 benchmark 的覆盖率可能连5%至10%都不到。

[39:08] 数据公司的生命周期与研发壁垒

[事实] 当前代码环境需求仍然旺盛,但代码热潮过去后,供应商需要寻找新的数据品类和激励机制。

[事实] 已经普及的简单材料会迅速失去价值,竞争者增多也会压低现有业务利润。

[事实] 嘉宾认为,优秀供应商需要像软件公司一样提前投入研发,识别未来需求,并把行业知识转化为 benchmark 和训练数据。

[事实] 模型实验室虽然具备模型和合成能力,但在行业采购、版权谈判和企业信任方面未必比第三方供应商更有优势。

[42:41] 模型公司为何仍会购买第三方数据

[事实] 模型公司的首要目标是提升模型;内部生产和外部采购可以同时进行,并不互相排斥。

[事实] 世界上仍有大量工作流尚未被整理成可训练形式,而实验室未必愿意为每个行业建立重型采购和研究团队。

[事实] 模型公司也有开发独家能力的动机,可以支付更高价格买断数据,或要求供应商把专家直接派入内部团队。

[推测] 第三方数据市场会长期存在,但通用数据可能趋于同质化,独家数据和深度行业环境更容易形成差异。

[44:12] 训练 Recipe、Reward Hack 与难度适配

[事实] 简单正确答案可以用于监督微调,rubric 和环境任务则常用于强化学习;长程任务的训练方式仍缺少统一共识。

[事实] 训练环境必须防止 reward hack,即模型没有真正完成任务,却通过漏洞获得高分。

[事实] 供应商可以让强模型测试任务、寻找捷径,并在最终奖励中加入资源消耗、执行步数和多维检查。

[事实] 训练题目的难度需要匹配具体模型:太简单无法带来学习,太难则无法获得成功轨迹和有效奖励。

[事实] 除强化学习外,供应商还可以采集、筛选或人工构造成功轨迹,供模型直接进行监督微调。

[48:22] 评测缺陷、数据污染与专家造假

[事实] 节目以 SWE-bench Verified 为例,讨论测试脚本可能误判正确方案、任务描述不清以及训练数据污染等问题。

[事实] 当 benchmark 接近饱和时,剩余题目可能集中包含脚本过严、任务不可解等缺陷,分数的区分意义也会下降。

[事实] Agent’s Last Exam 曾遇到提交者为了获得作者署名而使用 Agent 合成虚假材料的情况。

[事实] 公开数据污染相对容易搜索和检测,最难发现的是看似专业、实际并未执行过的虚构实验或模拟结果。

[事实] 复核这类任务可能要求另一位专家投入数周时间,验证成本很高,验证者本身也可能受到激励机制影响。

[51:00] 数据奖励机制与 Proof of Work

[事实] 无论奖励是作者署名还是小时工资,参与者都可能寻找偷懒或作弊的方法。

[事实] 嘉宾提出,可以要求专家提交完整工作流程、达到一定操作时长或留下足够过程证据,形成类似 proof of work 的验证机制。

[事实] 不同类型的数据需要不同的奖励和验证制度,如何让专家目标与数据质量一致仍是重要研究问题。

[推测] 数据行业不仅是在设计 AI 的奖励函数,也需要为提供数据的人设计难以投机的人类激励机制。

[52:59] 真实工作流仍离不开代码

[事实] 嘉宾认为,许多真实工作流都可以通过 API、MCP 或软件脚本转化为代码执行问题。

[事实] 3D 建模等任务并非传统算法题,但可以调用专业软件 API 完成,因此仍包含代码生成和工具使用。

[事实] 对 Agent 而言,代码相当于操作数字世界的“手和脚”,所以真实工作流训练通常仍会包含代码能力。

[54:04] 并购、数据资产与行业未来

[事实] 嘉宾提到一种可能的商业模式:收购垂直行业公司后,除使用 AI 提效,还可以发掘和利用其数据资产。

[事实] 数据需求持续增长,但产品形态变化很快,供应商无法长期依赖单一数据品类,需要不断迭代。

[事实] 嘉宾认为,未来优势可能来自把研发固化成持续发现新行业、新任务和新数据的飞轮。

[事实] 学术项目可能通过共同研究目标和作者身份吸引高级专家,而商业数据公司按小时付费时,未必能招募到同等级人才。

[推测] 数据行业的市场规模可能继续扩大,但劳动密集、持续研发和专家激励等特点,会限制其像平台型互联网业务那样形成轻松扩张的杠杆。

播客点评/总结

本期的突出价值,是把“数据”从一个笼统概念拆成专家知识采购、任务设计、执行环境、验证机制和训练 recipe 等具体环节。节目也清楚说明了 rubric 与 RL environment 并非替代关系,而是一套训练体系中的不同组件。

讨论没有把榜单刷分简单归为坏事,而是提出更有解释力的判断标准:评测是否对应真实需求、训练是否污染测试集、能力能否泛化到其他任务。这使节目同时覆盖了技术方法、商业利益和科研规范。

局限在于不少案例来自嘉宾个人观察,部分市场判断和未来趋势尚未给出系统数据验证;对各类供应商的收入结构、成本和客户采购流程也没有展开到可量化比较的程度。[推测] 因此,本期更适合作为理解行业结构和关键矛盾的框架,而不是数据市场规模或投资回报的完整研究报告。

节目适合关注大模型后训练、Agent 评测、数据创业和垂直行业 AI 的研究者、产品经理及投资人,也适合希望理解“模型分数为何不等于真实能力”的普通听众。