一个人、两周、数百美元,如何训出登顶 Hugging Face 的模型 | 对谈研究员逯雨鑫
一个人、两周、数百美元,如何训出登顶 Hugging Face 的模型
概览
本期对谈围绕雨昕个人后训模型的经历展开:她在加入 AI Lab 之前,用较低成本和较短周期做出了一个在 Hugging Face 开源模型榜单上表现突出的模型,并把经验拆解为目标选择、底座模型选择、数据管线、SFT 训练、评测迭代和发布。
核心结论是:对个人开发者和应用公司来说,训练或微调一个特定领域的小模型并不一定需要 PhD 背景或大型团队,真正困难的部分不是训练脚本、算力或基础设施,而是数据洞察、数据审核和围绕目标持续迭代。
后半段讨论进一步扩展到模型商品化、AI Lab 与应用公司的关系、主权 AI、本地模型和隐私。嘉宾认为,前沿预训练仍会由 AI Lab 主导,但应用公司会越来越多地掌握后训、数据和场景,未来可能形成“应用公司也是模型公司”的格局。
分段落总结
[00:20] 嘉宾背景与模型登榜
[事实] 主持人介绍雨昕此前做了一个基于相关底座模型和后训方法的模型,并在 Hugging Face 开源模型榜单中排名靠前。
[事实] 雨昕介绍自己曾做 Data Engineer,后来读 AI 方向研究生,目前在一家 AI Lab 做 AI Researcher。
[事实] 主持人特别指出,这个模型是在雨昕加入 AI Lab 之前完成的,她并非典型的 PhD 或长期 AI Lab 背景。
[推测] 这一开场的重点是打破“只有大厂研究员或博士才能训练模型”的刻板印象。
[01:37] AI 后训能力可以自学获得
[事实] 雨昕说自己从 2022 到 2023 年左右接触 GPT,对 AI 产生兴趣,后来在 Data Engineer 工作中接触到 AI 行业从业者,逐步选择 AI 路线。
[事实] 她认为 AI 不只有学术路线,也有工业路线;工业界常见、实用的方法主要包括 SFT 和 RL。
[事实] 她认为如果基础补好,再加上现在强大的 AI 工具辅助,很多人都可以逐步完成模型后训。
[事实] 她说最基础的东西来自自学,研究生经历更多是帮她夯实基础和提供方向。
[03:24] 项目成本、周期与效果
[事实] 雨昕说第一代模型大约用了 5 天,第二代用了两三周左右。
[事实] 她提到项目使用一张 5090、QLoRA,以及约 200 美元的 CloudMax 订阅来合成部分目标领域数据。
[事实] 她还提到 Hugging Face 社区中关注模型的人提供了真实轨迹等珍贵数据,帮助她完成 V2。
[事实] 她估算,如果只是特定领域提升,硬件成本可能不会超过 100 美元,总体成本是几百美元量级。
[04:51] 特定领域提升与泛化代价
[事实] 雨昕说模型在 agentic 相关领域,尤其是对标某个 benchmark 时,分数从原版约 15 分提升到 55 到 60 分。
[事实] 她也说明,对个人或应用公司来说,后训通常只能往特定领域提升,其他 benchmark 可能会有不同程度下降。
[事实] 主持人将其概括为:用更强的老师模型合成或提供数据,再通过 SFT 蒸馏出一个在特定领域更强的小模型,雨昕确认了这一理解。
[推测] 这里强调的是“局部能力增强”而非“训练出全面更强的通用模型”。
[05:55] 为什么这件事还没有大众化
[事实] 雨昕认为,身边真正做个人后训的人并没有大众想象中那么多,主要原因是大家觉得这件事非常复杂。
[事实] 她认为实际流程并没有那么复杂:先明确目标,再选底座模型,再设计数据管线,然后选择训练方法并持续评测迭代。
[事实] 她举例说,如果目标偏中文,就要注意底座模型的中文能力;她提到某些模型在中文上表现不好,可能需要选择类似千问这样的模型。
[推测] 后训门槛更多来自认知和实践经验,而不是缺少公开工具。
[07:28] 数据管线与训练方法选择
[事实] 雨昕说数据来源可以包括合成数据、两个模型互相扮演用户和真实模型生成对话、Hugging Face 或 ModelScope 等开源社区数据。
[事实] 她认为工业界常见做法主要是 SFT 和 Reinforcement Learning,其中 SFT 可以理解为把老师模型能力蒸馏给小模型。
[事实] 她最后选择了 SFT,并认为对很多应用公司和个人来说,SFT 是更现实的方案,RL 和其他方法成本更高。
[事实] 训练后需要跑 benchmark 或特定评测,从错误样例里反推数据和目标问题,再一版一版迭代。
[09:31] 真正的难点是数据
[事实] 雨昕说流程中的训练脚本、公开数据、benchmark 等大多已有开源工具,开发者可以借助 agent 和学习来改成适合自己模型的版本。
[事实] 她说个人项目基本用 Cloud 完成,同时认为 Codex 或 GPT 类工具更适合执行和写代码,不一定适合做规划。
[事实] 她强调,自己 95% 的时间都用在做数据上,真正的卡点是对数据的洞察力。
[推测] 对后训项目而言,数据质量和目标诊断比单纯堆算力更决定结果。
[11:36] 真实数据、合成数据与审核成本
[事实] 雨昕认为合成数据并不是很好,更多适合针对性处理某些问题,例如小模型“过度自信”、没有完成任务却宣布完成。
[事实] 她说大部分数据最好来自真实使用、公开的真实轨迹,以及自己与 AI 交互产生的好数据。
[事实] 她提到 V2 花费大量时间做数据审核;如果总数据量是 5000 条,她可能自己要审核约 500 条。
[事实] 她说第一版约 3 天做数据、1 天训练;第二版约两周里有 12 天在做数据,训练本身几个小时就能跑一版。
[14:58] 数据规模与能力差距问题
[事实] 雨昕说真实数据大约占 60% 到 70%,剩余数据用于针对模型错题做补强。
[事实] 她认为最终真实使用的数据规模在几千条量级就可以,尽管前期可能整理出接近万条数据并剔除很多。
[事实] 她指出,看起来好的数据不一定训练出好结果,因为老师模型和学生模型之间存在 capacity gap。
[事实] 她以强老师模型蒸馏到 12B 小模型为例说明,学生模型可能学不到老师模型的完整能力,只能通过反复测试验证提升是否存在。
[17:16] 什么是好的蒸馏
[事实] 雨昕说自己做过多种实验,认为蒸馏和 SFT 是最能真正解决问题的方法,OPD 和 RL 更像锦上添花。
[事实] 她认为好蒸馏和坏蒸馏的关键在于目标是否一致:如果数据把模型分布拉向真正想要的方向,就是好蒸馏。
[事实] 她说即使 benchmark 掉分,只要模型更符合目标方向,也可以算好的蒸馏。
[推测] 这是一种应用导向的模型评价观:不追求通用最强,而追求在真实使用场景中更合用。
[19:29] 应用公司训练模型的成本账
[事实] 雨昕认为,几千到一万人民币以内,应用公司应该可以训练出一个自己想要的小模型。
[事实] 她说大模型后训成本会更高,可能需要十几万或二十万以内。
[事实] 她也提醒,真正贵的可能是 serving 端,包括用户调用、token 成本、并发、SGLang 或 vLLM 等部署架构问题。
[事实] 她估计,如果只是小模型、几到十几个并发、十几个员工使用,一台 H200 级别资源可能能满足基本需求。
[21:31] 模型选择与常见坑
[事实] 雨昕说训练过程中每个环节都会有坑,但不应轻易放弃。
[事实] 她提到自己最早公开的微调模型是小说相关模型,起点是满足自己对武侠小说生成的兴趣。
[事实] 她认为千问模型在小模型里坑较少,训练、基础设施、脚本和部署体验相对更好。
[事实] 她提醒不要太相信 AI,要及时查询公开资料和成功案例。
[23:05] 后训会成为公司标配吗
[事实] 雨昕认为现在能独立做 SFT 的人其实不少,只是很多人把它想得太复杂。
[事实] 她认为中型或大型公司可以配置三四人的小团队来做模型后训,不需要特别大的开销。
[事实] 她认为当前显卡和内存价格处于高点,未来供应上来后,相关成本可能明显下降。
[推测] 如果成本继续下降,模型后训可能像过去互联网公司的技术团队一样,成为中大型公司的常规能力。
[25:28] 训练平台化与商品化趋势
[事实] 主持人提出,是否会有人把模型选择、数据上传、微调、评测和部署整合成完整 pipeline 服务。
[事实] 雨昕说海外已有类似公司或服务在做这件事,但价格仍然较贵。
[事实] 她认为国内外很多公司都在尝试把训练变成商品化服务,难点包括 infra 和 serving。
[事实] 她也提到 Hugging Face 上有相关训练服务,但目前仍有不少坑。
[推测] 模型训练服务化会降低门槛,但短期仍难完全替代懂数据和目标的人。
[27:04] AI Lab 与应用公司的未来分工
[事实] 雨昕认为 AI Lab 的数量或角色会发生变化,但真正强的 AI Lab 仍有价值。
[事实] 她认为小型应用公司早期更应该完成主业,可以由 AI Lab 或服务商承接模型能力;等应用起来后,再发展自己的 AI 团队。
[事实] 主持人提出,未来很多日常场景可能由开源模型加应用公司自己的后训解决,而 AI Lab 去探索更高智能和科学问题。
[事实] 雨昕认同这一方向,并认为 AI Lab 可能更多做研究、预训练和 serving,应用公司接管大量后训工作。
[31:00] 应用公司可能成为新的模型中心
[事实] 主持人引用推荐算法时代的类比:真正拥有应用、场景、商业闭环和用户数据的公司,最终可能拥有更好的算法和模型。
[事实] 雨昕认为未来的 Lab 会更偏向应用公司,很多小型公司可以直接调用这些应用公司的模型来做自己的事情。
[事实] 主持人与嘉宾都强调,和客户、用户直接接触的公司拥有第一手、真实、宝贵的数据。
[推测] 应用公司的价值可能随着数据积累和后训能力提升而上升,部分模型价值会向场景方转移。
[32:50] 数据价值与 AI Lab 买数据
[事实] 雨昕认为用户和 AI 的真实交互数据很宝贵,因为它展示了真实问题以及 AI 如何帮助用户解决问题。
[事实] 她说 AI Lab 免费开放模型,除了宣传和让用户体验,也是在收集有价值的数据来迭代下一代模型。
[事实] 主持人类比移动互联网早期买用户,认为早期获取数据的成本可能反而是较低的。
[推测] 数据可能会成为未来 AI 竞争中越来越昂贵、越来越核心的资产。
[35:26] 为什么仍要加入 AI Lab
[事实] 雨昕说自己选择加入 AI Lab,是因为真正有希望做 research、RSI 或更前沿研究的 AI Lab 仍有价值。
[事实] 她认为 Kimi、智谱等公司的最大价值之一是预训练,因为应用公司很难自己完成预训练。
[事实] 她估算,预训练需要大量 B300 级别算力、上百卡甚至更多,并持续几个月。
[事实] 她也指出,如果未来 AI Lab 不再开源,对应用公司会是很大的打击,因此中大型应用公司如果有预算,应尽早开始自己的后训迭代。
[37:01] 从大模型到人手一个 Local AI
[事实] 主持人提出类比:计算机从少数大型机器发展到个人电脑,AI 是否也会从少数大模型走向每个人自己的模型。
[事实] 雨昕认为这个方向已经出现,因为调用 API 时数据会被上游看到,中转站还可能存在灰色地带和数据泄露风险。
[事实] 她认为未来为了保护数据,大家会向 Local AI 靠拢;随着硬件发展,每个人可能都有自己的本地 AI。
[事实] 她提到未来统一内存和大内存设备可能让本地运行更强模型成为可能。
[39:17] 尽早开始做 AI 与开源风险
[事实] 雨昕建议应用公司如果想做 AI,不如从现在开始。
[事实] 她担心未来开源可能受到冲击,如果重要模型不再发布小模型,很多人只能依赖自己已有模型继续后训。
[事实] 她认为 CS 背景的人也可以主动往 AI 方向靠,这在闭源环境下可能带来更好发展。
[推测] 这段建议的隐含前提是:越早积累后训、部署和数据能力,越能抵御未来开源供给变化。
[40:18] Local AI 与最前沿模型的取舍
[事实] 沈皮追问:如果 OpenAI、Anthropic 等公司一直发布最前沿模型,用户是否仍愿意使用能力较弱的本地模型。
[事实] 雨昕承认自己目前 Local AI 使用率并不高,因为本地模型仍会出错,能力不如最前沿模型。
[事实] 她也说,Hugging Face 上很多反馈表明,数据敏感领域的人仍愿意使用 Local AI,尤其是 cyber security、生物等领域。
[事实] 她认为普通聊天可能更多使用大模型,但未来如果手机能部署让人满意的小模型,简单问题可能直接在本地解决。
[42:01] 隐私、成本与拒答场景
[事实] 雨昕认为 Local AI 的优势包括保护隐私、省钱,以及在某些领域商业大模型拒答时可以继续工作。
[事实] 她举小说写作作为例子,称长文本创作的 token 消耗很高,用商业 API 可能花费几千甚至几万人民币,而 Local AI 可以降低成本。
[事实] 关于隐私是否是真需求,雨昕认为确实有很多人不在意,但也有很多人在乎。
[事实] 她还提到 cyber security 和生物研究中,最前沿模型可能因为安全策略拒答,用户因此可能选择中等能力但可本地部署的模型。
[44:53] SOTA 崇拜与性价比
[事实] 主持人补充说,所谓 SOTA 到底多强才算够强,本身可能会随着使用场景改变;很多情况下更强模型从性价比上未必必要。
[事实] 主持人用 4G、5G、6G 类比说明,用户可能在某个阶段觉得“已经够用”。
[事实] 雨昕认同很多人会盲目追求最强模型,而没有先看自己的真实需求。
[事实] 主持人认为多数普通用户最终还是选择方便、性价比高、能解决问题的产品,例如豆包一类的大众化应用。
[推测] Local AI 的普及未必完全来自个人主动选择,也可能由手机厂商、应用公司或平台方推动。
播客点评/总结
这期的价值在于把“训练模型”从抽象叙事拉回到具体流程:目标、底座、数据、SFT、评测、迭代。尤其是嘉宾反复强调数据审核、真实轨迹和错题迭代,比单纯讲模型架构或算力更贴近个人开发者和应用公司的实际问题。
亮点是经验非常一线:几百美元、单卡、几千条数据、几小时一版训练,这些信息让听众能建立一个更现实的成本感。与此同时,嘉宾也没有把后训神化,明确指出特定领域提升可能伴随其他 benchmark 下降,合成数据质量有限,capacity gap 会导致老师模型能力无法完整传给小模型。
[推测] 局限在于,转录中部分模型名、公司名和技术名存在识别不稳定,且很多成本估算来自个人项目和个人体感,不能直接套用于所有行业或生产级系统。对于需要严格安全、合规、稳定 serving 的公司,还需要额外评估部署、数据治理和持续维护成本。
[推测] 这期适合想理解模型后训门槛的开发者、正在评估自有模型的应用公司、关注开源模型和 Local AI 趋势的从业者。不太适合作为完整教程直接照做,但非常适合作为判断“该不该开始做后训”和“难点到底在哪里”的入门框架。