开场介绍0:00
感谢 " 屠龙之树 " 主播庄明浩老师的推荐 。 红杉资本近期发起了一个名为 "Own Your Intelligence" 的系列专题分享 , 邀请在企业自建智能方面实践最多的几家公司 , 围绕 " 战略理念 "" 模型后训练 "" 强化学习环境 " 与 " 垂直落地四大议题 " 做系统分享 。
模型后训练的实操方法论由 Fireworks AI CEO Lin Qiao 主讲 。 作为前 Meta PyTorch 核心工程负责人, 她指出 API 门槛坍塌的今天 , 浅层应用极易被像素级复刻 , 企业真正的壁垒在于通过 SFT、DPO 与强化学习 , 将自家独到的业务判断和 " 产品品味 " 烘焙进模型权重 。
她特别警示企业避开 " 凭感觉评测 (Vibe Evaling)" 的陷阱 , 必须建立系统化的自动化评估与单元测试 ,并警惕环境模拟不足导致的 " 奖励黑客 "。
这套方法论不仅能在特定领域超越前沿闭源模型 , 更能将推理成本降低数倍 。
好的 , 接下来我们有请 Lin, 她是 Brendan 的密友和合作伙伴 。Lin, 先举手表决一下 : 在座有谁在做后训练 (Post-Training)?
好的 , 现场有不少人。 那谁在用 Fireworks? 好的 , 现场也有不少人, 所以 Lin 你在观众里有一些熟人了 。 那接下来的这场分享 , 我们要聚焦的是后训练 。Lin 和 Brendan 那场类似的安排 , 我们先花 15 分钟讲讲如何应对后训练这个问题 , 然后留大约 15 分钟做问答 。Lin, 真的很高兴你能来 , 感谢你加入我们 。
背景与趋势1:32
谢谢邀请 。 大家好 , 早上好 , 我是 Lin,Fireworks 的 CEO 和联合创始人。 那么 , 随着话能篇放出来 , 今天我打算稍微深入讲讲后训练 ,以及为什么后训练可能与你们经营自己的业务高度相关 。
首先 , 简单像之前一样 : 我想今年我们已经看到 —— 首先 , 我是 Fireworks 的 , 我们是一个专注于推理的智能平台 ,有大量的应用构建在我们之上, 从初创公司到数字原生企业 , 再到大型企业 , 都有 。
所以我们工作的有趣之处在于 , 我们能见到很多模式 : 人们在上面构建什么样的创新 ,他们面临什么样的挑战 , 开发者们在上面构建的趋势是什么 。
特别是过去 1 年里 , 软件开发和应用程序开发在某种程度上被 " 颠覆 " 了 。 因为过去是这样的 : 你有一个好点子 , 想实现它 , 规模化上线 , 这需要一支由数十名非常强的产品工程师 、 产品经理组成的团队一起协作 , 花好几个季度才能交付 。
而现在 , 一个人, 几周时间 , 哪怕一行代码都不会写 , 你就能做到 。 所以 , 无论是时间线还是深度 、 专业能力方面 , 所需资源的坍塌正在改变应用领域的竞争格局 ,也在推动人们从构建在现成的黑盒 API 之上, 转向构建更深的模式 , 这样他们才能建立一个更持久 、 更有护城河的业务 。
你们也看到了很多讨论 , 尤其是在过去一周里 , 关于 " 开放模型 " 和 " 封闭模型 " 之争 ,以及围绕开放模型的各种声援和支持 。
那个联盟之所以如此深入 ,是因为我们相信 —— 我的意思是 , 这个行业要深得多 ,因为看看整个行业 ,有太多的公司 , 对吧 ?
有太多公司 ,在座各位也都在构建自己的公司 。 每一家公司的存在都有其原因 ,因为他们专注于用一种特别的方式解决一个独特的问题 , 这意味着他们把自己的判断 、 品味 、 决心和信念带进了那个产品 , 这就是公司存在的原因 。
今天 , 如果你构建在现成的 API 之上, 那你真的需要思考 , 如何把那种特别的品味 、 判断和独特之处保持下去 。
我们相信 , 每家公司要建立持久业务的一个途径 , 就是把你自己的判断 、 品味和对客户的深度理解 , 烘焙进你构建的智能里 ,而不只是依赖现成的 API。
这就是行业正在发生的事情 、 我们看到的趋势 ,以及为什么后训练可能对你们非常非常相关的背景 。
拥有智能4:10
好的 , 你们大概听过很多 " 拥有智能而不是租用智能 " 的说法 。 那么 , 拥有你自己的智能到底意味着什么 ?
它其实意味着很多东西 。 首先 , 从数据开始 。 智能是数据的衍生物 。 显然 , 基础实验室我们都在使用的所有基础模型 , 构建在公共数据和标注数据之上 。
这些数据解决的是通用任务 ,但在座各位解决的都是特定任务 。 这正是你们创建业务 、 创建公司的原因 : 能够策划高质量的生产数据 , 甚至生成合成数据来丰富你的生产数据 ,是拥有自己智能的一步 。
然后 ,在你有了数据之后, 你会开始把这些数据转化为模型 , 构建在现有模型之上 ,并拥有权重 。 有一系列技术可以帮你到达那里 。
这些技术是为解决你可能遇到的不同类型的问题而量身定制的 , 它们之间也可以互相配合 , 帮你达成最终目标 。
技术进阶5:11
然后, 当你拥有了一个属于自己的 、 能很好地解决你特定问题的出色模型 , 你还需要做好服务部署 。
你大概会先做一些 A/B 测试 , 确保它真的能推动你的产品指标 , 然后再回到这个循环里 。 显然 , 我不认为你应该立刻跳进后训练 , 你会经历不同的阶段 。
首先 , 提示词 。 每个人都是从提示词开始的 , 直接使用模型本身做 few-shot( 少样本 ) 示例 。 如果很快的话 , 你可以用它来测试你的想法 。
然后, 你用 RAG 把 AI 的使用锚定到你自己的数据上, 从那里你可以开始做大量的上下文工程 , 这些是从几分钟的交互到几小时的交互 。
然后你进一步推进 : 嘿 , 我有一些数据了 , 我想看看我的数据会如何反应 , 如何让模型在我的产品中工作得更好 。
所以你会开始做监督微调 (SFT), 这需要你花几个小时到 : 嘿 , 我希望模型反映我产品个性化的品味 , 这是我产品非常独特的选择 。
因此 , 你想开始使用偏好信息 。 你从用户交互中收集的 , 比如 " 点赞 "" 点踩 " 这类信息 , 帮助模型学习你的产品品味 。
最后, 你想构建一个能承载你专业知识的模型 。 不管这种专业知识是法律 、 金融 、 医疗 、 客服 、 招聘 、 营销 、 销售 , 什么领域都行 。
即使在一个行业垂直领域内 ,也有非常多的子领域 , 所有这些都是独特而特别的 、 指向你正在构建的产品 。
所以通常 , 你们可能听过很多关于 " 强化学习 " 的说法 , 那实际上就是用来构建这种专业性的 。
这个进阶过程和我们人类随时间学习知识的方式非常相似 。 举个例子 , 我们确实通过阅读文献学到了很多知识 , 对吧 ?
文献会告诉你什么是对的 , 什么是不对的 。 所以这和监督微调非常相似 。 随着我们成长 , 我们发展出自己的品味和判断 , 我们想用哪种特定的方式来解决问题 , 这就是偏好 (Preference) 或 DPO。
随着时间的推移 , 我们学会在某些领域做得非常好 , 比如 : 嘿 , 我想当一名会计师 , 那我就真的知道怎么深入财务数据 ; 或者我想成为一名牙医 , 你就学习牙科操作的所有细节 。
所以这一切和人类获取知识的方式非常非常相似 。 而且非常有意思的是 , 不同的技术是用来解决不同类型的问题的 。
技术选型7:40
举个例子 , 如果模型不知道某个事实 ,而且事实通常是非常动态的 , 你的产品中数据的实际情况非常动态 , 那么通常你用 RAG 来解决这个问题 。
但如果你的模型输出行为或结构不对 , 那你就策划数据 , 做监督微调来纠正它 。 如果你的模型回答的质量是个性化的 , 或者说特定于你产品的品味 , 那你就用偏好调优 。
或者 , 如果模型在你试图解决的特定问题上相当弱 , 那你就用强化学习 (RL)。 而如果最终结果是模型太慢或太贵 , 无法在生产环境部署 , 那你就用蒸馏 (Distillation), 让老师教学生 , 教一个小得多的学生模型 , 这样它就更能胜任 、 更经济 。
显然 , 蒸馏对于 LLM、VLM 或图像生成模型来说 , 含义也各不相同 。 如果你是感兴趣的话 , 我们可以多聊一点 。
所以有很多不同的方式 。 团队开始 : 嘿 , 我想试试这些技术 ,但他们可能对体验不满意 ,因为他们可能烧了钱和时间 , 却没有达到理想的结果 。
常见陷阱8:38
所以 , 这里有一些你可能感到挫败的领域 , 比如说 , 谈到数据 。 数据是调优的本质 , 数量不是最重要的 , 实际上质量才是最重要的 。
但有时候 , 仅仅把海量数据扔进训练流程 ,并不一定会带来好的结果 。 所以你真的需要控制数据质量 。
而且通常 , 谁是数据质量的最佳评判者 ? 其实是你的产品团队 。 这就是我们看到的融合 : 在生成式 AI 之前 , 产品团队和研究团队或 ML 团队是分开的组织 、 分开的团队 ,他们携手合作来把事情做成 。
而如今很多时候 , 当人们后训练生成式 AI 模型时, 我们看到的是 , 产品团队需要做出数据质量的判断 ,并开始深度参与这个过程 , 这样他们才能确保最好的结果 。
第二 , 你会有评测 (Evals)。 我知道你们都很忙 , 急着尽快发布 , 所以很多评测都是 " 感觉评测 (Vibe Evaling)"。
创始人真的会看结果 , 然后感觉 : 嘿 , 这对不对 ? 实际上, 这就是判断 。 你把你对最终结果的判断放进去 , 决定它好不好 。
然后你把那个判断转化为系统化的评估 , 这和传统软件开发没什么不同 。 传统开发里有单元测试 、 集成测试来保证质量 。
同样的 , 如果你考虑做后训练 , 然后想办法构建评测 , 把你自己的判断构建成一个可重复的流程 , 这是极其重要的 。
然后还有一个问题 : 当你做 RL 时, 可能会有草率的 RL 环境 。 你构建了一个模拟环境 ,但模拟并没有真正反映现实 。
然后模型可能会在一个糟糕的模拟上爬升 (Hill Climb)。 我的意思是 , 它也可能会做奖励黑客 (Reward Hacking) 以及各种奇怪的事情 。
关于奖励黑客 ,有个有趣的故事 : 我们让一个模型生成 ( 这是一个编码示例 , 生成能够最小化编译错误的代码 )。
好的 , 猜猜模型做了什么 ? 模型生成了 0 行代码 。 好的 , 这样就没有编译错误了 ,但这绝对不是你想要的结果 。
所以 , 这就是奖励黑客的一个例子 。 它非常常见 ,因为模型非常聪明 , 它会尝试各种不同的方式来达成你的目标 ,但那可能不是你想要的 。
所以 , 请注意所有这些细节 , 尽量不要让模型比你更聪明 。 显然 ,在你的实验之间 , 把你的开发过程想成这样 : 你其实在做大量的实验 , 从训练模型开始 ,但训练模型并不是你实验的终点 。
最终的评判标准是产品指标有没有在动 。 所以 , 你需要把最终模型带到服务层 , 做 A/B 测试 。 这个过渡极其重要 ,因为如果你从训练站换到服务站 ,而没有对齐这两者 , 质量可能会下降 。
因为想一想 , 模型是海量的计算 、 数学和矩阵乘法 。 而做矩阵乘法和计算的方式 , 如果你用不同的库 、 不同的数值精度 、 不同的优化方式 , 就会产生不同的结果 。
因此 , 训练得到的最终结果可能无法复现 , 甚至你在服务过程中会损失精度 。 所以 , 这种对齐非常重要 。
我可以给你更多例子 。 还有一些其他的挑战你会遇到 , 我很乐意离线的时候和你们更详细地聊 。 所以 ,有很多先驱者和我们合作做后训练 。
客户案例12:15
我会说 Cursor 是其中之一 ,他们从去年年初就开始上车了 , 原因有很多 。 一是他们真的很想掌控模型供应的命运 ,而且显然 ,他们有很多用户参与度 ,他们了解什么是客户偏好 ,有大量数据 , 所以那成了他们旅程的起点 。他们做了相当深入的从中期训练到后训练的工作 。
你们也听到他们每隔几个月就持续发布新模型 , 结果非常棒 。他们的愿景是在前沿质量上竞争 , 非常大胆的抱负 ,而且他们正在做到 。
所以 , 从 Composer 2、Composer 2.5 来看 , 结果非常令人印象深刻 , 与前沿实验室的质量不相上下 。他们总是试图持平或超越前沿实验室的质量 。
所以 ,他们是其中一个例子 , 一个非常生动的例子 , 证明只要保持专注 、 有正确的工具 ,并持续构建在我们之上, 这是完全可以做到的 。
还有另一大类例子来自医疗健康 。 比如 Doxymity 就是一个例子 。 它们做诊所 AI, 基本上让医生提出深入的医学问题 , 把症状与药物和副作用匹配起来 ,并在医学领域的所有方面都有全面的研究 。他们实际上也在 Fireworks 上训练 ,并且登顶了一个非常重要的基准 : 斯坦福哈佛诊所安全基准 (Stanford Harvard Clinic Safety Benchmark)。
我们为那个结果感到非常自豪 ,他们也在持续推进这个训练循环 。Factory 那是一家红杉投资的公司 ,他们构建在 Fireworks 之上, 尤其专注于编码中的安全部分 。
这是一个非常难的话题 ,因为安全不容许高容忍度 , 你必须做对 。他们调优的模型也在安全领域的基准测试中登顶了 。
所以你可以看到 , 所有这些例子都是一种证明 , 所有这些公司都在用一种特别的方式解决一个非常独特的问题 : 他们通过构建在开放模型之上, 用他们自己的数据构建自己的挑战 。
这些就是细节 。 显然 , 如你所知 , 去年 2025 年是编码之年,Fireworks 支持所有构建在我们之上的编码公司 ,他们在从中期训练到后训练方面取得了巨大成功 , 训练出了非常强的模型 。
如你所见 , 那些基准测试非常亮眼 , 所有这些编码公司都被激励着去持平或超越前沿实验室在编码领域的水准 。
协作空间14:47
但编码不是全部 。 今年, 我们开始看到各种不同的协作空间 (Coworkspace"Cowork Space) 出现非常有趣的发展 , 从通用协作空间到专业化的 、 特定领域的协作空间 。
就像我提到的 ,有法律 、 金融 、 营销 、 招聘 、 销售 、 客服 、 协作空间 ,他们都在开始后训练 , 拥有自己的智能 , 为自己的产品提供动力 。
这里 ,GenSpark 是通用协作空间应用之一 ,他们为专业人士构建深度研究和幻灯片生成 。 如你所见 ,他们与前沿模型竞争 , 结果略好一点 ,但成本显著更低 。
所以这里我们说的是降低 5 到 10 倍的成本 。 所以作为一家初创公司 , 一旦你撞到这样一个问题 , 如果你能快速规模化 , 就能变成一个可行的业务 。
我猜还有一个医疗健康的例子 。 医疗健康数据或用例在前沿实验室的模型里并没有被很好地覆盖 。
所以你可以看到 , 调优后的模型质量明显优于最先进的封闭模型 。 我们有各种不同类型的开发者构建在 Fireworks 之上做后训练 。
那么这些类型是什么呢 ? 我们看到了很多前沿智能体构建者 。 前沿智能体构建者通常构建定制的 、 个性化的 Harness 框架 ,他们不使用通用的 Harness,他们会把自己的 Harness 与他们的系统以及各种不同的工具协同优化 。他们想要构建在 " 之上 " 的 , 往往就需要后训练 。
所以 , 我们看到了很多在这个方向上可复制的成功 。 而且 , 显然 , 我们也看到很多大公司开始做后训练 ,因为有趣的是 , 这些在位者拥有巨大的流量 。
对他们来说 , 把 AI 功能全面部署给所有客户 , 是一个巨大的成本负担 , 巨大的成本负担 。 所以如果我们说要小心规模到破产 (Scaling into Bankruptcy), 这不只是对初创公司说的 , 实际上对在位者也一样 。他们的 CFO 真的会因为成本而叫停 AI 功能的上线 ,而后训练就是解决这个问题的方法 。
我们还看到很多专业化的模型运营者 , 这些可能是新的实验室 ,也有很多前沿模型开发者 ,他们也会做大量的后训练 。
所以 , 这是我们反复听到的一句话 : 在实现产品市场契合 (Product-Market Fit) 之后, 训练成为很多很多公司构建专业化智能的载体 。
未来展望17:15
我们确实相信 ,也确实看到这个趋势 , 未来可能会有数百万个专业化模型 , 每个用例 、 一个模型 , 会是数以百万计 。
我就是这么相信的 。 显然 , 我们也看到过不同的方法把数据转化为模型 、 来自奖励的信号 ,以及如何构建那些奖励函数 ,是这个故事中非常重要的一部分 。
所以我们的观察是 : 不要早开始 。 早开始 , 开始做大量的实验 , 更具迭代性地做 ,他们会获得亲身体验 。
我们见过人们上手非常快 , 实际上并不存在很多人感觉到的那种门槛 。 因为整个奖励工程和软件工程非常相似 , 逻辑推理和思维方式非常非常相近 。
所以 ,是的 , 卷起袖子动手 , 开始测试吧 。 好 , 我想 ,是的 , 这些就是关键的要点 。 我想我们 , 我们想承认 ,在这个领域里 , 你们现在拥有不同的专长或不同的知识 。
比如 , 我们和 Cursor(Cognition) 这样的公司合作 ,他们有深厚的研究人员 ,他们想尽可能控制每一个旋钮 ,以获得极致的结果 。
我们给他们最低层的 API。 这意味着 , 我们只是提供 RL rollout( 强化学习轨迹 ) 展开 ,他们可以直接与之交互 , 完全控制训练器 , 这给他们最好的结果 。
但很多公司 , 你们有产品工程师或机器学习工程师 , 你们对后训练有足够的信息和知识 , 你们想要一些控制权 ,但你们不想要最低层级的控制权 。
所以这就是我们有训练 SDK 的地方 , 和你们所有人紧密迭代 , 让你们动起来 。 我们也很乐意部署我们自己的研究人员 。
那就是 , 我们会看到 , 帮忙手把手地训练你的团队 , 让他们上手 。 所以 , 这些就是我们看到的不同的团队想要参与并熟悉整个流程的不同方式 。
好 , 我在这里暂停一下, 看看你们有没有什么问题 。 我来问一个吧 。 最成功的人, 如果他们已经有数据和奖励信号 ,也许来自他们的产品 , 你见过的最好的奖励信号例子是什么 ?
奖励信号19:13
就是那种非常成功的快速训练出来的 。 通常 , 奖励 , 你可以把奖励想成是代码 , 你是用代码写奖励的 。
通常要想的是奖励的评分细则 (Rubrics)。 想想 , 你要在多维度上给结果打分 。 举个例子 , 如果你在构建一个招聘智能体 , 你可以想 : 嘿 , 我们怎么评估候选人筛选 ?
不同的公司 , 我保证你有不同的标准 。 比如 , 我们想给候选人的能力倾向打分 ,他们是不是真的很有饥渴感 ?
他们不会接受 " 不 " 作为答案 ,他们会破墙前进 。 这是一个维度 。 第二个是 ,他们是不是真的很快地构建东西 , 取得进展 ?
等等 , 然后你把分数混合 、 合并起来 。 所以 , 想想在多维度的评分细则上定义奖励 。 然后不同的公司有不同的混合方式 , 那就是你独特的部分和秘制酱料 (Secret Sauce)。
讲得非常棒 ,Lin。 我是 Verso 的 Raj。 我好奇的是 , 我想你提到了过早开始的陷阱 ,但根据你从 Verso(Cognition) 或其他公司看到的情况 ,他们实际上是什么时候开始考虑后训练的 ?
时机与ROI20:22
是他们觉得准备好了的时候 ? 还是成本太高的时候 ? 因为那些他们超越的基准测试是一个很好的信号 , 说明是的 , 你可以超越前沿模型 ,但那是主要的动机吗 ?
比如说 , 那 2% 的提升值得整个框架的成本或投资吗 ? 他们怎么考虑 ROI? 你知道 , 封闭模型更贵 ,但后训练也有金钱投资和后续维护的隐形成本 。
所以我好奇的是 ,他们是在成本成为担忧的时候开始 , 还是在使用量激增 、 不得不提前一两年做规划的时候开始 ?
是的 , 这是个非常棒的问题 。 通常 , 想想在 AI 领域构建产品市场契合和规模化业务 , 实际上是两个阶段 。在 SaaS 时代 , 这是一个概念 : 你达到了产品 、 市场契合 , 然后就规模化 。
我知道你得尽可能多地扩张 ,但现在我们看到一种分叉 : 产品市场契合并不意味着你有一个持久 、 可扩展的业务 。
而且通常我们看到 , 公司部署的策略是先通过构建在前沿实验室模型之上来实现产品市场契合 ,因为你不需要担心任何事情 , 只要花钱 , 达到产品市场契合 。
另一个非常重要的事情是 , 只有在你达到产品市场契合之后, 你从产品表面收集的数据才真正有意义 ,而且你也会开始收集到高质量数据的体量 , 来自产品表面 , 那成为你开始拥有自己智能的燃料 。
所以 , 我们把这看作一个非常强烈的信号 ,因为一旦你达到产品市场契合 , 你真的开始考虑规模化业务时, 你会想两件事 : 一是继续保持你的竞争优势 , 二是建立一个持久的业务 , 让你的收入和成本处于健康状态 。
那么 , 后训练就变成了一个非常有吸引力的解决方案 ,因为后训练让你能够基本上把你的独特品味编码固化进一个没有人能偷走的模型里 。
因为照搬和复制应用本身非常容易 , 正如你们都知道的 , 对吧 ? 从编码智能体来说 , 非常容易 , 截个图 , 砰 , 生成一个一样的甚至更好的应用 。
所以 , 很可怕的是 , 应用本身作为一种护城河 , 正在被削弱 ,而你把你反映产品参与度和所有深度知识的数据烘焙进你的模型 , 是一种保住它的方式 。
第二 , 你可以后训练一个模型 , 把成本降低 5 到 10 倍 , 那意味着你可以用同样的预算支撑 5 到 10 倍的流量 ,而且你规模化的单位经济性要好得多 , 你避免了规模到破产 。
结语23:15
所以 , 我们看到这背后有两个引人入胜的故事 , 关乎原因和时机 。 谢谢你 ,Lin。 非常感谢 。 这就是今天跟大家分享的全部内容 。
欢迎订阅 《AI 智识录 》, 获取最新鲜的 AI 领域最新智识 。 最后插播一个广告 : 主播自己的 AI 创业产品 YouNavi, 一个能一键整合你的飞书 、 钉钉 、 腾讯会议 、Claude 和其他录音卡录音豆 , 随时随地帮您解读日常会议与沟通背后的深意 , 锁定关键信息的 Agent 应用已经正式上线 。
最新的版本也支持了直接给它播客链接 , 它就能轻松完成转写 、 总结 、 分析 , 甚至多个播客的关联解读和分析 。
如果你有兴趣 , 欢迎在本播客的公告栏查看体验方式 。 我们下期见 。
