开场与背景0:00
感谢 " 屠龙之术 " 主播庄明浩老师的推荐 。 红杉资本近期发起了一个名为 "Own Your Intelligence" 的系列专题分享 , 邀请在企业自建智能方面实践最多的几家公司 , 围绕战略理念 、 模型后训练 、 强化学习环境与垂直落地四大议题做系统分享 。
强化学习底层细节由 Mercor CEO Brendan Foody 拆解 。Mercor 是一家以 AI 匹配全球顶尖人才重塑真实工作流的企业 , 本期他详解了 RL 环境的三要素 : 业务上下文 ( 世界 )、 高保真软件克隆 ( 应用 )、 明确指令与专家评分 ( 任务与验证器 ), 并强调金融 、 法律等高门槛领域必须依赖顶尖专家设定严苛评分边界 , 防止模型 " 奖励黑客 " 作弊 。
他预测评测演进的两大方向 : 处理百小时级的 " 超长视野任务 ",以及考察智能体在虚拟办公环境中的协作与社交能力 。
以下是分享内容 。
Mercor, 我记得你们在过去大约 4 个月里 , 营收从 10 亿美元的年化水平涨到了 20 亿美元 , 所以这家公司简直是势如破竹 。
而且我觉得你们正好站在了所有公司思考如何后训练自家模型 、 如何构建自有智能的最前沿 , 所以感谢你们来参加这场对话 。
流程上我们是这么安排的 : 先由 Brendan 讲大约 15 分钟的内容 ,他会重点讲 RL 环境 , 我觉得这是一个相当前沿的新话题 , 探讨起来会很有意思 ; 然后最后再留大约 15 分钟做问答 。
所以请大家先把问题揣在兜里 ,Brendan, 交给你了 。
好嘞 , 那我就来聊聊 RL 环境 。 开场之前 , 我觉得先给大家一点背景会很有帮助 : 关于数据市场的历史 ,以及这段历史如何与 Mercor 的创业故事交织在一起 。
数据市场史1:43
真正的起点是 2020 年, 那是一个靠 " 重包数据 " 做行为克隆的时代 , 当时主要是监督微调数据 ,也就是输入和输出 , 还有 RLHF 数据 , 让标注员从模型的几个回答中挑出他们更偏好的那一个 。
靠着这些 , 我们得以在微调 GPT-3 上不断取得进展 , 一步步迈向 ChatGPT 和 GPT-4, 那还是在 " 重包智能体数据 " 的时代 。
但我们也看到市场正在发生变化 , 尤其是进入 2024 年后, 出现了一个巨大的转型 : 从低技能重包的行为克隆数据时代 , 转向智能体 agentic 数据时代 。
问题变成了 : 我们如何找到全球技能最顶尖的专家 , 让他们以团队协作的方式 , 为下一代模型构建前沿评测和 RL 环境 ?
软件工程师 、 律师 、 医生 、 银行家等等 , 这些人能够衡量智能的前沿 ,并借助这些评测来提升模型能力 。
于是 Mercor 就在这个浪潮中成长起来 。 我们的第一个大项目是 Deep Research, 我猜那是第一个声名鹊起的 RL 智能体 。
随后我们与所有前沿实验室一起迅速规模化 , 成为所有头部实验室 、 以及所有头部应用层公司 , 从 Harvey、Cera、Cognition 到 RAMP, 最主要的智能体数据供应商 。
过去 12 个月里 , 尤其令人兴奋的是 ,在智能体数据范式下,RLVR 已经演进到把 RL 环境也包含进来 , 这些丰富的应用和世界 , 教智能体如何使用我们笔记本电脑上每天在用的各种工具 。
所以我会讲这些 ,也会讲这项起源于前沿实验室的技术如今如何扩散到应用层 ,以及你们在座各位在经营公司时正在构建的所有产品 。
RL环境三要素3:42
从高层看 ,RL 环境是什么 ? 它包含三个部分 。 第一部分是 " 世界 (Worlds)", 包括消息 、 幻灯片 、 文档 、 表格等等 , 对应你在一个真实项目或公司里会遇到的一切 。
第二部分是 " 应用 (Apps)", 热门应用的高保真克隆 , 比如 Salesforce、ServiceNow、Microsoft 365 等等 , 智能体可以通过 MCP、CLI 或 GUI 与它们交互 。 第三部分是 " 任务 (Tasks)", 我们提供提示词和验证器 , 验证器可以是评分细则 (rubrics) 或单元测试 , 既可以用于评测 ,也可以用于训练 。
前沿实验室要想把你用 Claude 在笔记本电脑上能做的所有事都自动化 , 面临的障碍是如何覆盖经济体中所有世界 、 所有应用 、 所有任务的完整分布 。
为此 , 行业出现了一场巨大的规模扩张 ,在这些环境的构建中, 人类一直处于核心位置 。 当然 , 模型也在其中深度参与 。
我这里放了一张图 , 展示了过去 24 个月里我们人才网络投入的专家工时 。 这是一条相当惊人的增长曲线 , 仅第二季度就有 250 万小时 ,而且用于构建所有这些环境的专家时间还在加速增长 。
原因当然如我所说 , 我们需要把环境分布扩展到经济体的每一个类别 。 在座很多人可能知道 OCTANET, 美国劳工统计局下有 205 个职业领域 ,但你还得想清楚 , 如何为所有这些职业配上对应的应用 , 覆盖所有不同的场景和任务 。
这是一项巨大的工程 。在大多数领域 , 只有人类才能衡量前沿 ; 不是所有领域 ,也有少数例外, 比如数学 , 它有非常干净的模拟环境 , 模型可以从答案对错中学习 ; 但在大多数领域 , 比如做一份幻灯片 , 模型极难可靠地发现自己错在哪里 , 这就好比让人类给自己批改作业 。
所以 , 让人类来创建评分细则非常有价值 , 就像教授为批改论文创建细则 , 或者助教为那份幻灯片打分 。
这和我们很多人学习的方式很像 , 我们很大程度上是从身边人的反馈中学习的 ,而不是纯粹地把东西塞进计算器或干净的模拟环境 。
而构建这些验证器很难 ,因为任何时候你要做一份幻灯片 , 都需要理解完整的问题空间 , 比如哪 10 种不同的幻灯片都可能是值得走的好路径 , 你可能会犯的几十种错误是什么 , 如何构建一个全面的验证器 , 覆盖这整个可能的解空间 。
所以我会带大家看一个示例 RL 环境 ( 不好意思 , 把它拆开来讲给你们听 )。 这个环境之所以这么 " 酷 ", 稍后我会说到 , 部分原因是我们与实验室合作开发了大量这类技术 。
法律环境示例6:12
当然 ,其中有些我们已经开源发布给了全世界 ,但现在这一切开始扩散到应用层公司 , 那些正在构建并拥有自有智能的公司 。
因为他们意识到 ,他们 AI 战略的三大核心支柱是 : 算力 、 算法或研究人员 ,以及他们构建的数据集 ,而数据往往是最具差异化优势的那一个 。
这里有一个我们发布的例子 , 是一个法律场景 。 我们请来自顶尖律所 , 比如瑞声 Latham Watkins 的律师 , 写下他们在大型律所工作中处理过的真实项目场景 。
然后他们为数据室 Data Room 创建一份完整的大纲 , 对应所有不同的消息 、 邮件 、 文件 。 文件大小我把完整的数据室截掉了 ,因为它非常庞大 。
当然 , 模型在其中又很大参与 , 它们如何高效地填充这些内容 , 就像软件工程师现在不应该完全手工写代码一样 , 它们应该学会编排智能体 , 非常高效地完成这件事 。
然后我们把这个数据室渲染进应用 ,在这个场景里是 Google Workspace 的克隆 ,并准备好提示词 , 让模型在这个环境里滚动生成轨迹 (Trajectories)。
在这个例子里 , 它要评估 Star Tankers 航运国际有限公司相对于 Cooper Jefferies 能源公司依据 《 石油法案 》 应承担的最大总责任 ,并综合考虑数据室里这个真实场景的所有上下文 。
然后如我所说 , 就像教授为论文创建评分细则一样 , 它们有关键的评分标准 , 对应着什么样的模型回答才算准确的特征 , 还要确保这些评分标准能避免 " 奖励黑客 "(Reward Hacking) 并有效对齐 。
当你滚动生成 100 条轨迹时, 确保所有这些分数都准确 ,是极具技术挑战的 。 因此 ,有大量的研究 、 数据质量把控 、 数据训练等等 , 投入到解决这个问题上, 最终产出这些高质量的验证器和排行搒 , 给你一个 " 聚合 " 的模型评分 , 展示不同模型在特定领域上的表现 。
如我们所见 , 过去几个月的重大变化之一是 GLM52 和 Chimera K3 登上了排行搒 , 这对你们所有人来说都是巨大的机会 ,因为它给了我们基础 , 去真正实现前沿智能 ,以及你们所专注的那些具体应用和垂直领域 。
而且这一天并不遥远 。 为了让大家对这种情形有个概念 , 我会分享一个在 Apex Agents 上做后训练的例子 ,也就是我刚才展示的那个数据集 。
这个例子里有 1800 个任务 , 这次后训练跑的是 GLM47,但我们正在为 Chimera K3 重做其中的很多任务 , 所以很快会给大家更新后的结果 。
大家可以看到 , 仅仅在 1800 个任务上, 用大约 50 万美元的算力 , 提升就相当惊人, 公司法从 4.7% 跳到 26.6%。 但请注意 , 这还只是我们给它的 Apex Agents 数据集 ,而它实际上泛化得非常好 ,在 OCTANET 和不含这些数据室的 Apex V1 上也有出色表现 , 甚至在其他一些基准上也看到了名义上的提升 。
所以我们正在和像 Harvey 这样的客户做大量这类工作 , 我知道 Harvey 稍后也会来讲他们的东西 , 帮他们构建对应自身特定领域的环境 , 这样他们就能在其中构建前沿智能 。
我记得 Andrew 讲到过 Cursor 是一个很好的第一个例子 , 说明应用层公司如何能构建出一个行业领先的模型 , 为客户创造了巨大的价值 。
我相信在未来 12 个月里 , 会出现几十个类似的例子 , 公司拥有自己的智能 ,而这就是他们正在构建的产品的关键优势来源 。
商业模式10:03
实际上,Josh 和我前几天也聊过这个话题 。 这里有几个如何策划高质量数据集的方法 , 我们最常看到 、 也很乐意分享并给大家发链接的 , 主要有三种 。
第一种是按任务定制 , 这是最常见的 。 客户会说 : 我真的很喜欢法律这个环境的数据形态 , 我们愿意为每个任务支付 2000 美元来规模化 。
举个例子 , 某些前沿实验室可能每个月从我们这里买 5 万个任务 , 所以规模往往相当惊人。 这些任务通常非常复杂 ,有些甚至要花人类一个月的时间才能完成 ,有些则只需要几个小时, 这类一般是按任务单独定价 。
第二种是现成数据 (Off-the-Shelf Data)。 我们投入了数亿美元构建自己的数据集 , 卖给多个客户 。 所有这些新的 Neolabs 实验室通常更倾向于现成数据 ,因为让 10 家不同的实验室各自构建自己的数据集并不合理 , 一次构建 , 多方受益 , 这里面有巨大的价值 。
最后一种 , 我们也会做一点 ,但已经不是我们的重点了 , 就是直接提供专家 , 让客户自己组织专家 , 按小时计费的模式 。
我们偶尔会做一点这种业务 , 比如 Harvey 当初就是通过这种方式跟我们合作的 , 雇了一些律师 ,但随着时间的推移 , 一般会转向上面那种规模化的数据服务 。
好了 ,以上是关于如何构建 RL 环境 ( 它们是什么 ) 的一点背景 。 我真的非常兴奋 , 这些技术 ( 以前只限于前沿实验室使用的技术 ) 正在走向你们所有人。
那么我很乐意回答任何问题 。
Hi, 我是来自 AstroGuy 的阿里 。 我的问题比较开放 ,但很简单 : 你们怎么给数据定价 ? 就是怎么评估数据的价值 。
Brendan, 定价方式有很多种 。 最自然的一种是 : 我们的客户关心的是模型提升 , 对吧 ? 所以客户会有一个既定目标 , 比如他们想在某张排行搒上站到前沿 。
我们就可以倒推 : 这个目标对他们值多少钱 , 我们应该按任务收多少钱 ,以及我们认为多少任务能帮他们达成那个目标 。
比如我们想到英伟达这样的公司 ,他们可能愿意花 10 亿美元拥有一个前沿的开源模型 , 所以这里面有很多复杂性 , 比如我们如何为达成这件事的所有不同要素定价 。
另一种我们定价时会考虑的视角 ,是我们的成本结构 。 当然 , 当我们有一个任务需要 10 小时的人力 , 我们按每小时 150 美元付给专家 , 那成本基础可能就是 1500 美元 。
然后就变成一个问题 : 在这个成本之上, 我们想要多少利润率 , 取决于这个具体任务的差异化和前沿程度 。
但价格区间跨度非常大 , 我们的任务从 50 美元到 1 万美元都有 。 观众 , 你们怎么看待数据质量 ?
数据质量12:53
你提到利用人类专家来标注数据 。 那么从你的角度看 , 怎么比较人类标注的数据和前沿实验室 ( 前沿联盟 )的判断数据 ?
第一个问题是关于我们怎么看待质量 , 第二个是问我们怎么比较人类偏好标签和自动评分器 , 对吧 ?
核心在于 , 一般当人们说 " 数据质量 " 时 ,他们指的是两件事 : 第一是真实性 (Realism), 第二是验证器的准确性 。
关于真实性 , 就拿公司法来说 ,他们想把经济体里所有对应公司法的工作都自动化 , 对吧 ? 所以要怎么确保这真的反映了真实律师环境中的真实分布 。
这也是为什么专家要创建大纲 , 指导数据策划全过程的原因之一 。 环境 、 应用 、 任务 , 所有东西的真实性都极其重要 , 还要细致地理解驱动这种真实性的分类体系 , 覆盖你想要的整个分布 。
第二部分关系到人们思考质量的另一种方式 , 就是验证器的准确性 。 因为训练这类模型的方式是 : 你可能会让 Kimi K3 滚动生成 100 条轨迹 , 然后用这份评分细则给所有轨迹打分 。
你可以想象 , 模型可能走的路径有太多太多条 , 所以你要确保这份评分细则的打分方式 , 和直接让人类对这 100 条轨迹做排序的结果是一致的 。
为此我们做的是一个叫 " 轨迹分析 (Trajectory Analysis)" 的流程 , 我们先让要改进的目标模型滚动生成 10 条轨迹 , 然后给它们全部打分 , 再通过智能体质量控制系统和人工复核的组合 , 确保所有分数与目标一致 。
有时候你也可以用人类反馈 、 评测或偏好标签作为自动评分器的评测基准 , 这是解决这个问题的另一种方式 。
你觉得合成数据生成在整个过程中占多大比重 ? 尤其是在创建这些大型数据室的时候 。
有意思的是 , 我觉得很多人对 " 合成数据 " 这个词存在很大的误解 ,因为 RLVR 本质上就是一次对合成数据的下注 。
它基本上就是让模型滚动生成一大堆合成轨迹 ,而不是让人类去写 SFT、 监督微调数据 , 然后我们给所有这些轨迹打分 , 让模型从这些合成轨迹中学习 。
所以我认为这是合成数据的第一种用法 。 第二种用法是 : 模型在我们填充环境 、 创建任务的过程中扮演着巨大角色 , 就像写法律备忘录的律师绝对应该用 Claude 或 ChatGPT 来写一样 , 构建这些数据室的专家也绝对应该用 Claude、ChatGPT 或任何模型来帮忙 。
模型有太多方式可以让它们更高效 ,但人类仍然是这个过程中不可或缺 、 极具差异化优势的组成部分 。
原因是 , 几乎从定义上讲 , 你需要人类来衡量超出模型能力前沿的东西 。 你不能直接跟模型说 : 给我编一个法律环境 , 然后告诉我你写的法律备忘录哪些好哪些坏 , 这噪音太大了 ,而且没有清晰的信号 。
你需要拥有超出那个模型能力前沿的东西 , 才能可靠地做到这一点 。
RL环境崛起15:51
我的问题是 ,RL 环境现在似乎风靡一时, 可能已经流行了大约一年 。在那之前我真的没怎么听说过它们 , 当时全是人类专家标注 。
所以为什么现在一切都围绕 RL 环境 , 这对应用层公司来说是最值得思考的事情吗 ?RL 环境之后, 还会有什么 ?
那我先讲讲它为什么火起来 ,也许还有 2025 年我们看到的 Deep Research 范式和环境范式之间的一些区别 。 然后我会讲讲展望未来 , 我们看到数据格局正在如何演变 。
具体来说 , 我认为 Deep Research 环境之所以是第一个 ,是因为 Deep Research 有工具使用 : 搜索 。 搜索就是模型在期间工作的那个环境里的工具 ,但专家不一定要去填充应用 , 所以那算是一种更轻量级的 RL 环境 , 专家只需要创建对应的评分细则就行 。
再说一句 , 我现在能讲这些 ,是因为这已经是两三年前的事了 ,不再那么机密 。 然后关于 2025 年的应用趋势 , 我认为它之所以变得如此巨大 ,是因为人们意识到 , 让模型变得有用的主要瓶颈在于模型如何开始使用代码库里的所有上下文 ,以及我们笔记本电脑上的所有工具 , 对吧 ?
所以如果我们想让模型进入用户的使用分布 , 就需要让它进入模型学习的数据分布 。 因此 , 未来这三个类别都将继续出现巨大的多样性扩张 ,但也会有一些变化 。
也许说说我们想得最多的两个变化 : 第一个是超长视野 (Ultra Long Horizon)。 现在智能体大多没有训练去做超过 10 小时的事情 , 我们需要开始为可能需要人类 100 小时甚至 1000 小时才能完成的事情构建任务 , 这将是一个巨大的转变 。
评测新方向17:20
我们看到的另一个重大转变是引入虚拟同事 (Virtual Coworkers), 与前者相对应 。 当人们思考他们的数据分布时, 我最喜欢问的一个问题是 : 你的工作中, 有多大比例的任务需要与其他人互动 ?
大多数人的回答是 60% 或 70%,有些人说更多 ,有些人说略少 。 但是如果你把这个数字对应到 : 有多少比例的评测是在衡量模型与他人互动的能力 ?
大概只有 1%。 也许 Talbench 里面稍微有一点 。 所以这里存在一个巨大的真实性缺口 : 如何真正衡量智能体在整个工作过程中与需要协作的各种人和其他智能体进行社交互动的表现 。
验证器规模化18:18
你谈到了评分细则的生成 , 这是不是一种为任务定制的验证方式 ? 据我理解 , 这受制于专家 。 你们有没有找到方法 , 用你们的模型来规模化这件事 ?
比如让模型给出一些启发式规则 , 甚至训练一些模型来 ——
我们发现 , 如果有一个 AI 副驾 (Copilot) 能与专家协作来创建任务和验证器 , 效率会大大提高 。 这样专家可以和轨迹对话 , 确切地理解正在发生什么 , 哪里出了问题 。
挑战在于 , 如果你试图改进的是 Fable,Fable 无法可靠地写出自己在哪些地方犯错的评分标准 , 它可能说对一半 , 说错一半 ,而这样的噪音量 , 从训练角度看是无法接受的 。
所以这就是为什么最需要人类参与的环节是任务创建 。 比如很多环境的填充 , 我们可以大量使用合成数据 , 让人类来写大纲也很有帮助 ,因为他们熟悉环境 ,而且这些大纲扎根于现实 , 扎根于真实分布 ,但任务本身往往真的需要人类 。
少数例外情况是 : 在代码领域 , 或者如果你是在蒸馏 , 比如如果你有一个比 Kimi K3 差的模型 , 那它肯定可以从 Kimi K3 创建的任务中学习 。
所以如果走那条路 ,是有一些例外的 。
Hi, 我是来自 Quibble 的 Nikhil。 当我们考虑某些可证明的领域 , 比如网络防御或事件响应的 RL 环境时, 模型或智能体要试图在现有系统中找出漏洞 。
这种情况下, 你们是用人类来编写环境或搭建环境 , 还是也用它来评分 ? 有没有办法规模化 ?
我实际上认为 , 网络安全恰恰是那种不一定总是需要人类来做验证器的领域 ,因为你可以有一个攻击者智能体和一个防御者智能体 。
你说得对 , 对于网络安全 , 人类更多是来架构什么样的环境才算 " 真实 ",以及搭建环境 ,因为你确实需要很多多样性 。
但就构建验证器而言 , 它的人力密集程度就低多了 。
你怎么判断什么时候是 " 受限于基础模型 "? 表面上看 , 你们对所有这些模型用的是同一个数据集 , 它们在这份 " 搒单 " 上的最终表现也差不多落在同一个水平 。
模型可训练性20:21
但如果你用一个更小的模型 ,也许这是一个不错的起点 , 它的表现会低得多 。 原因是什么 ? 只是参数数量的问题吗 ?
还是 ——
参数数量肯定会影响模型能多有效地从数据中学习 ,也就是它的可训练性 。 我觉得主要要看的是 Parsite 16 和 Parsite 1 之间的差距 。
如果你有一个模型滚动生成 16 条轨迹 , 它全部搞错了 , 那基本上可以说这个模型从中学习是没希望的 , 至少在大多数情况下是这样 。
也许你再滚动生成 100 条轨迹 , 它只对了 1 条 。 反过来 , 理想的情况是 Parsite 1 失败 ,但 Parsite 16 当你滚动生成 16 条轨迹时, 它能对上 1、2 次 , 那么模型就能非常有效地从中学习 。
所以这通常是我们判断基础模型需要多强 , 才能有效从给定数据集学习的启发式方法 。
合作策略21:27
对于那些与你们在数据上合作的公司 , 你们有什么建议 ? 他们应该自己承担哪些部分作为 RL 后训练的一部分 ,而不是依赖 " 互补 " 的部分是什么 ?
我认为这正是我们业务中很大一部分是 " 定制数据 " 的原因 。 我们有完全隔离 、 专属于关键客户的团队 , 确保我们构建出世界上最好的数据集 , 归他们所有 。
这让他们既能保持由此带来的竞争优势 , 同时又能受益于我们构建的所有基础设施 。 我觉得确实有一些公司试图在内部构建全部的人才网络和基础设施 ,但我认为 , 如果你看看前沿实验室和最好的模型是怎么做的 , 就能得到一个很好的指示 。
与一个拥有所有这些规模经济 ( 平台 、 人才 、 网络等等 )的合作伙伴合作 , 能带来太多的规模经济收益了 。
结尾与广告22:17
总之 , 感谢大家邀请我来 。 这就是今天跟大家分享的全部内容 。 欢迎订阅 《AI 知识录 》, 获取最新鲜的 AI 领域最新知识 。
最后插播一个广告 : 主播自己的 AI 创业产品 Unaway, 一个能一键整合你的飞书 、 钉钉 、 腾讯会议 、Claude 和其他录音卡 / 录音豆 , 随时随地帮您解读日常会议与沟通背后的深意 , 锁定关键信息的 Agent 应用已经正式上线 。
最新的版本也支持了直接给它播客链接 , 它就能轻松完成转写 、 总结 、 分析 , 甚至多个播客的关联解读和分析 。
如果你有兴趣 , 欢迎在本播客的公告栏查看体验方式 。 我们下期见 。
