AIAI智识录2026年8月14日· 20:15

红杉「Own Your Intelligence」专题 6:持续学习-AI 智能体如何越用越好

Trajectory 联合创始人 Arjun Karanam 在红杉资本「Own Your Intelligence」系列压轴演讲中提出「经验差距(Experience Gap)」:模型 IQ 快速提升,但每次对话都像第一天上班,持续学习的核心是把被丢弃的智能体交互 token 转化为让智能体越用越好的信号,实现系统随使用而复利增长。他许下四个愿望:一是全链路可追踪,不只记录顶层动作,还要捕获包含子智能体和工具调用的完整调用树,用户的编辑、撤销、重试远比点赞点踩更有价值;二是评测贴近生产,每个任务要可重放,直接在生产级 Harness 上评分;三是 Harness 不该用「防呆」思维限制模型,而应提供清晰原语、让智能体接口尽可能接近用户界面、让工具返回信息丰富的响应而非简单的 Done;四是拥抱开放权重与模型路由,这是拥有权重并持续迭代的前提。隐私上他的立场很明确:不直接拿客户私有数据训练,而是对客户数据分布采样、合成等价数据后再更新模型。知识分三层:全局通用技能训练进权重,组织级偏好存进情景记忆,个人习惯留在上下文,各归其位、互不污染。他最后介绍 Trajectory 的产品愿景:把后训练的复杂旋钮交给幕后智能体,让任何公司约 15 分钟即可完成训练、评测与部署,拥有自己的经验层。

  1. 0:00开场介绍
  2. 1:40经验差距
  3. 3:42产品方案
  4. 6:24愿望:追踪
  5. 7:31愿望:评测
  6. 8:28愿望:Harness
  7. 10:10愿望:模型
  8. 12:18产品演示
  9. 13:32观众问答
  10. 17:32适用边界
  11. 19:25结尾

PodHood 提供支持

文字稿

开场介绍0:00

Arjun Karanam0:00

谢屠龙之树主播庄明昊老师的推荐 。 红杉资本近期发起 "Own Your Intelligence" 系列专题 , 邀请在企业自建智能议题上走得最远的几家公司做系统分享 。

本期由 Trajectory 联合创始人 Arjun Karanam 主讲 ,也是该系列活动的压轴演讲 。他提出了 " 经验差距 (Experience Gap)" 的概念 : 模型的 IQ 在快速提升 ,但每次对话都像是第一天上班 。

而持续学习的核心 , 就是把那些被丢弃的智能体交互 token 转化为让智能体越用越好的信号 。 它围绕可追踪性 (Traceability)、 评测 (Evals)、Harness( 模型 ) 四个方面许下 4 个愿望 ,并介绍了 Trajectory 的产品愿景 。

Guest0:47

好的 , 最后一场演讲把今天的活动带向尾声 。 我们有 Trajectory 的联合创始人 Arjun 和 Ronak,他们围绕我认为是当下最热门的话题之一 —— 持续学习 —— 做了一系列非常有趣的研究 。

让我们欢迎 Arjun 上台 。

Arjun Karanam1:04

好的 , 大家好 , 非常感谢 。 我真的很兴奋 , 我知道我差不多是最后一个讲的 , 所以希望大家还剩一点注意力 。

我在这里 ,Ronak 也在后面 , 所以我们是一起的 。 让我们开始吧 : 我们是 Trajectory, 正在构建持续学习的平台 。

我们是谁 ? 我认为我们在做一个非常 、 非常酷的使命 , 这是最有意思的部分 。 第二有意思的部分是 , 我能和我最好的两个朋友一起做这件事 。Ronak 来之前曾在 OneServe 和 Trainspeed 一一工作 ,Michael 之前在 DeepMind 做非常酷的机器人研究 。

我想先讲讲我们的世界观 ,以及它如何塑造了我们为什么认为这个问题重要 。 我们的世界观是 : 这不算什么惊人观点 , 我们正生活在人类历史上一段不可思议的时期 , 似乎每周都有新的模型发布 , 超越上一个 。

经验差距1:40

Arjun Karanam1:57

不可否认 , 模型正变得越来越好 ,但我们认为它们只是在一个轴上变好 , 那就是 IQ。 这些模型越来越聪明 ,但当你和它们交谈时, 总觉得像是它们上班的第一天 。

打个比方 , 如果口袋里装着陶哲轩 Terence Tao, 那很棒 ,但陶哲轩在会计师事务所上班的第一天 , 大概不会是那里最好的会计 ; 但给他几年, 说句实话 , 甚至可能只要几天 ,他大概就会变得非常优秀 。

所以我们有一个 " 政交 " 的轴 : 经验 , 它与 IQ 结合时, 比我们想象的更重要 。 这就是我们所说的经验差距 (Experience Gap), 也是我们这家公司想要弥合的 。

但问题是 , 你如何弥合它 ? 经验从哪里来 ? 它其实已经存在于外面了 。 有数不清的 , 几亿只是一个数字 ; 但有这么多 token 正由这些智能体生成 。

你有时会看到它们 ,有时甚至不看 。 它们就被扔掉了 ,但这是它们做的真实工作 。 人们在这些工作的基础上行动 , 然后它们被丢弃 。

所以我们公司有一个鲜明的观点 ,Gabe 也提到过 : 这些是应该被我们学习的信号 。 这也是人类变好的方式 。

而且以典型的 AI 风格 , 如果人类这样做 , 那大概就是一个很好的建模参照 。 今天的智能体仍然缓慢 、 昂贵 , 随着时间推移容易出错 。

你部署它们 , 它们大概不会变好 。 我们想象一下学习型智能体的样子 : 当它们被人使用时, 会随着时间推移变得越来越好 。

具体来说 , 这有两个很好的好处 : 立刻就能得到更快 、 更好 、 更便宜的模型 ; 但更令人兴奋的是 , 你达到了 " 系统随使用而复利增长 " 这个目标 。

产品方案3:42

Arjun Karanam3:42

我想先谈谈我们如何解决这个问题 , 然后在结尾给大家看一些有意思的东西 。 一切都始于 —— 这正好接上 Harrison 之前讲的 —— 可追踪性 (Traceability)。

我们需要首先捕获这些交互 , 捕获这些被丢弃的经验 。 这是第一步 。 然后第二步 , 这是我们开始进入研究的领域 。

我们对自己正在构建的公司的定位是 : 我们构建一个实现持续学习的产品 ,但在这个产品的每一项能力之下, 我们都在做前沿研究 , 让这些成为可能 。

你有所有这些交互 。 接下来我们构建的是模型规范 (Model Spec) 这个概念 。 这个想法是 : 你需要一种方式 , 定义 " 我希望我的智能体做什么 ", 然后让智能体朝着这个目标学习 。

我们正在做非常酷的研究 : 如何提取用户交互 , 把它转化为奖励 , 把轨迹转化为你想让智能体做什么的精确规范 。

然后, 好的 , 你有了想让智能体做的事情 。 拿它怎么办 ? 有两个层面 。 一个是模型 , 对吧 ? 你想让你的模型从真实的交互中学习 。

我们正在做非常酷的研究 , 比如 SDPO 之类的算法 , 用强化学习拿这些完整的长轨迹 , 随时间改进模型 。

但模型不是全部 , 你还有 Harness。 我们做了很多很酷的研究 : 当人们给出好的反馈时, 这个反馈应该进入 Harness 还是进入模型 。

一个例子是 : 如果它是一个事实 , 比如 " 这家公司已经被摘牌了 ", 你大概不想把这种知识训练进模型 。

它大概应该是 "Harness 可以获得的上下文 "。 这就是我们拆分事情的方式 ,也是我们正在构建的产品 : 让你从真实的交互 , 一路走到 " 你想让智能体改进什么的规范 ", 再到 " 更好的模型 、 更好的 Harness"。

然后立刻部署这些模型 , 开始使用我们的产品 。 这就是我们想达到的世界 。 如果你构建过智能体 , 我相信在座大多数人都构建过 。

你大概知道 , 这些环节的每一个都有很多地方会出错 ,而每一个都是未解决的问题 。 所以我想用这个框架来讲接下来的部分 。

假设我刚从阿拉丁里出来 , 我有 4 个愿望 。 我会许什么愿望 , 来让智能体生态变得更好 ? 今天的智能体离那个理想状态有一个差距 ,有一个智能体需要达到的水平 。

跨过它之后, 我们才能真正看到持续学习的指数级效果 。 那是什么 ? 我会用刚才讲的 4 个类别逐步来讲 : 在可追踪性方面 , 我们希望看到什么 ; 在评测方面 , 我们希望看到什么 ; 在 Harness 方面 , 我们希望看到什么 ; 在模型方面 , 我们希望看到什么 。

愿望:追踪6:24

Arjun Karanam6:24

让我们从第一个愿望开始 ,以及公司如何能更快到达那里 。 可追踪性 , 这里有两个子愿望 。 第一个是 : 追踪发生的整棵树 , 包括子智能体 。

很多公司追踪正在发生的主行动 , 却把工具调用或子智能体丢掉了 , 这让你很难从整个过程中学习 。

所以这是第一个愿望 。 第二个子愿望可能是这里最重要的 : 你应该围绕如何捕获交互数据 , 同时引导出恰到好处的反馈 , 来构建你的产品 。

这样你才能捕获它 。 一个非常有意思的点是 , 我认为第一层的思考方式是 : 好的 , 让我们加一个点赞 、 点踩 , 然后捕获它 。

这在理论上听起来很棒 ,但实际噪音极大 。 如果你用过任何编码智能体 , 你知道你基本就是接受智能体做的一切 。

然后, 过了 5 次提交之后, 你才说 " 哦糟糕 , 这把所有东西都搞坏了 , 让我去撤销它 "。 所以是纠正行为 、 编辑 、 撤销和重试 , 这些既需要从用户那里引导出来 ,也需要被捕获 。

这就是我在可追踪性上的愿望 。 第二个愿望是关于评测 。 这里的心智模型是 : 你的用户使用的产品 , 应该尽可能接近评测所在的环境 。

愿望:评测7:31

Arjun Karanam7:42

也就是说 , 评测应该尽可能接近训练发生的地方 。在理想世界里 , 这些是同一个东西 , 它们之间没有区别 。

这意味着评测来自真实流量 : 人们如何实际使用你的产品 , 包括他们现在如何使用 ,以及他们在前沿请求的那些 " 可能还不可行 " 的东西 。

所有这些都非常有帮助 。 第二是让每个任务可回放 (Rolloutable)。 这是一个相当大的基础设施挑战 ,但它的意思是 : 如果用户做了一件事 , 我能不能以某种方式重放用户做过的事 ?

在智能体时代 , 这是一个非常 、 非常有帮助的助推 。 最后, 这一点和第一点呼应 : 通过真实的 Harness 来评分 ,不是做一个 Harness 的变体 ,而是给人们在生产中实际使用的真实 Harness 评分 。

愿望:Harness8:28

Arjun Karanam8:28

这就是第二个愿望 。 第三个愿望 , 进入 Harness, 相当重要 。 第一个是 —— 我觉得这里的心智模型是 —— 很多产品是围绕 " 一年半前存在的模型 " 来构建 Harness 的 。

那时候 Harness 的主要功能 ,是防止智能体做坏事 。 当智能体还会随机崩溃或输出格式错误时, 这真的很有用 。

但现在 , 我们非常处于让智能体自由发挥 (Let the Agents Cook)的世界 。 所以我认为构建 Harness 不应被视为 " 强制执行特定流程 ",而更应看作 : 你的产品有什么原语 (Primitives), 无论是搜索工具还是私有信息 , 然后让智能体去编排这些原语 , 让它放手去做 。

这是第一个子愿望 。 第二个子愿望 , 这也是我们构建产品的方式 ,是让智能体接口尽可能接近用户界面 。在理想世界里 , 我在你的 UI 上能做的每一件事 , 你的智能体也能通过工具调用做到 。

我认为那是一个 " 让训练和持续学习变得容易得多 " 的世界 。 最后, 这是一个小点 : 让工具响应信息丰富 。

很容易想 " 好的 , 我只想知道状态 "。 比如我调用一个搜索工具 , 我想知道状态 , 想看看它是否成功了 。

如果它写入数据库 , 它就写入了 。 我们经常看到的是 : 那次工具调用的响应 , 会是 " 完成 "," 结束了 "。

这在理论上听起来不错 ,但从智能体的角度看 , 这令人难以置信的困惑 。 而且如果你想从中训练或学习 , 没有任何信号可以学 , 对吧 ?

你不知道实际写了什么 ,也不知道实际读了什么 。 所以这是 Harness 下的最后一个子愿望 : 让你的工具响应信息丰富 。

这是第三个愿望 。 我想 , 按惯例我只能有 3 个愿望 ,但让我们想象我有 4 个 。 第四个是关于模型的 。

愿望:模型10:10

Arjun Karanam10:17

我们今天已经聊了很多这个 ...... 那就是 , 我希望切换开放权重模型能像换个模型那么简单 。 但如果你试过 , 你大概已经看到有 50 个其他考虑 : 从安全到合规 , 再到不同的访问授权问题 。

所以 , 开始习惯在开放权重上运行吧 ,因为那是打开拥有你自己的权重 , 然后在上面持续改进这扇门的钥匙 。

另外 Gabe 也谈过这个想法 : 模型路由器 (Model Routers) 大概会在把智能路由到任务的精确能力上扮演很大的角色 。

所以 , 试验路由器是我向这个世界许下的另一个愿望 。 这是大框架 。 当我们与公司合作时, 我们通常做的第一件事 ,是对这些方面做一次审计 , 看看它们处于什么位置 。

大多数情况下, 要达到这里还有很多工作要做 。 所以 , 我们与它们一起把它建起来 。 如果有一天我们去一家公司 , 发现它们已经建好了其中很多 , 那会是我的梦想 。

当然 , 我们也意识到其中很多不能指望 , 所以我们在做很多很酷的研究 。 比如 " 假设没有人有评测 , 我们如何克服 ......"

或者 " 假设可追踪性很差 , 我们如何从现有的信号中学习 "。 这就是我对这个世界许下的愿望 。

我想快速讲一下 : 我认为这是一个非常 、 非常核心的研究和产品问题 , 所以我们对我们组建的团队非常兴奋 。

但更重要的是 , 我们正在与非常前沿的客户合作 。 那些真正在推动智能体在生产中能做到什么的边界的人, 无论是今天还是明天 , 非常兴奋能和他们合作 。

另外我还想展示的是 , 我们有 —— 哦 , 那是我的邮箱 —— 我们有一个测试版 。 我们一个非常核心的信念是 : 这种能力 , 拥有你自己的智能的能力 ,不应该经常需要你外包给咨询公司 。

它应该是你自己建立的专业能力 ,因为它对你的产品太重要了 。 这对我们意味着 : 我们想构建一个产品 , 让任何公司都能拥有自己的模型 , 主要通过持续学习从真实交互中获益 。

产品演示12:18

Arjun Karanam12:18

这是我们产品的一些很酷的截图 。 我不知道 Nico 在不在 , 我本来今天晚些时候要给 Nico 看这个 , 所以这算是一个预览 ,但这里是 Harvey。

这是 Gabe 谈到的 Lab Benchmark。 导入非常 、 非常容易 , 训练一个模型也极其容易 。 我们为我们做的界面感到非常自豪 ,因为如果你做过后训练 , 你知道有 5000 万个东西会出错 ,5000 万个旋钮要转 ,而且全靠研究者的直觉 (Researcher Intuition, 打个星号 ,不管那是什么意思 )。

我们试图做的是 : 把我们研究人员后训练模型的所有方式 , 用一个幕后智能体来照顾大部分旋钮 , 只暴露你需要知道的那几个 , 让后训练尽可能简单 。

所以 , 训练一个模型 , 看看模型表现如何 , 评估 、 比较 , 看它是否比你之前用的模型更好 , 然后部署它 。

都非常容易 。 就实际投入的工作而言 , 那还没算等模型训练的时间 , 大概 15 分钟 。 这就是我们想达到的世界 : 去赋能所有这些公司 , 希望还有在做的更多人。

所以 ,是的 , 这就是我们的目标 。 我们想让每家公司拥有自己的经验层 , 期待和在座的各位一起构建它 。

观众问答13:32

Guest13:32

谢谢你 , 很棒的演讲 。 我想问一下, 当你谈持续学习时, 你怎么看待可训练对象 、 模型权重 (Harness)、 工具 、 应用层之间 ?

你怎么看待它们 ? 你如何排序 ?

Arjun Karanam13:45

我觉得一个有趣的说法是 : 如果你问 6 个研究者 " 持续学习是什么 ", 你大概会得到 7 个答案 。 你可以非常纯粹地说 " 哦 , 它需要像人类一样 , 就是权重需要在实时单次学习中调整 "。

但我们看待它的方式是 : 你的产品赖以运行的智能是一个系统 , 它是一个有很多组件的系统 , 真正的持续学习是跨这个系统做优化 , 根据你正在学习的信息 , 决定系统的哪些部分需要更新 。

我脑子里的类比是 : 当你保存东西的时候 , 对吧 , 我们不再考虑是保存在内存里还是硬盘里 , 那是被抽象掉的层面 " 基于什么最有意义 " 来决定 。

我们以同样的方式看待模型 (Harness" 与上下文 "): 感觉不对的是 , 我们不得不在信息很少的情况下决定该更新什么 。

这是一个可以被解决的科学问题 , 让我们解决它 , 然后把它抽象掉 。

Guest14:40

今天一些演讲者谈到 " 不拿你的客户数据训练 " 的重要性 。 我猜持续学习的一大块是 : 你从这些交互中学习 , 你们怎么考虑 " 差分隐私 " 之类的事情 , 你怎么真正让你的系统变好 。

我猜大多数这些应用公司都有针对特定客户的数据安排 , 让这变得非常困难 。

Arjun Karanam15:00

100%。 我认为这是一个极其重要的问题 。 实际上, 来这之前我在苹果工作 , 我们在那里也相当多地处理这个问题 。

有很多巧妙的方法可以做到 : 你不是真的在客户数据上训练 ,而是从你的客户数据中采样 、 分布 , 然后合成生成你自己的数据 , 再做一种类似密码学的心智模型 , 比较这些分布 , 看我的数据是否真的在分布内 。

但你不是直接在客户数据上训练 , 所以这完全正确 。 那里有很多有趣的工作 , 它非常核心 ,而且我们已经和客户在做一些有趣的事情来克服这一点 。

Guest15:36

Hi, 我是 Said, 来自 Finch。 谢谢你 。 我认为情景记忆 (Episodic Memory) 在持续学习中起了一定作用 。 比如 , 如果用户在我们的平台上做了一件事 : 纠正了智能体之前做的事 , 我们可能想要更新智能体的行为 。Trajectory 对这个问题有鲜明的观点吗 ?

Arjun Karanam15:57

是的 。 我想 , 关于情景记忆 —— 我重复一下 —— 关于情景记忆 , 如果我没想错的话 , 问题是 : 不同类型的反馈如何影响所学到的东西 。

一种看待方式是 : 有两种不同类型的信号 。 有那种只是出了问题的信号 , 比如如果有人骂智能体说 " 你真的很差 ",但没有后续跟进 , 或者只是点了个踩 , 或者中途离开了会话 。

这些是 " 你知道出了事 ,但不知道正确的样子是什么 " 的案例 。 然后你有向智能体重试 , 然后得到了正确解决方案的情况 , 或者你通过说 " 这是一个差异 " 来纠正它 。

这就是我们做的区分 。在后一种情况下, 我们对与输出相关的奖励 , 我们分配的东西 , 非常 、 非常确信 ; 在前一种情况下, 我们知道要惩罚那个行为 ,但我们不一定说存在一个正确的答案 , 这是看待它的一种方式 。

另一种看待方式是 : 信息对人来说有一个相关性层级 ,有些信息大概是全局准确的 、 全局真实的 。

比如调用某个工具时反复失败 , 那可能对每个人都相关 , 所以这应该被训练进模型 , 模型应该在学会这个工具上变得更好 。

而某个用户说 " 我永远不想用子智能体 , 拜托拜托拜托别用它 ", 那大概不是你应该训练进模型的东西 ,而是留给上下文 。

而且我们非常兴奋的是 , 这正是 Harvey 讲的 : 这实际上可能会按组织 、 甚至更进一步按客户发生 。 所以这是另一种思考方式 ,也就是反馈所相关的层级 。

适用边界17:32

Guest17:32

我觉得今天的一个主题是 : 在你的产品里 ,有一些任务或部分 , 你想更多实验 、 更便宜 、 加更多开源的东西 , 对吧 ?

而其他领域 , 处在前沿 、 使用闭源模型或闭源框架更有用 。 我猜把这个类比延伸到持续学习 : 有哪些任务或工作流 , 或者说什么问题形态 ,是你看到持续学习真的非常重要的 ?

相比之下, 只是用一个静态训练的前沿模型 , 甚至一个静态训练的开源模型 , 然后用 Harness 把相关信息注入上下文 , 就足够达到用户通常想要达到的目标 ?

Arjun Karanam18:12

是的 , 这是一个很棒的问题 。 我想第一层的答案是 : 我认为大多数任务都能用持续学习 ,但我最兴奋的是那些 " 处于前沿 " 的任务 。

我们关于 AI 进步的心智模型是 : 人们会带着他们期望产品能做到什么的预期 , 去问模型 、 问产品 。

也许他们会试探产品做不到的边缘 , 然后看到它失败 , 或者看到它做错事 , 然后退回去想 " 哦 , 它不够好 , 我不能用它做这个 "。

我觉得一个很好的例子是 : 两年前 , 我会不会做梦打出那些给 Cursor 的疯狂查询 ? 绝对不会 。 我的期待比这低多了 。

但随着时间推移 , 我开始查询它 , 模型在变好 。 我想 , 好吧 ,也许我们可以做越来越大的事 。 我们最兴奋的是 : 这种情况发生的方式是 , 模型总体上变好了 ,而且我们在有针对性地推动某些方向 。

但我们从一些客户那里看到的是 : 用户要求一些模型勉强能做到的事 ,但在训练中它学会了怎么做 , 然后用户现在能做之前做不到的事 。

这个链条才是持续学习真正令人兴奋的地方 : 基于用户尝试而做不到的事 , 真正推动可能的边界 。

Guest19:25

太棒了 , 谢谢你 ,Arjun。 我想我们时间到了 , 非常感谢你做这个分享 。

结尾19:25

Arjun Karanam19:30

这就是今天跟大家分享的全部内容 。 欢迎订阅 《AI 智识录 》, 获取最新鲜的 AI 领域最新智识 。 最后插播一个广告 : 主播自己的 AI 创业产品 ——YouNavi, 一个能一键整合你的飞书 、 钉钉 、 腾讯会议 、Claude 和其他录音卡 、 录音豆 , 随时随地帮您解读日常会议与沟通背后的深意 , 锁定关键信息的 Agent 应用已经正式上线 。

最新的版本也支持了直接给它播客链接 , 它就能轻松完成转写 、 总结 、 分析 , 甚至多个播客的关联解读和分析 。

如果你有兴趣 , 欢迎在本播客的公告栏查看体验方式 。 我们下期见 。