# 红杉「Own Your Intelligence」专题 6：持续学习-AI 智能体如何越用越好

AI智识录 · 2026-08-14

<https://ai.podhood.com/8cfb679e-fb1e-4cbd-9ba0-64073d32253d>

Trajectory 联合创始人 Arjun Karanam 在红杉资本「Own Your Intelligence」系列压轴演讲中提出「经验差距（Experience Gap）」：模型 IQ 快速提升，但每次对话都像第一天上班，持续学习的核心是把被丢弃的智能体交互 token 转化为让智能体越用越好的信号，实现系统随使用而复利增长。他许下四个愿望：一是全链路可追踪，不只记录顶层动作，还要捕获包含子智能体和工具调用的完整调用树，用户的编辑、撤销、重试远比点赞点踩更有价值；二是评测贴近生产，每个任务要可重放，直接在生产级 Harness 上评分；三是 Harness 不该用「防呆」思维限制模型，而应提供清晰原语、让智能体接口尽可能接近用户界面、让工具返回信息丰富的响应而非简单的 Done；四是拥抱开放权重与模型路由，这是拥有权重并持续迭代的前提。隐私上他的立场很明确：不直接拿客户私有数据训练，而是对客户数据分布采样、合成等价数据后再更新模型。知识分三层：全局通用技能训练进权重，组织级偏好存进情景记忆，个人习惯留在上下文，各归其位、互不污染。他最后介绍 Trajectory 的产品愿景：把后训练的复杂旋钮交给幕后智能体，让任何公司约 15 分钟即可完成训练、评测与部署，拥有自己的经验层。

## Questions this episode answers

### 什么是「经验差距（Experience Gap）」？为什么模型 IQ 提升还不够？

Trajectory 联合创始人 Arjun Karanam 指出，模型只在 IQ 轴上变好，但每次对话都像第一天上班。他打比方：口袋里装着陶哲轩很棒，但陶哲轩在会计师事务所上班第一天大概不是最好的会计，给他几天就会变得非常优秀。经验与 IQ 结合时比想象中更重要，这就是需要弥合的经验差距。

[2:11](https://ai.podhood.com/8cfb679e-fb1e-4cbd-9ba0-64073d32253d?t=131000)

### Arjun 为智能体生态许下了哪四个愿望？

Arjun 围绕四个类别许愿：可追踪性上要追踪包含子智能体和工具调用的整棵调用树，并捕获用户的编辑、撤销、重试等纠错行为，而非噪音极大的点赞点踩；评测要来自真实流量、每个任务可重放、用生产环境的真实 Harness 评分；Harness 应提供原语让智能体自由编排，工具响应要信息丰富；模型方面要拥抱开放权重和模型路由器。

[6:24](https://ai.podhood.com/8cfb679e-fb1e-4cbd-9ba0-64073d32253d?t=384000)

### 不拿客户数据训练的前提下，持续学习如何解决隐私问题？

Arjun 说他来之前在苹果工作，处理过这类问题。方法是不直接在客户数据上训练，而是从客户数据分布中采样，合成生成自己的数据，再用类似密码学的心智模型比较分布，确认数据在分布内。他表示这非常核心，且已和客户在做有趣的事情来克服这一难题。

[15:00](https://ai.podhood.com/8cfb679e-fb1e-4cbd-9ba0-64073d32253d?t=900000)

### 不同类型的用户反馈该如何处理——进模型权重、情景记忆还是上下文？

Arjun 区分两类信号：有人骂智能体、点踩或中途离开，这类只知道出了问题但不知道正确答案，只能惩罚行为；而重试后得到正确方案或明确纠正的，可确信地分配奖励。他还提出相关性层级：工具反复失败这类全局真实的信息应训练进模型，而某用户说永远不想用子智能体这类偏好则留在上下文，甚至可按组织或客户分层。

[15:57](https://ai.podhood.com/8cfb679e-fb1e-4cbd-9ba0-64073d32253d?t=957000)

## Key moments

- **[0:00] 开场介绍**
- **[1:40] 经验差距**
  - [1:51] Trajectory 联合创始人 Arjun：模型 IQ 飞速提升，但每次对话都像上班第一天
  - [2:11] Arjun 用陶哲轩类比「经验差距」：天才会计上班第一天也不会是最好的会计
  - [2:39] 智能体生成的数亿 token 交互被直接丢弃，Arjun 主张把它们转化为训练信号
- **[3:42] 产品方案**
  - [4:03] Trajectory 的产品路径：从真实交互到模型规范（Model Spec），再到更好的模型与 Harness
- **[6:24] 愿望：追踪**
  - [6:24] Arjun 的第一个愿望：全链路可追踪，编辑、撤销、重试远比点赞点踩更有价值
- **[7:31] 愿望：评测**
  - [7:31] 评测愿望：每个任务可重放（Rolloutable），并在生产级 Harness 上直接评分
- **[8:28] 愿望：Harness**
  - [8:28] Harness 别做「防呆」：提供清晰原语让智能体放手编排，工具响应要信息丰富而非只返回 Done
- **[10:10] 愿望：模型**
  - [10:10] Arjun 第四个愿望：拥抱开放权重与模型路由，这是拥有自己权重并持续改进的前提
- **[12:18] 产品演示**
  - [12:18] Trajectory 演示：用产品训练一个模型只需约 15 分钟，后训练旋钮由幕后智能体代管
- **[13:32] 观众问答**
  - [13:45] Q: 持续学习该更新权重还是上下文？Arjun：像内存与硬盘一样抽象掉，跨系统自动优化
  - [14:53] Q: 如何用客户数据训练又不碰隐私？Arjun：对客户数据分布采样、合成等价数据再训练
  - [15:56] 知识分三层：通用技能进权重、组织级偏好进情景记忆、个人习惯留在上下文
- **[17:32] 适用边界**
  - [17:32] Q: 什么任务最需要持续学习？Arjun：用户试探模型能力边缘而失败的前沿任务
- **[19:25] 结尾**

## Speakers

- **Arjun Karanam** (guest)

## Mentioned

Trajectory (company), 苹果 (company), Cursor (product), YouNavi (product)

## Transcript

### 开场介绍

**Arjun Karanam** [0:00]
谢屠龙之树主播庄明昊老师的推荐 。 红杉资本近期发起 "Own Your Intelligence" 系列专题 ， 邀请在企业自建智能议题上走得最远的几家公司做系统分享 。

本期由 Trajectory 联合创始人 Arjun Karanam 主讲 ，也是该系列活动的压轴演讲 。他提出了 " 经验差距 （Experience Gap）" 的概念 ： 模型的 IQ 在快速提升 ，但每次对话都像是第一天上班 。

而持续学习的核心 ， 就是把那些被丢弃的智能体交互 token 转化为让智能体越用越好的信号 。 它围绕可追踪性 （Traceability）、 评测 （Evals）、Harness（ 模型 ） 四个方面许下 4 个愿望 ，并介绍了 Trajectory 的产品愿景 。

**Guest** [0:47]
好的 ， 最后一场演讲把今天的活动带向尾声 。 我们有 Trajectory 的联合创始人 Arjun 和 Ronak，他们围绕我认为是当下最热门的话题之一 —— 持续学习 —— 做了一系列非常有趣的研究 。

让我们欢迎 Arjun 上台 。

**Arjun Karanam** [1:04]
好的 ， 大家好 ， 非常感谢 。 我真的很兴奋 ， 我知道我差不多是最后一个讲的 ， 所以希望大家还剩一点注意力 。

我在这里 ，Ronak 也在后面 ， 所以我们是一起的 。 让我们开始吧 ： 我们是 Trajectory， 正在构建持续学习的平台 。

我们是谁 ？ 我认为我们在做一个非常 、 非常酷的使命 ， 这是最有意思的部分 。 第二有意思的部分是 ， 我能和我最好的两个朋友一起做这件事 。Ronak 来之前曾在 OneServe 和 Trainspeed 一一工作 ，Michael 之前在 DeepMind 做非常酷的机器人研究 。

我想先讲讲我们的世界观 ，以及它如何塑造了我们为什么认为这个问题重要 。 我们的世界观是 ： 这不算什么惊人观点 ， 我们正生活在人类历史上一段不可思议的时期 ， 似乎每周都有新的模型发布 ， 超越上一个 。

### 经验差距

**Arjun Karanam** [1:57]
不可否认 ， 模型正变得越来越好 ，但我们认为它们只是在一个轴上变好 ， 那就是 IQ。 这些模型越来越聪明 ，但当你和它们交谈时， 总觉得像是它们上班的第一天 。

打个比方 ， 如果口袋里装着陶哲轩 Terence Tao， 那很棒 ，但陶哲轩在会计师事务所上班的第一天 ， 大概不会是那里最好的会计 ； 但给他几年， 说句实话 ， 甚至可能只要几天 ，他大概就会变得非常优秀 。

所以我们有一个 " 政交 " 的轴 ： 经验 ， 它与 IQ 结合时， 比我们想象的更重要 。 这就是我们所说的经验差距 （Experience Gap）， 也是我们这家公司想要弥合的 。

但问题是 ， 你如何弥合它 ？ 经验从哪里来 ？ 它其实已经存在于外面了 。 有数不清的 ， 几亿只是一个数字 ； 但有这么多 token 正由这些智能体生成 。

你有时会看到它们 ，有时甚至不看 。 它们就被扔掉了 ，但这是它们做的真实工作 。 人们在这些工作的基础上行动 ， 然后它们被丢弃 。

所以我们公司有一个鲜明的观点 ，Gabe 也提到过 ： 这些是应该被我们学习的信号 。 这也是人类变好的方式 。

而且以典型的 AI 风格 ， 如果人类这样做 ， 那大概就是一个很好的建模参照 。 今天的智能体仍然缓慢 、 昂贵 ， 随着时间推移容易出错 。

你部署它们 ， 它们大概不会变好 。 我们想象一下学习型智能体的样子 ： 当它们被人使用时， 会随着时间推移变得越来越好 。

具体来说 ， 这有两个很好的好处 ： 立刻就能得到更快 、 更好 、 更便宜的模型 ； 但更令人兴奋的是 ， 你达到了 " 系统随使用而复利增长 " 这个目标 。

### 产品方案

**Arjun Karanam** [3:42]
我想先谈谈我们如何解决这个问题 ， 然后在结尾给大家看一些有意思的东西 。 一切都始于 —— 这正好接上 Harrison 之前讲的 —— 可追踪性 （Traceability）。

我们需要首先捕获这些交互 ， 捕获这些被丢弃的经验 。 这是第一步 。 然后第二步 ， 这是我们开始进入研究的领域 。

我们对自己正在构建的公司的定位是 ： 我们构建一个实现持续学习的产品 ，但在这个产品的每一项能力之下， 我们都在做前沿研究 ， 让这些成为可能 。

你有所有这些交互 。 接下来我们构建的是模型规范 （Model Spec） 这个概念 。 这个想法是 ： 你需要一种方式 ， 定义 " 我希望我的智能体做什么 "， 然后让智能体朝着这个目标学习 。

我们正在做非常酷的研究 ： 如何提取用户交互 ， 把它转化为奖励 ， 把轨迹转化为你想让智能体做什么的精确规范 。

然后， 好的 ， 你有了想让智能体做的事情 。 拿它怎么办 ？ 有两个层面 。 一个是模型 ， 对吧 ？ 你想让你的模型从真实的交互中学习 。

我们正在做非常酷的研究 ， 比如 SDPO 之类的算法 ， 用强化学习拿这些完整的长轨迹 ， 随时间改进模型 。

但模型不是全部 ， 你还有 Harness。 我们做了很多很酷的研究 ： 当人们给出好的反馈时， 这个反馈应该进入 Harness 还是进入模型 。

一个例子是 ： 如果它是一个事实 ， 比如 " 这家公司已经被摘牌了 "， 你大概不想把这种知识训练进模型 。

它大概应该是 "Harness 可以获得的上下文 "。 这就是我们拆分事情的方式 ，也是我们正在构建的产品 ： 让你从真实的交互 ， 一路走到 " 你想让智能体改进什么的规范 "， 再到 " 更好的模型 、 更好的 Harness"。

然后立刻部署这些模型 ， 开始使用我们的产品 。 这就是我们想达到的世界 。 如果你构建过智能体 ， 我相信在座大多数人都构建过 。

你大概知道 ， 这些环节的每一个都有很多地方会出错 ，而每一个都是未解决的问题 。 所以我想用这个框架来讲接下来的部分 。

假设我刚从阿拉丁里出来 ， 我有 4 个愿望 。 我会许什么愿望 ， 来让智能体生态变得更好 ？ 今天的智能体离那个理想状态有一个差距 ，有一个智能体需要达到的水平 。

跨过它之后， 我们才能真正看到持续学习的指数级效果 。 那是什么 ？ 我会用刚才讲的 4 个类别逐步来讲 ： 在可追踪性方面 ， 我们希望看到什么 ； 在评测方面 ， 我们希望看到什么 ； 在 Harness 方面 ， 我们希望看到什么 ； 在模型方面 ， 我们希望看到什么 。

### 愿望：追踪

**Arjun Karanam** [6:24]
让我们从第一个愿望开始 ，以及公司如何能更快到达那里 。 可追踪性 ， 这里有两个子愿望 。 第一个是 ： 追踪发生的整棵树 ， 包括子智能体 。

很多公司追踪正在发生的主行动 ， 却把工具调用或子智能体丢掉了 ， 这让你很难从整个过程中学习 。

所以这是第一个愿望 。 第二个子愿望可能是这里最重要的 ： 你应该围绕如何捕获交互数据 ， 同时引导出恰到好处的反馈 ， 来构建你的产品 。

这样你才能捕获它 。 一个非常有意思的点是 ， 我认为第一层的思考方式是 ： 好的 ， 让我们加一个点赞 、 点踩 ， 然后捕获它 。

这在理论上听起来很棒 ，但实际噪音极大 。 如果你用过任何编码智能体 ， 你知道你基本就是接受智能体做的一切 。

然后， 过了 5 次提交之后， 你才说 " 哦糟糕 ， 这把所有东西都搞坏了 ， 让我去撤销它 "。 所以是纠正行为 、 编辑 、 撤销和重试 ， 这些既需要从用户那里引导出来 ，也需要被捕获 。

这就是我在可追踪性上的愿望 。 第二个愿望是关于评测 。 这里的心智模型是 ： 你的用户使用的产品 ， 应该尽可能接近评测所在的环境 。

### 愿望：评测

**Arjun Karanam** [7:42]
也就是说 ， 评测应该尽可能接近训练发生的地方 。在理想世界里 ， 这些是同一个东西 ， 它们之间没有区别 。

这意味着评测来自真实流量 ： 人们如何实际使用你的产品 ， 包括他们现在如何使用 ，以及他们在前沿请求的那些 " 可能还不可行 " 的东西 。

所有这些都非常有帮助 。 第二是让每个任务可回放 （Rolloutable）。 这是一个相当大的基础设施挑战 ，但它的意思是 ： 如果用户做了一件事 ， 我能不能以某种方式重放用户做过的事 ？

在智能体时代 ， 这是一个非常 、 非常有帮助的助推 。 最后， 这一点和第一点呼应 ： 通过真实的 Harness 来评分 ，不是做一个 Harness 的变体 ，而是给人们在生产中实际使用的真实 Harness 评分 。

### 愿望：Harness

**Arjun Karanam** [8:28]
这就是第二个愿望 。 第三个愿望 ， 进入 Harness， 相当重要 。 第一个是 —— 我觉得这里的心智模型是 —— 很多产品是围绕 " 一年半前存在的模型 " 来构建 Harness 的 。

那时候 Harness 的主要功能 ，是防止智能体做坏事 。 当智能体还会随机崩溃或输出格式错误时， 这真的很有用 。

但现在 ， 我们非常处于让智能体自由发挥 （Let the Agents Cook）的世界 。 所以我认为构建 Harness 不应被视为 " 强制执行特定流程 "，而更应看作 ： 你的产品有什么原语 （Primitives）， 无论是搜索工具还是私有信息 ， 然后让智能体去编排这些原语 ， 让它放手去做 。

这是第一个子愿望 。 第二个子愿望 ， 这也是我们构建产品的方式 ，是让智能体接口尽可能接近用户界面 。在理想世界里 ， 我在你的 UI 上能做的每一件事 ， 你的智能体也能通过工具调用做到 。

我认为那是一个 " 让训练和持续学习变得容易得多 " 的世界 。 最后， 这是一个小点 ： 让工具响应信息丰富 。

很容易想 " 好的 ， 我只想知道状态 "。 比如我调用一个搜索工具 ， 我想知道状态 ， 想看看它是否成功了 。

如果它写入数据库 ， 它就写入了 。 我们经常看到的是 ： 那次工具调用的响应 ， 会是 " 完成 "，" 结束了 "。

这在理论上听起来不错 ，但从智能体的角度看 ， 这令人难以置信的困惑 。 而且如果你想从中训练或学习 ， 没有任何信号可以学 ， 对吧 ？

你不知道实际写了什么 ，也不知道实际读了什么 。 所以这是 Harness 下的最后一个子愿望 ： 让你的工具响应信息丰富 。

这是第三个愿望 。 我想 ， 按惯例我只能有 3 个愿望 ，但让我们想象我有 4 个 。 第四个是关于模型的 。

### 愿望：模型

**Arjun Karanam** [10:17]
我们今天已经聊了很多这个 ...... 那就是 ， 我希望切换开放权重模型能像换个模型那么简单 。 但如果你试过 ， 你大概已经看到有 50 个其他考虑 ： 从安全到合规 ， 再到不同的访问授权问题 。

所以 ， 开始习惯在开放权重上运行吧 ，因为那是打开拥有你自己的权重 ， 然后在上面持续改进这扇门的钥匙 。

另外 Gabe 也谈过这个想法 ： 模型路由器 （Model Routers） 大概会在把智能路由到任务的精确能力上扮演很大的角色 。

所以 ， 试验路由器是我向这个世界许下的另一个愿望 。 这是大框架 。 当我们与公司合作时， 我们通常做的第一件事 ，是对这些方面做一次审计 ， 看看它们处于什么位置 。

大多数情况下， 要达到这里还有很多工作要做 。 所以 ， 我们与它们一起把它建起来 。 如果有一天我们去一家公司 ， 发现它们已经建好了其中很多 ， 那会是我的梦想 。

当然 ， 我们也意识到其中很多不能指望 ， 所以我们在做很多很酷的研究 。 比如 " 假设没有人有评测 ， 我们如何克服 ......"

或者 " 假设可追踪性很差 ， 我们如何从现有的信号中学习 "。 这就是我对这个世界许下的愿望 。

我想快速讲一下 ： 我认为这是一个非常 、 非常核心的研究和产品问题 ， 所以我们对我们组建的团队非常兴奋 。

但更重要的是 ， 我们正在与非常前沿的客户合作 。 那些真正在推动智能体在生产中能做到什么的边界的人， 无论是今天还是明天 ， 非常兴奋能和他们合作 。

另外我还想展示的是 ， 我们有 —— 哦 ， 那是我的邮箱 —— 我们有一个测试版 。 我们一个非常核心的信念是 ： 这种能力 ， 拥有你自己的智能的能力 ，不应该经常需要你外包给咨询公司 。

它应该是你自己建立的专业能力 ，因为它对你的产品太重要了 。 这对我们意味着 ： 我们想构建一个产品 ， 让任何公司都能拥有自己的模型 ， 主要通过持续学习从真实交互中获益 。

### 产品演示

**Arjun Karanam** [12:18]
这是我们产品的一些很酷的截图 。 我不知道 Nico 在不在 ， 我本来今天晚些时候要给 Nico 看这个 ， 所以这算是一个预览 ，但这里是 Harvey。

这是 Gabe 谈到的 Lab Benchmark。 导入非常 、 非常容易 ， 训练一个模型也极其容易 。 我们为我们做的界面感到非常自豪 ，因为如果你做过后训练 ， 你知道有 5000 万个东西会出错 ，5000 万个旋钮要转 ，而且全靠研究者的直觉 （Researcher Intuition， 打个星号 ，不管那是什么意思 ）。

我们试图做的是 ： 把我们研究人员后训练模型的所有方式 ， 用一个幕后智能体来照顾大部分旋钮 ， 只暴露你需要知道的那几个 ， 让后训练尽可能简单 。

所以 ， 训练一个模型 ， 看看模型表现如何 ， 评估 、 比较 ， 看它是否比你之前用的模型更好 ， 然后部署它 。

都非常容易 。 就实际投入的工作而言 ， 那还没算等模型训练的时间 ， 大概 15 分钟 。 这就是我们想达到的世界 ： 去赋能所有这些公司 ， 希望还有在做的更多人。

所以 ，是的 ， 这就是我们的目标 。 我们想让每家公司拥有自己的经验层 ， 期待和在座的各位一起构建它 。

### 观众问答

**Guest** [13:32]
谢谢你 ， 很棒的演讲 。 我想问一下， 当你谈持续学习时， 你怎么看待可训练对象 、 模型权重 （Harness）、 工具 、 应用层之间 ？

你怎么看待它们 ？ 你如何排序 ？

**Arjun Karanam** [13:45]
我觉得一个有趣的说法是 ： 如果你问 6 个研究者 " 持续学习是什么 "， 你大概会得到 7 个答案 。 你可以非常纯粹地说 " 哦 ， 它需要像人类一样 ， 就是权重需要在实时单次学习中调整 "。

但我们看待它的方式是 ： 你的产品赖以运行的智能是一个系统 ， 它是一个有很多组件的系统 ， 真正的持续学习是跨这个系统做优化 ， 根据你正在学习的信息 ， 决定系统的哪些部分需要更新 。

我脑子里的类比是 ： 当你保存东西的时候 ， 对吧 ， 我们不再考虑是保存在内存里还是硬盘里 ， 那是被抽象掉的层面 " 基于什么最有意义 " 来决定 。

我们以同样的方式看待模型 （Harness" 与上下文 "）： 感觉不对的是 ， 我们不得不在信息很少的情况下决定该更新什么 。

这是一个可以被解决的科学问题 ， 让我们解决它 ， 然后把它抽象掉 。

**Guest** [14:40]
今天一些演讲者谈到 " 不拿你的客户数据训练 " 的重要性 。 我猜持续学习的一大块是 ： 你从这些交互中学习 ， 你们怎么考虑 " 差分隐私 " 之类的事情 ， 你怎么真正让你的系统变好 。

我猜大多数这些应用公司都有针对特定客户的数据安排 ， 让这变得非常困难 。

**Arjun Karanam** [15:00]
100%。 我认为这是一个极其重要的问题 。 实际上， 来这之前我在苹果工作 ， 我们在那里也相当多地处理这个问题 。

有很多巧妙的方法可以做到 ： 你不是真的在客户数据上训练 ，而是从你的客户数据中采样 、 分布 ， 然后合成生成你自己的数据 ， 再做一种类似密码学的心智模型 ， 比较这些分布 ， 看我的数据是否真的在分布内 。

但你不是直接在客户数据上训练 ， 所以这完全正确 。 那里有很多有趣的工作 ， 它非常核心 ，而且我们已经和客户在做一些有趣的事情来克服这一点 。

**Guest** [15:36]
Hi， 我是 Said， 来自 Finch。 谢谢你 。 我认为情景记忆 （Episodic Memory） 在持续学习中起了一定作用 。 比如 ， 如果用户在我们的平台上做了一件事 ： 纠正了智能体之前做的事 ， 我们可能想要更新智能体的行为 。Trajectory 对这个问题有鲜明的观点吗 ？

**Arjun Karanam** [15:57]
是的 。 我想 ， 关于情景记忆 —— 我重复一下 —— 关于情景记忆 ， 如果我没想错的话 ， 问题是 ： 不同类型的反馈如何影响所学到的东西 。

一种看待方式是 ： 有两种不同类型的信号 。 有那种只是出了问题的信号 ， 比如如果有人骂智能体说 " 你真的很差 "，但没有后续跟进 ， 或者只是点了个踩 ， 或者中途离开了会话 。

这些是 " 你知道出了事 ，但不知道正确的样子是什么 " 的案例 。 然后你有向智能体重试 ， 然后得到了正确解决方案的情况 ， 或者你通过说 " 这是一个差异 " 来纠正它 。

这就是我们做的区分 。在后一种情况下， 我们对与输出相关的奖励 ， 我们分配的东西 ， 非常 、 非常确信 ； 在前一种情况下， 我们知道要惩罚那个行为 ，但我们不一定说存在一个正确的答案 ， 这是看待它的一种方式 。

另一种看待方式是 ： 信息对人来说有一个相关性层级 ，有些信息大概是全局准确的 、 全局真实的 。

比如调用某个工具时反复失败 ， 那可能对每个人都相关 ， 所以这应该被训练进模型 ， 模型应该在学会这个工具上变得更好 。

而某个用户说 " 我永远不想用子智能体 ， 拜托拜托拜托别用它 "， 那大概不是你应该训练进模型的东西 ，而是留给上下文 。

而且我们非常兴奋的是 ， 这正是 Harvey 讲的 ： 这实际上可能会按组织 、 甚至更进一步按客户发生 。 所以这是另一种思考方式 ，也就是反馈所相关的层级 。

### 适用边界

**Guest** [17:32]
我觉得今天的一个主题是 ： 在你的产品里 ，有一些任务或部分 ， 你想更多实验 、 更便宜 、 加更多开源的东西 ， 对吧 ？

而其他领域 ， 处在前沿 、 使用闭源模型或闭源框架更有用 。 我猜把这个类比延伸到持续学习 ： 有哪些任务或工作流 ， 或者说什么问题形态 ，是你看到持续学习真的非常重要的 ？

相比之下， 只是用一个静态训练的前沿模型 ， 甚至一个静态训练的开源模型 ， 然后用 Harness 把相关信息注入上下文 ， 就足够达到用户通常想要达到的目标 ？

**Arjun Karanam** [18:12]
是的 ， 这是一个很棒的问题 。 我想第一层的答案是 ： 我认为大多数任务都能用持续学习 ，但我最兴奋的是那些 " 处于前沿 " 的任务 。

我们关于 AI 进步的心智模型是 ： 人们会带着他们期望产品能做到什么的预期 ， 去问模型 、 问产品 。

也许他们会试探产品做不到的边缘 ， 然后看到它失败 ， 或者看到它做错事 ， 然后退回去想 " 哦 ， 它不够好 ， 我不能用它做这个 "。

我觉得一个很好的例子是 ： 两年前 ， 我会不会做梦打出那些给 Cursor 的疯狂查询 ？ 绝对不会 。 我的期待比这低多了 。

但随着时间推移 ， 我开始查询它 ， 模型在变好 。 我想 ， 好吧 ，也许我们可以做越来越大的事 。 我们最兴奋的是 ： 这种情况发生的方式是 ， 模型总体上变好了 ，而且我们在有针对性地推动某些方向 。

但我们从一些客户那里看到的是 ： 用户要求一些模型勉强能做到的事 ，但在训练中它学会了怎么做 ， 然后用户现在能做之前做不到的事 。

这个链条才是持续学习真正令人兴奋的地方 ： 基于用户尝试而做不到的事 ， 真正推动可能的边界 。

**Guest** [19:25]
太棒了 ， 谢谢你 ，Arjun。 我想我们时间到了 ， 非常感谢你做这个分享 。

### 结尾

**Arjun Karanam** [19:30]
这就是今天跟大家分享的全部内容 。 欢迎订阅 《AI 智识录 》， 获取最新鲜的 AI 领域最新智识 。 最后插播一个广告 ： 主播自己的 AI 创业产品 ——YouNavi， 一个能一键整合你的飞书 、 钉钉 、 腾讯会议 、Claude 和其他录音卡 、 录音豆 ， 随时随地帮您解读日常会议与沟通背后的深意 ， 锁定关键信息的 Agent 应用已经正式上线 。

最新的版本也支持了直接给它播客链接 ， 它就能轻松完成转写 、 总结 、 分析 ， 甚至多个播客的关联解读和分析 。

如果你有兴趣 ， 欢迎在本播客的公告栏查看体验方式 。 我们下期见 。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
