# 汤道生x姚顺雨对谈：腾讯AI下半场

AI智识录 · 2026-06-05

<https://ai.podhood.com/b07861c4-ba91-49c0-908c-1581e5ffdb1c>

腾讯高级执行副总裁汤道生与腾讯首席AI科学家、ReAct架构提出者姚顺雨对谈，主张AI下半场的核心壁垒不再是模型本身，而是寻找值得解决的真实通用问题，以及对原始输入数据、真实用户行为和独家Context（上下文）的掌握。姚顺雨解释他因腾讯的产品矩阵、坦诚文化及'基于Trust而非Metric'的运转方式而加入，提出构建Foundation（基础模型）、产品、Frontier（前沿探索）三足均衡的组织。两人详述'Code Design'实践：反对刷榜、建立基于真实业务的Eval，腾讯曾派后训练最强骨干帮元宝做DeepSeek后训练以换取互信，模型与元宝、ima、WorkBuddy协同产生的聊天、搜索等能力可跨产品泛化反哺。谈及混元三Preview，姚顺雨称大模型没有算法秘密，重点在重建基础设施、丰富数据Taxonomy，将攻坚具备图灵完备性的代码智能体，并认为在中国打造高性价比中小模型的变现价值大于极限跑分提升一两个百分点。汤道生分享AI时代产品从'预设菜单'转向开放式交互，开发转向3-5人扁平小分队、高度容错试错，工程师从写代码转向架构设计与测试对齐。面对'腾讯AI慢了'的质疑，汤道生回应AI是没有尽头的马拉松，腾讯的多业态产品与真实场景将提供长跑底气。

## Questions this episode answers

### 姚顺雨所说的AI"下半场"是什么意思？下半场最重要的竞争壁垒是什么？

姚顺雨解释，预训练和后训练让模型成为通用的"万能锤子"，方法论已成熟，寻找值得解决的真实问题反而更难。下半场的核心壁垒不再是模型本身，而是掌握原始输入数据、真实用户行为和独家Context，腾讯在这方面有很强优势。

[0:13](https://ai.podhood.com/b07861c4-ba91-49c0-908c-1581e5ffdb1c?t=13000)

### 腾讯内部做Eval和外部刷榜的Benchmark有什么区别？

姚顺雨认为榜单容易Saturate，基于真实世界数据的Eval有三个帮助：发现榜单测不出的底线问题（这也是发Preview模型的目的）；了解真实的Prompt Distribution，现实问题往往模糊且多轮追问；还能从产品获得灵感，推进尚无榜单的新领域，如Context Learning。

[9:28](https://ai.podhood.com/b07861c4-ba91-49c0-908c-1581e5ffdb1c?t=568000)

### 混元三Preview具体做了哪些改变？

姚顺雨称做大模型没有秘密，算法反而简单。混元三主要做了三件事：重建预训练和强化学习的基础设施；大幅改进数据和Eval，定义更真实的问题、丰富Data Taxonomy、提升数据质量；以及大量决策依赖Taste，包括招人、设定模型节奏和权衡各种Trade-off。

[16:49](https://ai.podhood.com/b07861c4-ba91-49c0-908c-1581e5ffdb1c?t=1009000)

### Token成本暴涨，如何提升模型解决问题的Token效率？高性价比中小模型价值何在？

姚顺雨认为性价比首先是Performance：用Opus这类强模型反而更省钱，因为更快把事做对，还省人力。成本上中国领先世界，但关键是让更小的模型做好高价值任务。他主张做鲁棒性强、比肩大模型性能的较小模型，比在长程任务上提升一两个点更有价值。

[29:59](https://ai.podhood.com/b07861c4-ba91-49c0-908c-1581e5ffdb1c?t=1799000)

## Key moments

- **[0:00] 加入腾讯**
  - [0:13] 姚顺雨解释"AI下半场"：方法论已成熟，寻找值得解决的真实问题成为核心矛盾
  - [0:56] 姚顺雨：预训练和后训练让AI成为"万能锤子"，难的是找对钉子
  - [2:39] 姚顺雨：企业未来竞争壁垒不在模型，而在原始输入数据与独家Context
  - [3:50] 姚顺雨谈加入腾讯的最重要原因：坦诚文化、基于Trust而非Metric运转
- **[5:35] 模型与产品**
  - [5:39] 姚顺雨提出AI组织三角：Foundation、产品、Frontier三者需均衡构建
  - [7:06] 姚顺雨批评中国AI圈"刷榜"风气：应基于真实产品场景构造Eval
- **[9:28] 评测体系**
  - [9:28] 姚顺雨：腾讯产品矩阵数据可相互泛化，元宝的聊天搜索能力可迁移到ima和WorkBuddy
  - [9:45] Q: 内部Eval和外部榜单有什么区别？姚顺雨：榜单易饱和，真实数据能暴露底线问题
- **[11:43] 产品原理**
  - [12:36] 汤道生谈AI时代做产品之变：从预设菜单到开放式交互，瀑布式流程需重新设计
  - [13:37] 姚顺雨：LLM时代与过去AI的本质区别是泛化性，做Coding Agent也需要聊天、搜索、推理能力
  - [15:55] 汤道生：今年大部分代码由AI生成，工程师转向架构设计，测试左移前置
- **[16:49] 混元三**
  - [17:09] 姚顺雨揭秘混元三Preview：没有算法秘密，重点是重建基础设施、数据和Eval
- **[18:15] 信任构建**
  - [21:36] 姚顺雨回忆派后训练最强骨干帮元宝做DeepSeek后训练：建立模型与产品互信的关键一步
- **[22:35] ReAct回望**
  - [22:54] 姚顺雨重读2019年博士论文：从Next Token Prediction到Digital Automation的预言兑现
  - [24:59] 姚顺雨回忆2022年7月ReAct首次跑通：像微弱的电灯丝突然亮了的感觉
- **[26:53] Token效率**
  - [27:23] 姚顺雨：Coding Agent本质是图灵完备的系统，能控制File System就是Complete的System
  - [29:59] 姚顺雨谈性价比：用Opus比用更差的模型反而更省钱，性能好才是性价比关键
  - [31:51] 姚顺雨：在中国做鲁棒的高性价比中小模型，比极限跑分提升一两个点更有价值
- **[31:54] Agent瓶颈**
- **[34:11] 组织变革**
  - [34:22] 汤道生揭秘WorkBuddy组织形态：3-5人扁平小分队、高度容错、大量实验试错
- **[36:52] 下半场**
  - [37:13] 姚顺雨：AI是长期游戏，不认为ChatGPT和Claude Code会是唯一的Super App
  - [38:36] 姚顺雨：下半场将从单一主线走向多元，多模态与具身智能刚刚开始
- **[39:43] 长跑底气**
  - [39:43] 姚顺雨谈下半场关键：诚实面对自己、Be Real、看到Feedback就改变、保持耐心
  - [40:25] 汤道生回应"腾讯AI慢了"质疑：AI是没有尽头的马拉松，丰富场景是长跑底气

## Speakers

- **汤道生** (host)
- **姚顺雨** (guest)

## Topics

模型评估

## Mentioned

腾讯 (company), CodeBuddy (product), DeepSeek (product), WorkBuddy (product), ima (product), 元宝 (product), 混元 (product)

## Transcript

### 加入腾讯

**汤道生** [0:00]
顺雨啊 ， 你加入腾讯之前 ， 我记得当时我还问过你一些问题 ： 为什么会选择来到腾讯 ，而且你认为 AI 的 " 下半场 " 最重要的是什么 。

**姚顺雨** [0:13]
对 ， 我觉得我想先首先解释一下什么叫做 " 下半场 "，因为我最近感觉这个词有点被滥用了 。 对 ， 就是这个概念其实是我去年的一个博客里面提出来的 。

什么意思呢 ？ 其实 ， 嗯 ， 我觉得在可能去年之前 ，AI 已经发展了几十年， 但是更加重要的是怎么去解决问题 ， 去寻找好的方法 。

但是最近我觉得很明显的就是说 ， 方法论已经变得非常成熟 ， 寻找问题变得更加困难 。 我举个例子 ， 比如说 ， 呃 ， 过去比如说我们做下围棋 ， 对吧 ， 我们会发明像 AlphaGo 这样的一个方法 ，但这个方法它可能只用来适合下围棋或者下各种棋类 。

你会为了翻译做一个这个特别的模型 ，但是它可能只能用来做翻译 ，不能做其他事情 。 嗯 ，但是有了预训练和后训练之后， 我们发现 ， 呃 ， 我们像有了一个万能的锤子 ， 对吧 ， 它可以去砸任何钉子 ， 它是一个通用的方法论 ， 可以去解决各种各样的问题 。

那么反而更困难的是怎么去寻找好的问题去解决 。 所以 ，其实 ， 呃 ， 我觉得加入腾讯很重要的一点就是说 ， 呃 ， 这里有很多好的问题 ，有 ，有很多很多产品 ， 然后我觉得这一点会在接下来变得越来越重要 。

其实 ， 呃 ， 一方面好的产品能够解决第一个问题 ， 就是说我们做了这样的好的 ， 我们做了预训练和后训练之后， 我们到底要把它应用在什么样的地方产生价值 。

第二就是说 ， 呃 ， 环境是非常重要的 。 如果没有好的环境 ， 那 Agent 就没有办法去做各种各样的事情 。 比如说如果你没有一个这个点外卖的这个 tool 的话 ， 那你就没有办法去点外卖 ， 那很多事情你做不到 。

但是我觉得可能最重要的是 ， 呃 ，Context。其实就是无论是企业还是个人， 呃 ， 就像我上一次在这个这个 Agent 说的一样 ， 我觉得越来越重要的事情是 Context，因为 ， 呃 ， 模型越来越擅长把一个非常复杂的输入变成一个输出 。

那很多时候你的竞争壁垒就在来自于你有没有那个最原始的输入 ， 你知不知道这个人他到底在干什么 ， 你知不知道这个企业的这个各种各样的信息 。

那这一点的话 ， 我觉得 ， 呃 ， 腾讯有非常强的优势 。 但其实我觉得这个只是第二大的原因 。 我觉得其实最重要的原因是文化 。

我还记得我第一次跟你聊天的时候 ， 包括和就是很多其他总办的老板们聊天的时候 ， 呃 ， 我第一印象就是大家都非常的诚实 ， 就是哪里做得好 ， 哪里做得不好 ， 都非常直白 ， 就是不会去掩盖 ， 然后就说 ：" 哎 ， 我知道我这里做得好 ， 我知道我这里不知道 ， 我知道这里应该怎么做 ， 我不知道哪里应该怎么做 。"

我觉得这种坦诚是我的第一印象 。 然后我觉得第二 ， 第二的就是说 ， 呃 ， 我觉得腾讯总体是一个基于 Trust 而不是基于 Metric 去运转的公司 。

我觉得这一点对于做 AI 是非常重要的 。 然后包括我觉得 ， 呃 ， 我们的这个文化其实有非常 Low Ego， 非常非常 Solid 的这一面 。

然后我觉得这些文化都是 ， 呃 ， 可能对于长期来做一个 AI 的这个组织是非常重要的 ， 包括我们对长期主义的这种坚持 。

所以 ， 呃 ，AI 下半场最重要的是什么 ？ 我个人的目标我觉得就是 ， 呃 ， 我觉得我们应该在中国建立一个 ， 呃 ， 长期的基于 AGI 的这样的一个组织 。

那我觉得今天的 AI 其实主要有三个部分 。 首先是 Foundation 的部分 ， 我们怎么样去把预训练和后训练这种最基础的东西做得非常 Solid。

第二部分是产品 ， 我们怎么去把这样的技术真的为人和社会产生价值 。 第三就是 Frontier， 我们怎么去探索新的研究的范式 ， 探索新的机会 。其实我觉得最重要的就是说我们要构建一个非常均衡的这样的一个三角形一样的组织 。

呃 ， 那我觉得对于做 Foundation 来说 ， 最重要的其实就是第一 ， 需要充足的资源 ； 第二就是需要正确的做事的方式 。

这其实跟我刚刚说的文化的一点也是吻合的 。 那对于产品来说 ， 我觉得就是有好的产品的 Sense，有这种做产品的精英是至关重要的 。

那第三我觉得就是说在中国 ， 我们今天可能所做的探索还不够多 ， 所以我也希望就是能把这种 Frontier Exploration 的精神能更多地注入到我们组织中 。

**汤道生** [4:47]
你提到的 ， 呃 ， 跟总办聊的过程中感受到的这个真诚或者务实吧 ，其实也是经常我跟客户交流得到的反馈 。

我觉得我们的做事的方式 ， 做产品的理念其实也是比较实事求是的 。 毕竟 AI 赛道还是一个长跑 ， 我觉得

有时候认知其实也很重要 ， 对吧 ？ 哪些我们做得好的 ， 哪些做得不好的也得认 ，但关键这是一个多维度的一个竞赛 。

我们看到现在模型有很多的进步 ， 我们做产品其实也是有越来越多的形态 ， 不同的场景 ，有不同的需求 。

### 模型与产品

**汤道生** [5:35]
我觉得未来还是非常可期的 ， 我觉得 。 那您刚提到模型跟产品 ， 产品可以说提供了一个环境 ， 里面要给模型提供 Context， 上下文 。

那我想问你一个问题 ，也许我们平时开会提的有一个词比较多的 ，是 Code Design。 怎么把产品跟模型能够比较紧密地结合起来 ， 尤其今天有这么多丰富的产品 ， 从我们合作非常紧密的像元宝这样的一个聊天机器人， 包括 AI 搜索 ， 企业里面也有部署一些智能客服 、 智能营销 。

另外最近非常火的这个类龙虾的像 Cobuddy、WorkBuddy 这样的一个产品 ，其实对于模型的能力依赖很深 。 你怎么去思考 Code Design 这个方式 ？

**姚顺雨** [6:46]
对 ， 我觉得有三点吧 。 首先 ， 呃 ，Code Design 的前提就是说模型本身要做得很 Solid，有很多 Foundation 的 Work 要做好 。

那其实 ， 呃 ， 首先我觉得预训练是一个

相对就是产品 Agnostic 的事情 ， 然后它做得非常 Solid， 可以提供一个非常强的 Foundation。 而且预训练它最大的特点就是它是一个可泛化的学习的过程 ， 就它的进步是可以就是带给各种各样下游的任务都以这个持续的这个价值的提升 。

那后训练的话 ，其实我觉得最重要的一点是要设立好正确的 Eval。 我觉得在中国可能大家有个不好的倾向 ， 就是比较喜欢刷榜 。

但是 ， 呃

， 我觉得就是如何实事求是地基于产品 、 基于真正的应用去构造更加真实的 Eval。 那我觉得这个首先 ， 呃 ， 你要有好的产品出口 。

第二就是说你要意识到就是说 ， 呃 ， 可能实用性的价值是大于这个刷榜的价值 。 那其实这一点的话 ， 我们做了大量的工作 ， 就是说跟各种各样的产品进行了深度的 Code Design。

我觉得 Code Design 其实很关键的一点就是要产生相互的信任 ， 这一点其实我们也做了大量的这个工作去取得互信 。

那怎么把产品的数据用好 ， 怎么把这种回流 ， 怎么把 Eval 做好 ， 我觉得这有很多细节我就不赘述 。

但我觉得第三点我想说的就是说 ， 呃 ， 我觉得 LLM 时代和过去的 AI 最本质的区别就是泛化性 。 就是在 LLM 之前 ， 比如说你做一个翻译的产品 ， 你只要把翻译的数据做特别好就行了 ； 你做一个围棋的程序 ， 你只要把围棋的数据准备特别好就行了 。

但是今天 ， 呃 ， 即使你想就只做一个 Coding Agent， 你发现其实需要的也不仅仅是 Coding Agent 数据 ， 你需要非常好的 ， 呃 ， 聊天能力 ， 非常强的搜索能力 ， 非常强的指令遵循能力 ， 非常强的推理能力 。

它其实是一个非常复合的 Data 的 Taxonomy。 我觉得需要对这个事情有个 Taste。 那我觉得这个事情的一个推论就是说 ，其实有很多产品的这样的一个体系化的地方 ，其实是会有一个比较大的优势 。

比如说我们和元宝的 Code Design 可以使我们模型产生很强的聊天和搜索能力 ，但这样的能力可能又可以被迁移到 ima 或者 WorkBuddy 这样的其他的产品 。

所以这些产品它能够提供不同的数据 ，但这些数据之间又可以相互泛化 ， 它形成一个像网络一样的体系 。

我觉得这一点的价值会越来越重要 。

### 评测体系

**汤道生** [9:28]
对对对 。 呃 ， 我其实外部的刷那个榜啊 ，其实也是属于 Eval 的一种嘛 。 所以我们内部做 Eval 跟外部的这种榜有什么区别

？

**姚顺雨** [9:45]
呃 ， 我觉得就是首先这些 Benchmark 还是有它的价值 ，不是说它完全没有价值 。 我觉得 ， 呃 ， 只是说现在这些榜非常容易 Saturate。

那我觉得基于真实世界的数据有几个帮助 。 首先就是你能发现模型很多底线问题 。 实际上我觉得我们想要就是发一个 Preview 模型 ， 最重要的目的之一就是我们希望能够获得真实世界的反馈 ， 来修复各种各样的就是榜单中没法发现的这些底线问题 。

那我觉得这一点会在正式版上面有一个非常大的改进 。 那第二点就是说你对真实的 Prompt Distribution 有一个更深的了解 。

那我举个例子 ， 比如说 ， 呃 ，Benchmark 上面的这些题目可能它都是非常精确的 ， 就是它有非常长的这种 Concrete Description， 然后它可能一般来说是个单轮的这样的一个问题 。

但是我们知道在现实场景中， 可能大家问的问题都是比较模糊的 ， 可能就一两句话 ， 然后他会不停地追问 。

那这些 Setup 上的 Difference 就可以启发我们怎么去更好地去做这样的训练 。 那第三就是说我觉得甚至我们可以在这些产品上面获得一些灵感去推进现在可能还没有的榜单或者没有的领域的这样的推进 。

比如说我们最近做了很多 Context Learning 的工作 ， 我觉得也是跟元宝 Pi 给我们的启发很有帮助 。 所以我觉得这个产品和这个模型的互相成就是越来越重要的一个 AI 的话题 。

**汤道生** [11:14]
对对 。 我记得我们在早期做元宝的时候 ， 还碰到多轮遵循的问题 ， 好像在使用产品 ， 大家这种迭代 Prompt 的方式跟 Benchmark 也好像有些差异 。

真正在产品里面大家使用所需要的能力确实好像跟 Benchmark 是还蛮大的差异的 。

### 产品原理

**姚顺雨** [11:43]
你问了我这么多问题 ， 我也问一点你的问题 。

**汤道生** [11:46]
好啊 ， 欢迎欢迎 。

**姚顺雨** [11:47]
对 ，其实我记得我第一次跟你聊的时候 ， 你给我讲了很多你过去的经历 ， 对吧 ？ 就是从 QQ 空间 、QQ 秀的时代一直到我小学时候最喜欢的这个产品 。

**汤道生** [12:01]
你说是老登是吧 ？

**姚顺雨** [12:05]
到 QQ、 到音乐 、 到这个语音 、 到现在的元宝 、 到 ima，其实跟你聊天很有意思 ，因为你做过各种各样的产品 ， 然后 To C 的也有 ，To B 的也有 ， 就是远古时代的也有 ， 这个最近的这个 AI 时代的产品也有 。

那我其实比较好奇就是说 ， 你觉得你做产品的第一性原理是什么 ？ 你觉得哪些经验或者价值是不变的 ？

哪些东西变了 ？

**汤道生** [12:36]
我觉得其实最终做产品还是奔着到底用户有什么需求 ， 我怎么去解决他的痛点 ， 怎么去给用户或者客户创造价值 。在

不同的时代 ， 你最后甚至不同的行业 ， 你做一个产品还是需要能够给用户带来价值 ，他才会买单 ， 才会使用 。

所以我倒觉得从 PC 互联网时代 ， 我们做空间 、 移动的时代 ， 做各种各样的产品 、 内容的产品 ， 到产业互联网做云 ，其实我们也要花好多的时间精力去听客户的声音 ， 尝试去帮助他们去解决他的问题 。

底层的逻辑其实没有这么大的变化 ，但确实我觉得在 PC 互联网 、 移动互联网时代做产品跟今天在 AI 时代做产品还是有蛮多不一样的地方 。

首先我觉得从范式的角度来看

，在

AI 时代以前 ， 我们做产品很多时候想的是通过功能来满足用户的需求 。 你作为一个产品提供方 、 服务提供方 ， 你想清楚我提供怎么样的一个能力 ， 让用户可能通过界面 、 通过某些菜单去选 ， 好像是一些阈值在

你只能在里面去点一样 。 但在 AI 时代做产品 ， 它的那种开放式的服务形态就会带来很不一样的要求跟挑战 。

用简单的交互方式 ， 可能是自然语言 ， 可能是语音 ，其实作为产品方你也不知道用户会问什么 ， 所以要充分利用模型能力去理解用户的需求 ， 然后通过比如今天大模型的这种能推逻辑推理 、 能去调用工具的能力 ， 产品去给模型提供各种各样它可以用的工具来应对这种开放式的需求 。

这个是我觉得跟我们过去做产品很不一样的地方

， 甚至也包括你刚提到的 Eval。 以前我觉得做产品我们有很清晰的 Specification，有很清晰的这个产品的这个细节功能的描述 。

那怎么去做设计 、 基于做研发 、 怎么去测试 ， 我觉得那个瀑布式的流程也比较清晰 。 但在做 AI 产品 ， 我发现最大的变化是我们整个流程可能都要重新设计 ， 尤其今年， 尤其今年这个大部分的代码都由 AI 生成 。

我们的工程师可能会花更多的时间去做设计 、 架构的设计 ， 把写代码的工作可能都交给 AI 了 ， 然后定期去指导一下， 修正一下， 然后测试也要左移更前置去想清楚针对我们的这种各种案例 Eval， 对吧 ？

有环境 ，有我们对于这些开放式答案的一些要求 ， 甚至 Alignment 怎么对齐用户 ， 我们用户所需要的那种风格 。

我感觉今天 AI 时代做产品其实要求的能力更全面 。

**姚顺雨** [16:46]
更难了 。

**汤道生** [16:46]
更难了 。

### 混元三

**汤道生** [16:49]
那我又问你一下， 混元三 ， 就大家都在说混元三 Preview 是混元三的 ，是你的腾讯的首秀啊 。 具体混元三做了什么改变 ？

你能给大家介绍一下吗 ？

**姚顺雨** [17:08]
其实我觉得没有什么秘密 ， 就是今天做大模型从某种程度来说是一个比较 Trivial 的事情 ， 就是说我们应该把 Infrastructure 做好 ， 我们应该把数据做好 。

算法的部分其实反而是比较简单的 。其实我觉得主要几个点吧 ， 第一就是说我们把这个 Infrastructure 进行了重建 ， 无论是预训练还是强化学习 。

第二就是说我们把数据和 Eval 做了很多大的改变 ， 如何去定义更真实的问题 ， 如何去丰富这个 Data 的 Taxonomy， 如何去提高数据的质量 ， 这是一个永无止境的追求 。其实第三的话 ， 我觉得很重要的很多决策其实包括怎么去招人， 怎么去设立这个模型的节奏 ， 怎么去每天有很多这个 Decision 要考虑很多 Trade-off。

我觉得可能没有一个很清晰的公式 ， 可能我觉得是一个很 Taste Driven 的事情 。 所以

### 信任构建

**姚顺雨** [18:15]
我其实挺好奇想问你一个问题的 ，因为你刚刚跟我讨论就是 Code Design 这个概念 ， 我其实也很好奇就是你对 Code Design 这件事情是怎么想的 ， 就是说你觉得哪些事情应该是模型应该做 ， 哪些东西应该是产品应该做的 。

**汤道生** [18:32]
我觉得 Code Design 在不同阶段 ， 过去这两年其实是一直在变化的 。 我觉得这个变化某种程度来讲是随着模型能力的升级而变化 。

当然整个行业 、 市场 、 用户的需求 ， 它在变化的过程中也会带来我们两边模型跟产品需要更好去满足

。 给我一个比较深的感受是怎么去对齐 ，因为在我们一起去做产品 、 去做 Alignment 对齐会的时候 ， 我们有很多不同的角色 ， 对吧 ？

产品可能要针对某个方向去解决一些问题 ， 模型到底怎么去做满足这个需求 ，但你要回到模型需要数据 ， 数据应该怎么标注 ， 到什么颗粒度 ， 到底什么是好的标注 ， 什么是不好的标注 ，因为有些地方要奖励 ，有些地方要惩罚 。

然后还有 Eval， 对吧 ？ 还有这个评测 ，因为如果产品认为好的产品体验评测是不认同的话 ， 那大家其实做出来的产品就会不一致了 。

所以 Code Design 给我的感觉更多的是在

项目组里面不同的角色 ，他参与到这个产品的设计 ， 定了一些产品的目标方向 ， 怎么让多个角色能够对于一些开放式问题有比较好的对齐 。

如果没有做到这样的一个对齐的话 ， 那你会发现用那个产品的行为会不可预测 ， 甚至有时候会有一些随机性 ，因为模型在训练的过程可能也被混淆了 。

所以这个是我这两年跟做产品 、 跟模型团队做 Code Design 的一个比较深的感受 。 你觉得呢 ？

**姚顺雨** [20:57]
对 ，其实我是觉得就像我刚刚说的 ， 我觉得首先最难的一点就是要建立 Trust，并且我觉得同理心很重要 ，因为说到底就是说做模型的这个目标和做产品的目标有很多 Align 的部分 ，也有很多不 Align 的部分 ， 对吧 ？

就是说模型的人他会希望我这些这个能力越强越好 ，但是产品的人他可能希望用户的需求满足得越好是越好 。

所以天然有很多不 Align 的部分 。 那我觉得可能很重要一点就是要有这个换位思考的能力 。其实就是你刚刚问我就是说这个元宝 ， 对吧 ？

我们是怎么一步一步 Code Design，其实一个很重要的细节是我们当时是 ， 如果你还记得的话 ， 我们当时其实派了后训练最强的骨干力量去帮助元宝先把 DeepSeek 的这个后训练先做好 。

因为在那个时候我们自己的那个预训练还没有 Ready，但是我们知道就是说维护这样的产品以及它的 DAU 会对于我们接下来做模型也变得非常重要 ，而且会对于长期的合作非常重要 。

所以当时其实很多算法团队不理解 ， 然后我需要去很努力的解释 ，但我觉得现在看起来就是这些努力都是 Payoff， 对吧 ？

就是说我觉得这样的一个动作就是让产品和意识到就是说模型的同学是真的在为产品着想 。 那我觉得这个其实对于就是我们这个之后的合作 ， 包括混元三 Preview 在元宝上成功的上线起到非常重要的作用 。

当然有很多技术的部分可以探讨 ，但我觉得可能最难的部分其实反而是怎么样去建立信任 ， 怎么样换位思考 。

**汤道生** [22:35]
对 ， 对 ， 非常认同 。 那我换一个话题 ， 你是 ReAct 架构的提出者 ， 博士研究也是围绕着语言智能体展开的 ， 那你几年前的一些观点到今天兑现了吗 ？

### ReAct回望

**汤道生** [22:51]
比如有哪些

？

**姚顺雨** [22:54]
对 ， 那天我还挺感慨的 ，因为我重新读了自己的博士论文 ， 感觉又回到了一个这个很远古的时代 ， 就是我的博士论文的 Title 叫做 《Language Agent from Next Token Prediction to Digital Automation》。

**汤道生** [23:13]
那是哪一年呢 ？

**姚顺雨** [23:14]
19 年 。

**汤道生** [23:15]
19 年 。

**姚顺雨** [23:16]
19 年 。

**汤道生** [23:16]
7 年前 。

**姚顺雨** [23:17]
那个时候 Literally 就是我们的 GPT-2 那个时候 ， 它当时只能做 Next Token Prediction，而且它产生的可能一段话还不太连续或者还有很多毛刺 。

所以我觉得当时人们是很难想象到就是说它会有一天成为一个改变世界的力量 。 当时我觉得可能大家做的研究稍微有想象力的一些 ， 它会做一些研究 ， 比如说中国的首都市 ， 然后这样的话如果你做 Next Token Prediction， 它会回答北京 。

那 Somehow 它是一个有 Knowledge 的事情 。 能做到这点大家其实当时就非常开心了 ， 觉得这个技术很有意思 。

那当时我的想象力可能比较狂野吧 ， 就是我觉得 GPT 是个非常优美的东西 ， 就是吐下一个 Token 是一个非常极简且非常通用的事情 。

然后我觉得它有一天潜力不仅仅是在于吐出下一个 Token，而是在于把这个世界上所有的事情全部 Automate。 当然我现在当时我当时想的可能还不够大 ， 我想的是 Digital Automation，但是现在看起来也有可能是 Digital and Physical Automation。

那我觉得其实我博士期间主要做两部分 ， 第一部分就是如何建立一个这个 Agent 的方法论 ， 如何把一个 Next Token Prediction 的机器变成一个 Agent， 变成一个自动化的机器 。

那其实就像你说的最重要的一片工作可能是 ReAct。 我还记得就是 22 年 7 月份的时候 ， 某一天晚上就是我当我第一次把我记得当时是 PaLM 2 的 API 和我当时自己手写的一个 Wikipedia 的 API 连在一起 ， 然后它第一次可以就是基于这个网页回答问题 ， 然后并且多轮的交互的时候 ， 就是我当时感觉就像那个微弱的电灯丝突然亮了的感觉一样 。

就是我感觉这个 OK， 就我所知这可能是第一次人类把 LLM 和就是真正的互联网连在一起 ，并且去做这种多轮的交互 。

我当时的感觉就是 OK， 这个感觉可能在 5 年或者 10 年会改变这个世界 ，但是可能比我想象中还要更快 。

包括我记得当时我们第一次提出 Sequence 的 Idea 在 Brainstorm 的时候 ， 我觉得 OK， 如果这个事情能做到 ， 那很显然就是它会带来巨大的价值 。

当时可能是几百亿 、 上千亿 ，但是现在可能是数万亿 、 数十万亿 ， 可能我想的还是太小了 。 那另一部分其实我做的工作就是怎么去定义 Digital Automation 的任务 。

那比如说 WebShop 是第一个基于互联网的 ， 就 Web Agent 的 Task， 然后包括 Intercode 和 Sequence 是最早的就是 Coding Agent 这样的任务 。

那现在看起来就是 Agent 的技术最重要的两个部分可能确实是 Web 的 Agent 和 Coding 的 Agent。

**汤道生** [26:10]
对 。

**姚顺雨** [26:10]
Coding 的 Agent。 最后就是说那天我还在群里面跟大家聊天 ， 我说我看我那个博士论文的结尾 ， 就是我在 24 年的时候写我的 Future Work， 对吧 ？

第一个是 Train Models for Agent， 第二个是 Safe and Robust Deployment， 第三个是 Scientific Discovery， 第四个是怎么样去 Help Human。 我很感慨 ， 我说我现在很幸运 ， 我确实现在在做我当时列的 Future Direction。

**汤道生** [26:39]
你的 Prediction 太厉害了 ， 这个都一一看到这个整个行业针对这些方向在推进 。

**姚顺雨** [26:46]
可能想的还是不够大 ， 我觉得当时 。 我当时已经觉得自己想的够大了 ，但是可能还是不够大 ， 我觉得 。

**汤道生** [26:53]
技术的发展往往超乎我们的预期 。 那我也再转身一点 ， 智能体今天大家都说需要消耗很多的 Tokens，Tokens 的调用 ， 这对于混元做下一代的模型的研发 ， 你觉得什么是你的侧重 ，有哪些地方是比较重要的 ？

### Token效率

**姚顺雨** [27:22]
对 ， 我觉得毫无疑问 ， 今天 Agent 或者说 Coding Agent 就有点像预训练一样 ， 是一个不得不做的事情 ， 它是一个最基础的能力 。

我个人觉得 Coding Agent 非常本质 ， 当然有很多原因 ，但其实还有一个很重要的原因就是说它是一个有点像图灵完备的这样的一个事情 ， 对吧 ？

就是说当你有能力去控制自己的 File System， 当你有一个 Container 的时候 ，其实你是一个 Complete 的这样的一个 System。 那今天我觉得 Agent 毫无疑问是每一家模型所发力的重点 。

我觉得我们做的方法可能会有几个区别 ， 第一就是说即使可能今天 Coding Agent 也是最重要的事情 ，但是我们还是会强调体系的全面化 。

就是我始终认为就是说真的要把 Coding Agent 做好 ，其实需要的远远不止 Coding Agent 的数据 ， 你也需要像我刚刚说的聊天 、Instruction、Following、 推理 ， 各种各样不同的东西 ，因为大模型最重要的点是泛化性 。

那第二点就是很显然就是产品的作用越来越重要 ， 如何利用好就线上的回流 ， 我觉得是一个每一个模型厂长都在应对和思考的问题 。

那这里我觉得我们刚刚积累了很多 Code Design 的这些经验会变得非常重要 。 那第三就是说我觉得其实还是需要更多想象力 ， 无论是技术的演进 ， 还是产品的演进 ， 还是甚至下一个范式的演进 ， 我觉得我们还是需要做一些探索性的 ， 甚至不确定性的工作 。

**汤道生** [28:58]
对 ， 对 ， 对 。 我觉得从产品侧 ，因为大家越来越多有 Token 焦虑的声音 ，Token 的成本这个持续爆发式增长 ， 我也听到很多的客户 ， 甚至用户身边的同事们也在紧盯着这个积分的消耗或者 Token 的消耗 。

那怎么可以让我们的模型在解决某个问题或者完成某一个任务 ， 它的 Token 的效率最高 ？ 因为我之前做过一些任务 ， 可能它会是不同的方向 ，其实有些方向你也都知道肯定走不下去的 ，但可能模型还会试 ， 试完知道走不下去再试下一个 ，其实里面的有什么可以去 Optimize 的地方 ， 让 Token 整体使用的效率更高 。

**姚顺雨** [29:59]
对 ，其实我觉得今天在中国大家讨论性价比 ， 可能更多讨论的是模型架构 ，但其实它是个很复杂的体系 。

我觉得可能最重要的事情首先是你的 Performance， 对吧 ？ 就是说很多人其实跟我说他最后发现用 Opus 这样的模型比用一个更差的模型最后发现其实更省钱 ，因为你更快的就把这个事情做对了 ， 然后你也省了人的精力 。

然后这个其实最重要的事情我觉得是 Performance，因为如果你的 Performance 好 ，其实才真正提升性价比最关键的事情 。

那尤其我觉得今年我觉得可能很多简单任务的 Robustness 会变得更加重要 ， 如何一次把很多就是相对简单的任务做对 ， 这可能是性价比更关键的部分 ，而不仅仅是模型架构 。

那第二部分我觉得就是成本 ， 它其实本身就是性价比嘛 。 我觉得第一其实是性 ，因为如果这个性能不好 ，其实就性价比就无从谈起 。

那第二点我觉得就是成本 ， 那其实成本的话 ， 我觉得中国其实是领先于世界的 ， 对吧 ？ 就是说我们做大量的工作去优化我们的成本 ，但其实我觉得成本 Again 可能最重要的事情是怎么用一个更小的模型把这个更高的这个价值的任务给做好 。

那在这个基础上， 我觉得当然架构的创新 ， 包括长文的管理 ， 包括销售价 ，有很多需要做的事情 。 但当然我个人看法就是说 ， 如果我们能做一个相对较小的模型 ，但是它又能够比肩大模型的性能 ，而且它能够在就是大部分的任务上做到很强的 Robustness， 这可能会比在很多非常长程的就是 Fancy 的 Task 上面实现 ， 比如说一两个点的这个提升 ， 可能是在今天的中国更有

价值了 。

**汤道生** [31:54]
对 ， 对 。其实我也挺好奇 Dawson 就是说你觉得 Agent 你是什么时候意识到它是一个新的产品的机会 ，以及你现在认知是什么 ？

### Agent瓶颈

**汤道生** [32:05]
你觉得现在我们离一个好用的 Agent 的 Bottleneck 在哪里呢 ？

因为我们做的 Agent 针对不同场景其实有不同的产品形态

，在 Agent 的设计上面其实很大程度是在发挥模型的尽量去发挥好模型的能力 。 当然模型在迭代 ， 它能力越强 ， 可能 Agent 需要做的工作也越来越少 。

我看我们好几个产品在过去这段时间其实是随着模型能力加强 ， 我们可以把产品把 Agent 做得更简化 ， 更多的是给模型提供更多不同的工具 ， 创造更多的 Skills 来让模型能够更高效的去完成任务 ， 给模型提供更多的我们叫记忆吧 ， 对吧 ？

这个用户过去使用的一些习惯 ， 我们所能提取出来的一些用户 Preference 的一些信息 ， 作为一个上下文去 Feed 过去 ，在 Coding 的环境有相关的 Context 给到模型 。在 WorkBuddy 里面办公协作 ， 做过 PPT， 可能大家关注的内容或者该给到模型的这个 Context 也会不一样 。

所以在我们做不同的 Agent， 我觉得更重要还是了解那个场景下什么内容 、 什么信息是重要的 ， 比较 Relevant 的 ， 能够跟模型配合好 ， 让模型能够有它需要的信息 ， 同时也发挥它的这个能力吧 。

**姚顺雨** [33:59]
但最近我们确实推出了一些像 WorkBuddy 这样口碑很不错的产品 ， 对吧 ？ 然后背后就是我观察到就是很多小团队在快速的迭代产品 。

我其实挺好奇就是相对于传统的这种产品研发 ， 你觉得在这种新的 Agent 时代的这个研发和组织管理上的这个产品团队发生什么变化 ？

### 组织变革

**姚顺雨** [34:20]
你的思考是什么 ？

**汤道生** [34:22]
对 ， 我前一阵子在帮 WorkBuddy 做一个组织发文 ， 我看了一下他们那个

非常扁平化的组织 ， 跟我们过去的其他的产品组织架构是有很大的差异 ， 更多的小团队 ， 三个人 、 五个人， 一个可能就是围绕着某一个领域来去做攻坚

，而且有很多的实验

在里面 。 所以攻陷还要支持好这个 AI Infrastructure 去做实验 ， 让不同的这些小分队可以去探索 ， 然后再验证 ，因为其实实验大部分可能是拿不到正向的反馈的 。

那我们也要去包容团队去试错 ， 这种通过大量实验去体验出对于用户流程 、 对于我们想要的这个结果有正向的帮助 ， 这个是我觉得今天做 Agent、 做 AI 产品 、 原生 AI 产品 ， 这个组织形态要能够比较好去支撑 。

另外， 原来可能有很多工程师有很多时间花去写代码 ，但今天毫无疑问他们

这些工作可以交给 AI 了 ， 所以我们会看到更多角色的融合 ， 可能大家都是产品经理 ， 都要去了解 、 透彻用户的需求 ，以及设计出我们想要的产品形态 。

每一个工程师可能就更像一个有想法的 Leader， 驱动着多个 Coding Agent 来去针对我们想要的这种产品需求去做研发 、 开发 ， 同时也要像我刚刚说的 ， 要把参与这个评测 、 测试比较前置 ，也用好 AI 的能力 ， 把这些质量保证的工作 、Alignment 对齐的工作又要做到前面来 。

那我也想再问一下一个可能更大家比较多讨论的一个问题 ， 到底下半场是什么 ？ 你能再多说一下吗 ？

### 下半场

**姚顺雨** [37:13]
感觉这应该是我问你的问题 。

我觉得首先这个 AI 的这个 ， 我觉得其实今天我觉得有两个重要的判断 。 第一个就是说我们认为 AI 是一个短期的游戏 ， 还是一个长期的游戏 ？

因为在硅谷大家蔓延着很多情绪 ， 就是说两年后所有人都要失业了 ， 对吧 ？ 就这个 AI 就要取代所有人工作 ， 那我们应该赶快赚两年钱 ， 然后退休 ， 对吧 ？

那我觉得这是一个判断 ， 我觉得很显然我们的判断是这会是一个长期游戏 。 那其实我觉得 AI 才刚刚开始 ， 从某种程度来说下半场才刚刚开始 。

我不认为 ChatGPT 和 Claude Code 会是唯一的 Super App， 我觉得那会是一个非常灰暗的世界 ， 我觉得肯定会有源源不断的新的机会的诞生 。

可能今天就像是 70 年代 ， 就是 PC 刚刚产生的时候 ， 那我觉得还有很多很多事情需要做 。 那第二个判断就是说它会是一个更线性还是多元的游戏 ？

因为确实我觉得过去几年大家能看到的是 Pre-training， 然后 Post-training RL， 然后 Agent，Coding Agent， 就是似乎有一个非常清晰的主线 ， 然后这个主线就是所有人都在 Copy， 对吧 ？

坦白说就是所有人都在做一样的事情 ， 这也是个非常灰暗的事情其实 。 那到底未来会变得更单一还是更多元 ？

我个人看法就是说我觉得会变得更多元 ， 毫无疑问 Coding Agent 生产力会变得更加重要 ， 我觉得它是一个刚刚开始的事情 。

这个世界还有 Trillions of Dollars 的 Market 还没有被填满 ，但是多模态 、 具身智能 ， 很多很多新的事情都在发生 ， 或者刚刚发生 。

所以从这角度来说 ， 那如果我们认为下半场才刚刚开始 ， 那可能确实不是完 。 当然我觉得就是过去这个模型 、 产品做了很多探索 ， 走了很多弯路 ， 我觉得这是

正常的 。 就是你如果没有做过一个事情 ， 那你第一次做肯定还是会有这个曲折 。 但是我觉得可能更重要的事情是说能不能诚实地面对自己 ， 能不能够 Be Real， 能不能够去就是看到 Feedback 然后去改变 ， 能不能够去保持耐心 。

我觉得这些事情可能是在下半场更加重要的事情 。

### 长跑底气

**汤道生** [39:43]
对 ， 我觉得腾讯大家对于腾讯经常喜欢挑某一个点来批评 ， 当然我觉得我们也很欢迎大家给我们提更高的要求 ，但我们还是一个非常多业态 ， 很多产品在很多的赛道 ， 同时也有很多的团队在推进不同的项目事情 。

所以

毫无疑问在这样的一个复杂的组织里面 ，有些地方可能我们做得快了 ，有些地方做得慢了 ，有些地方可能会做失败 ，在探索 。

所以我觉得这些提醒都非常好 。 我觉得确实有些地方我们是可以做得更好 ，但就像你说的 ， 这是一个长跑 ， 这是一个马拉松 ， 腾讯还是有非常丰富的场景 。

就像你一开始提到选择腾讯 ，因为 AI 需要 Context， 对吧 ？ 模型需要很多的这些上下文 ，其实腾讯在过去的多年的不同产品在不同赛道的这些积累 ，其实都是可以针对每一个场景去提供 ， 为模型提供有用的信息 ， 提供这些 Context 来发挥价值 。

那在这样的一个长跑 ， 我相信模型会不断迭代 ， 用户的需求也在不断变化 ，也会有新的产品形态出现 。

我觉得我们比如今年年初对龙虾这一波热潮也反应比较快 ， 同时也有像 WorkBuddy 这样的一个智能体产品 ，其实也是几年前已经开始做的产品 ， 沿着原来做 Coding 的 CodeBuddy 慢慢看到非程序员也有很强的这个需求 ， 我们也能比较快地去应对 。

今天其实也听到很多客户对于我们的不同产品怎么去组合起来 ，有非常高的这个期待 。 所以

我们正在长跑中， 也请各位多给我们提醒 ， 给我们建议 ，也多用我们的产品来给我们这个正向的 Constructive 的反馈 。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
