# 杨植麟2026中关村论坛演讲：开源AI加速探索智能上限

AI智识录 · 2026-03-27

<https://ai.podhood.com/54f1b6e0-c006-4090-b328-9f2794a15c2d>

月之暗面创始人兼CEO杨植麟在2026年中关村论坛的演讲中指出，大模型的本质是把能源经算力与模型转化为智能，而竞争关键在于'有效规模化'而非暴力堆算力，核心抓手是提升Token效率与长上下文能力。在最新的开源模型Kimi k2.5中，他提出'Agent集群（Agent Swarm）'概念：类比人类公司组织，并行调度上百个Agent互相协作、协调与规划，使任务执行时间不再随任务复杂度指数增长，从而实现规模化输入、输出与编排，把原本不可能的复杂任务变为可能。架构层面，他沿用十年前残差网络的思路，将注意力机制从时间轴'旋转90度'应用到深度轴，结合块状残差结构，以约2%的额外成本大幅提升模型效果，挑战了Adam优化器、Attention架构、残差连接等沿用8到11年的行业标准。他强调开源让Kimi等模型成为全球芯片厂商评测和研究机构使用的新标准，降低了企业、研究者与终端用户获取智能的门槛。他还预判AI研发范式将从天然数据加人工标注、走向大规模强化学习，再到'AI主导研究'：每个研究员配备大量AI Token，由AI合成任务与环境、定义奖励函数并探索新的网络架构，月之暗面愿与开源社区共建生态、加速智能技术发展。

## Questions this episode answers

### Kimi k2.5 提出的 Agent 集群（Agent Swarm）是什么？它如何解决复杂任务执行时间指数增长的问题？

杨植麟介绍，k2.5 引入多个 Agent 形成 Agent Swarm，可并行开启如 100 个 Agent 协作、协调和规划，像人类公司组织一样分工。单一 Agent 完成复杂任务（如从零写代码仓库）需几天甚至几周，而集群使执行时间随任务复杂度增加几乎不变，实现规模化输入、输出与编排。

[1:56](https://ai.podhood.com/54f1b6e0-c006-4090-b328-9f2794a15c2d?t=116000)

### 月之暗面最新的开源模型架构创新是什么？注意力机制如何“旋转90度”应用到深度轴？

杨植麟称其灵感来自十年前何恺明等提出的残差网络（RustNet）。他们将注意力机制从时间轴旋转90度应用到深度轴，不再只基于前一层输出，而是结合之前所有层的输出计算，并设计基于块状的残差结构，在只有 2% 的额外成本下大幅提升模型效果。

[5:20](https://ai.podhood.com/54f1b6e0-c006-4090-b328-9f2794a15c2d?t=320000)

### AI 研发范式正在发生怎样的变化？什么是 AI 主导研究（AI-led Research）？

杨植麟指出，三年前主要靠互联网天然数据加少量人工标注，去年转向大规模强化学习系统（但任务仍由人确定），在编程、数学领域带来提升。从今年到明年及未来若干年，每个研究员将配备大量 AI Token，由 AI 合成任务与环境、定义奖励函数、探索新网络架构，AI 将主导研究。

[10:04](https://ai.podhood.com/54f1b6e0-c006-4090-b328-9f2794a15c2d?t=604000)

### 为什么说大模型的本质是“能源向智能的有效规模化转化”？

杨植麟在演讲开头提出，做大模型本质上是把更多能源经过算力和模型转换成智能，关键在于有效规模化而非暴力堆砌算力。具体路径包括提升 Token 效率——因为世界有效数据是有限常量，更好的架构和优化器能从同样数据学到更多智能，以及提升长上下文能力以获得更低 loss。

[0:13](https://ai.podhood.com/54f1b6e0-c006-4090-b328-9f2794a15c2d?t=13000)

## Key moments

- **[0:00] 能源转智能**
  - [0:13] 杨植麟：做大模型的本质是把能源转化为智能，关键是有效规模化而非暴力堆算力
- **[0:35] 有效规模化**
  - [0:56] 杨植麟：Token效率决定从同样数据中学到多少智能，因为世界有效数据是有限常量
- **[1:00] Token效率**
- **[1:56] Agent集群**
  - [1:56] Kimi k2.5提出Agent Swarm集群：100个Agent并行协作，让复杂任务执行时间不再指数增长
  - [2:56] 杨植麟用建公司类比Agent集群：一个人100年建千亿公司，200个聪明人协作短期完成
- **[4:20] 架构创新**
  - [5:20] 月之暗面把注意力机制旋转90度应用到深度轴，仅2%额外成本大幅提升模型性能
- **[6:43] 挑战标准**
  - [7:11] 杨植麟：Adam、Attention、残差连接统治十年无人挑战，如今都可以被挑战了
- **[7:51] 开源生态**
- **[9:08] AI主导研究**
  - [9:08] 杨植麟预判：未来几年AI将主导研究，自主合成任务、定义奖励函数并探索新架构
- **[10:26] 结语**

## Speakers

- **杨植麟** (host)

## Topics

AI开源与Agent生态, 自动化AI研究, AGI范式演进

## Mentioned

NVIDIA (company), Kimi (product)

## Transcript

### 能源转智能

**杨植麟** [0:00]
很高兴有机会能跟大家分享我们在做开源的模型 ， 还有包括就是去训练更好的大模型这个领域上做的很多最新的工作 。

呃 ，其实做大模型这个事情本质上是把更多的能源转换成智能 ， 然后转换成这个转化的过程中最重要的一个事情是能够去规模化 ，也就是说能够把尽可能多的能源 ， 然后去经过算力和模型 ， 去变成更多的 、 更高程度的智能 。

### 有效规模化

**杨植麟** [0:35]
所以本质上， 规模化这个事情是过去若干年所有的模型和 AI 发展的一个很重要的基础 。 当然就是这个规模化 ， 它并不是代表着说我们只是去暴力地增加能源 ， 或者去暴力地增加算力 ，而是涉及到我们怎么在这里面能够非常有效地去进行规模化 。

所以我们其实会从不同的方面去提高这个有效性 ， 比如说我们会很强调去提升 Token 的效率 。Token 的效率它本质上是代表着说你从同样的数据中能够学到多少智能 ，因为这个世界上的有效的数据其实是一个常量 ， 或者说它是一个非常有限的值 。

### Token效率

**杨植麟** [1:23]
那如果你有更好的网络架构 ， 或者有更好的优化器 ， 那么你就可以从一样的数据里面学到更多的智能 。

然后同时我们也希望去提升更长的上下文 ，因为在更长的上下文的时候 ， 可以在相同的情况下可能得到更低的 loss。

通过这个更低的 loss， 它本质上意味着这个模型可以去学会更加复杂的任务 。 所以我们也设计了一系列的网络架构 ， 还有数据 ， 去提升它在长上下文的表现 。

同时我们在最新的模型 Kimi k2.5 里面也提出了我们新的一种规模化的方法 ， 就是通过引入多个 Agent 形成一个 Agent 集群 ， 或者叫 Agent Swarm 的概念 ， 使得说有很多个 Agent 可以一起去工作 ， 然后通过这种方式去提升它能完成的任务的复杂度 。

### Agent集群

**杨植麟** [2:16]
所以这个是一个我们在 k2.5 里面研发出来的 Agent 集群 ， 它的一个效果 。 可以看到横坐标是任务的复杂度 ，而纵坐标是它的执行时间 。

所以如果我们原来只是用这种单一 Agent 的方式进行工作 ， 你可以看到就是随着任务的复杂度逐渐提升 ， 它需要的完成时间可能是指数增加的 。

比如说如果你完成一个非常复杂的任务 ， 比如你如果想从头去写一个代码仓库 ， 去实现一个很复杂的功能 ， 那它可能需要几天甚至几周的时间 。

但是如果我们能够并行开启 ， 比如说 100 个 Agent 去同时完成这个任务 ， 然后可能在这个过程中它们会有去进行互相的协作 ， 然后去互相地协调和规划接下来应该要做的事情 ， 就跟一个人类的组织一样 ， 那么这个时候它其实可以做到随着任务复杂度的增加 ， 它的执行时间其实没有太大的变化 。

那这样的话也意味着你可以在单位时间内去完成更加复杂的任务 ， 使得说原来一些可能完全不可能实现的任务变得有可能 。

这个就像一个公司一样 ， 如果你想做一个非常艰难的一个事情 ， 你要完成一个很复杂的一个 mission， 比如说从 0 到 1 建造一家 100 亿或者 1000 亿美元的公司 ， 那么你只靠一个人， 它可能要 100 年才能做出来 ， 那你在市场上是没有竞争力的 。

但这个时候如果你有 100 个人， 或者 200 个非常聪明的人， 它们一起协作 ， 那很可能就可以在短时间内完成 。

所以通过这个 Agent 集群 ， 我们可以实现规模化的输入 ， 比如说你可以同时去调查几百个不同的数据来源 ，在各种权威的数据源里面去寻找你要的答案 。

你也可以做规模化的输出 ， 比如说你可以通过刚才说的数据来源 ， 可以去撰写一个几百页的这样的一个论文 ， 或者去规模化的执行 ， 或规模化的编排 ， 通过这种方式去提升任务的复杂度 。

然后同时我们也非常注重去提升 、 去研发更好的网络架构 。 所以这个是我们最新的一个在最新开源的一个模型架构 。

### 架构创新

**杨植麟** [4:32]
然后这里面其实最主要的 insight 就是一个来自于一个十年前的技术 ， 叫 RustNet， 或者叫残差网络 。在十年之前其实没有任何人有办法去训练这种深度的神经网络 。

然后通过之前像何恺明等研究者去引入这种残差网络 ， 它可以让模型去训练超过比如说几十 、 几百层 ， 你可以任意地去增加层数 。

然后这种残差结构其实你可以认为它是 LSTM 网络的一个变种 ， 只是说 LSTM 可能是应用在时间的维度上， 那残差网络它更多现在可能是应用在深度上， 然后使得说你每一层可以用上一层的输出 ， 然后做一个函数的处理 ， 得到当前这一层的输出 。

那我们其实就是把一样的类似的思路做一个自然的泛化 ， 我们把注意力机制这种计算模式也是进行一个 90 度的旋转 ， 从原来可能只是应用在时间轴上， 现在可能我们可以把它应用在深度上 。

所以当你把注意力应用到深度上之后， 它其实有很多好处 ， 比如说你可能就不仅仅只是基于前一层的输出来进行计算 ，而是你可以去结合之前的所有层的输出进行计算 ， 那这样你在优化的时候就会有非常多的好处 。

这个是我们的整个架构的体现 ， 就可以看到左边是标准的残差的结构 ， 那右边其实是最新的我们提出来的并且开源的残差结构 。

然后我们也设计了这种基于块状的残差结构 ， 使得说它能够非常高效地去进行实现 ， 能够基本上在只有 2% 的这种额外的成本的情况下， 能够非常大幅度地去提升它的效果 。

然后当然这只是我们在这里面去做模型架构 ， 包括优化器创新的一个例子 。 就像我刚才说的 ， 我们可能不仅仅只是去暴力地做规模化 ，而是希望我们在这里面规模化的同时也能够去提升它的效率 。

所以我们一直希望有 ，也一直是致力于研发更强的模型架构 ， 使得说它的 Token 效率可以更高 。 比如说像 Adam 优化器 ， 或者像 Attention 架构 ， 或者像残差连接 ， 这些都是有了 8 到 11 年的历史的技术 ， 这个在计算机里面其实是一个非常长的时间 ， 就过去十年的时间里面其实没有任何人能够去挑战这样的技术 ， 大家都把它当成一个标准 。

### 挑战标准

**杨植麟** [7:11]
但其实你可以看到随着现在算力的进步 ， 包括大家研发方式的变化 ， 从原来的可能偏学术 、 单纯从 idea 出发的研究 ， 到变成现在可能更加重视与工程的结合 ， 然后可以设计非常扎实的这种规模化验证实验 ， 从而让你能得到非常扎实的结论 。

所以很多以前认为是标准的东西 ， 现在都是可以被挑战的 。 所以我们在这里面通过一系列的新的模型架构和我们的开源 ， 让它能够被全世界更多的人能够去获取这样的新的技术 ， 从而推进整个领域的发展 。

### 开源生态

**杨植麟** [7:51]
所以可以看到我们通过开源的技术 ，也逐渐让更多的技术和模型成为了新的标准 。 这个是两张可能从 NVIDIA 在最新 GTC 2026 年发布里面摘取的幻灯片 。

所以你也可以看到 ， 就是像以 Kimi 为代表的很多模型 ，其实现在正在全世界所有的模型厂商的评测里面作为一个标准 。

就是你如果要发布一个新的芯片 ， 那你必须要通过 Kimi 或者其他的开源模型来评测你的性能的提升 。

然后包括全世界很多研究机构也在用 k2.5 或者是其他的开源模型去进行研究 。 我觉得通过开源让每一个企业 、 每一个研究者 、 每一个终端的用户能非常低门槛地获取智能 ， 是一个非常重要的事情 。

同时我们在这里面也做很重要的很多创新 ， 包括我刚刚提到的很多新的架构 ， 使得说这些技术它都是开放的 ， 可以被任何人所获取 ， 然后大家能够去形成一个生态系统 ， 一起去推动这个领域的发展 。

### AI主导研究

**杨植麟** [9:08]
当然这个领域的发展它也在逐渐往前走 ， 现在的研发方式可能跟两三年之前会有很大的不同 。 可能三年之前更多的是大家使用天然数据 ，也就是你可能从整个互联网获取的数据 ， 加上一些少量的人工标注 ， 你可能要去标注某一条数据 ， 它到底是不是符合你的价值观或者偏好 ， 到可能去年大家更加重视一个大规模的强化学习系统 ，在这里面可能仍是去

筛选里面高质量的任务 ，但是这些任务还是由人来确定的 。 然后通过在这些任务上做强化学习得到更好的效果 。

可以看到大家就是在编程或者数学这些领域上得到的提升 ，其实主要来自于这种技术路线 。 但是从今年到明年， 以及接下来的若干年的时间内 ， 整个 AI 研究和研发的方式会发生重大的变化 ， 就是会有更多的是 AI 去主导这个研究 。

就是每个研究员他会配备非常多的 AI 的 Token， 然后这些 AI 的 Token 可以帮你去合成新的任务 ， 然后去帮你合成新的环境 ， 去帮你定义在这个环境下面到底什么样是最好 、 最合适的奖励函数 ， 甚至去帮你探索可能新的网络架构它可能长什么样 。

### 结语

**杨植麟** [10:26]
所以在这样的前提下， 整个 AI 的研发也会逐渐加速 。 所以我们希望也能够跟整个开源社区一起去不断地把智能的技术往前推进 ， 打造一个更加好的生态系统 。

感谢大家 。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
