能源转智能0:00
很高兴有机会能跟大家分享我们在做开源的模型 , 还有包括就是去训练更好的大模型这个领域上做的很多最新的工作 。
呃 ,其实做大模型这个事情本质上是把更多的能源转换成智能 , 然后转换成这个转化的过程中最重要的一个事情是能够去规模化 ,也就是说能够把尽可能多的能源 , 然后去经过算力和模型 , 去变成更多的 、 更高程度的智能 。
有效规模化0:35
所以本质上, 规模化这个事情是过去若干年所有的模型和 AI 发展的一个很重要的基础 。 当然就是这个规模化 , 它并不是代表着说我们只是去暴力地增加能源 , 或者去暴力地增加算力 ,而是涉及到我们怎么在这里面能够非常有效地去进行规模化 。
所以我们其实会从不同的方面去提高这个有效性 , 比如说我们会很强调去提升 Token 的效率 。Token 的效率它本质上是代表着说你从同样的数据中能够学到多少智能 ,因为这个世界上的有效的数据其实是一个常量 , 或者说它是一个非常有限的值 。
Token效率1:00
那如果你有更好的网络架构 , 或者有更好的优化器 , 那么你就可以从一样的数据里面学到更多的智能 。
然后同时我们也希望去提升更长的上下文 ,因为在更长的上下文的时候 , 可以在相同的情况下可能得到更低的 loss。
通过这个更低的 loss, 它本质上意味着这个模型可以去学会更加复杂的任务 。 所以我们也设计了一系列的网络架构 , 还有数据 , 去提升它在长上下文的表现 。
同时我们在最新的模型 Kimi k2.5 里面也提出了我们新的一种规模化的方法 , 就是通过引入多个 Agent 形成一个 Agent 集群 , 或者叫 Agent Swarm 的概念 , 使得说有很多个 Agent 可以一起去工作 , 然后通过这种方式去提升它能完成的任务的复杂度 。
Agent集群1:56
所以这个是一个我们在 k2.5 里面研发出来的 Agent 集群 , 它的一个效果 。 可以看到横坐标是任务的复杂度 ,而纵坐标是它的执行时间 。
所以如果我们原来只是用这种单一 Agent 的方式进行工作 , 你可以看到就是随着任务的复杂度逐渐提升 , 它需要的完成时间可能是指数增加的 。
比如说如果你完成一个非常复杂的任务 , 比如你如果想从头去写一个代码仓库 , 去实现一个很复杂的功能 , 那它可能需要几天甚至几周的时间 。
但是如果我们能够并行开启 , 比如说 100 个 Agent 去同时完成这个任务 , 然后可能在这个过程中它们会有去进行互相的协作 , 然后去互相地协调和规划接下来应该要做的事情 , 就跟一个人类的组织一样 , 那么这个时候它其实可以做到随着任务复杂度的增加 , 它的执行时间其实没有太大的变化 。
那这样的话也意味着你可以在单位时间内去完成更加复杂的任务 , 使得说原来一些可能完全不可能实现的任务变得有可能 。
这个就像一个公司一样 , 如果你想做一个非常艰难的一个事情 , 你要完成一个很复杂的一个 mission, 比如说从 0 到 1 建造一家 100 亿或者 1000 亿美元的公司 , 那么你只靠一个人, 它可能要 100 年才能做出来 , 那你在市场上是没有竞争力的 。
但这个时候如果你有 100 个人, 或者 200 个非常聪明的人, 它们一起协作 , 那很可能就可以在短时间内完成 。
所以通过这个 Agent 集群 , 我们可以实现规模化的输入 , 比如说你可以同时去调查几百个不同的数据来源 ,在各种权威的数据源里面去寻找你要的答案 。
你也可以做规模化的输出 , 比如说你可以通过刚才说的数据来源 , 可以去撰写一个几百页的这样的一个论文 , 或者去规模化的执行 , 或规模化的编排 , 通过这种方式去提升任务的复杂度 。
然后同时我们也非常注重去提升 、 去研发更好的网络架构 。 所以这个是我们最新的一个在最新开源的一个模型架构 。
架构创新4:20
然后这里面其实最主要的 insight 就是一个来自于一个十年前的技术 , 叫 RustNet, 或者叫残差网络 。在十年之前其实没有任何人有办法去训练这种深度的神经网络 。
然后通过之前像何恺明等研究者去引入这种残差网络 , 它可以让模型去训练超过比如说几十 、 几百层 , 你可以任意地去增加层数 。
然后这种残差结构其实你可以认为它是 LSTM 网络的一个变种 , 只是说 LSTM 可能是应用在时间的维度上, 那残差网络它更多现在可能是应用在深度上, 然后使得说你每一层可以用上一层的输出 , 然后做一个函数的处理 , 得到当前这一层的输出 。
那我们其实就是把一样的类似的思路做一个自然的泛化 , 我们把注意力机制这种计算模式也是进行一个 90 度的旋转 , 从原来可能只是应用在时间轴上, 现在可能我们可以把它应用在深度上 。
所以当你把注意力应用到深度上之后, 它其实有很多好处 , 比如说你可能就不仅仅只是基于前一层的输出来进行计算 ,而是你可以去结合之前的所有层的输出进行计算 , 那这样你在优化的时候就会有非常多的好处 。
这个是我们的整个架构的体现 , 就可以看到左边是标准的残差的结构 , 那右边其实是最新的我们提出来的并且开源的残差结构 。
然后我们也设计了这种基于块状的残差结构 , 使得说它能够非常高效地去进行实现 , 能够基本上在只有 2% 的这种额外的成本的情况下, 能够非常大幅度地去提升它的效果 。
然后当然这只是我们在这里面去做模型架构 , 包括优化器创新的一个例子 。 就像我刚才说的 , 我们可能不仅仅只是去暴力地做规模化 ,而是希望我们在这里面规模化的同时也能够去提升它的效率 。
所以我们一直希望有 ,也一直是致力于研发更强的模型架构 , 使得说它的 Token 效率可以更高 。 比如说像 Adam 优化器 , 或者像 Attention 架构 , 或者像残差连接 , 这些都是有了 8 到 11 年的历史的技术 , 这个在计算机里面其实是一个非常长的时间 , 就过去十年的时间里面其实没有任何人能够去挑战这样的技术 , 大家都把它当成一个标准 。
挑战标准6:43
但其实你可以看到随着现在算力的进步 , 包括大家研发方式的变化 , 从原来的可能偏学术 、 单纯从 idea 出发的研究 , 到变成现在可能更加重视与工程的结合 , 然后可以设计非常扎实的这种规模化验证实验 , 从而让你能得到非常扎实的结论 。
所以很多以前认为是标准的东西 , 现在都是可以被挑战的 。 所以我们在这里面通过一系列的新的模型架构和我们的开源 , 让它能够被全世界更多的人能够去获取这样的新的技术 , 从而推进整个领域的发展 。
开源生态7:51
所以可以看到我们通过开源的技术 ,也逐渐让更多的技术和模型成为了新的标准 。 这个是两张可能从 NVIDIA 在最新 GTC 2026 年发布里面摘取的幻灯片 。
所以你也可以看到 , 就是像以 Kimi 为代表的很多模型 ,其实现在正在全世界所有的模型厂商的评测里面作为一个标准 。
就是你如果要发布一个新的芯片 , 那你必须要通过 Kimi 或者其他的开源模型来评测你的性能的提升 。
然后包括全世界很多研究机构也在用 k2.5 或者是其他的开源模型去进行研究 。 我觉得通过开源让每一个企业 、 每一个研究者 、 每一个终端的用户能非常低门槛地获取智能 , 是一个非常重要的事情 。
同时我们在这里面也做很重要的很多创新 , 包括我刚刚提到的很多新的架构 , 使得说这些技术它都是开放的 , 可以被任何人所获取 , 然后大家能够去形成一个生态系统 , 一起去推动这个领域的发展 。
AI主导研究9:08
当然这个领域的发展它也在逐渐往前走 , 现在的研发方式可能跟两三年之前会有很大的不同 。 可能三年之前更多的是大家使用天然数据 ,也就是你可能从整个互联网获取的数据 , 加上一些少量的人工标注 , 你可能要去标注某一条数据 , 它到底是不是符合你的价值观或者偏好 , 到可能去年大家更加重视一个大规模的强化学习系统 ,在这里面可能仍是去
筛选里面高质量的任务 ,但是这些任务还是由人来确定的 。 然后通过在这些任务上做强化学习得到更好的效果 。
可以看到大家就是在编程或者数学这些领域上得到的提升 ,其实主要来自于这种技术路线 。 但是从今年到明年, 以及接下来的若干年的时间内 , 整个 AI 研究和研发的方式会发生重大的变化 , 就是会有更多的是 AI 去主导这个研究 。
就是每个研究员他会配备非常多的 AI 的 Token, 然后这些 AI 的 Token 可以帮你去合成新的任务 , 然后去帮你合成新的环境 , 去帮你定义在这个环境下面到底什么样是最好 、 最合适的奖励函数 , 甚至去帮你探索可能新的网络架构它可能长什么样 。
结语10:26
所以在这样的前提下, 整个 AI 的研发也会逐渐加速 。 所以我们希望也能够跟整个开源社区一起去不断地把智能的技术往前推进 , 打造一个更加好的生态系统 。
感谢大家 。
