开场0:00
好 , 很荣幸今天能邀请到这个各位重磅的嘉宾啊 , 然后也覆盖了其实不同的层面 , 对吧 , 从模型层到这个底层的算力层 , 到上面的 Agent 层 。
那就很高兴今天能 , 呃 , 跟大家一起来探讨一下, 然后可能最主要的关键词是这个 " 开源 ", 然后还有 "Agent"。
那我们就先从第一个问题开始 , 啊 , 这个问题是给所有人, 啊 , 就是我们现在也是最流行的这个 OpenClaw, 然后, 呃 , 大家自己日常使用这个 OpenClaw 或者类似的产品 ,有什么 , 呃 , 觉得最有想象力或者印象深刻的是什么 ?
OpenClaw体验0:40
然后从技术的角度来看 , 呃 , 如何看待今天 OpenClaw 和相关的 Agent 的演进 ? 那我们要不从这个张鹏这边开始 ?
好 , 先感谢植麟啊邀请 , 然后也感谢主办方给这么机会跟大家来交流 。 呃 , 确实很早我就开始自己来 , 呃 , 玩这个 OpenClaw, 当时还不叫 OpenClaw, 最早叫 Claud Bot, 然后来接上这些事情自己动手来搞 。
毕竟也是程序员出身 , 玩这些东西还是有一些自己的体验 。 我觉得这个事情它可能给大家带来的最大的一个突破点 , 或者说新鲜的一个点就在于 , 可能这件事情不再是程序员或者说 , 呃 , 极客们的这种专利 , 普通人也可以比较方便地来使用顶尖的这些模型的这个能力 , 尤其是在编程和智能体方面的这些能力 。
呃 , 所以我到现在为止 , 可能跟大家在交流的过程当中更愿意把 OpenClaw 这个事情称作一个叫 , 称作叫 " 脚手架 "。
它提供的是一种可能性 ,在模型的基础上搭起来一个很牢固的 、 很方便的 、 但是又很灵活的这样的一个脚手架 , 大家可以按照自己的意愿去使用很多的 , 呃 , 底层的模型提供的这个很新奇的一些东西 。
原来自己的一些想法 , 受限于自己不会写代码或者不会这样的一些其他的一些技能 , 那今天终于可以通过很简单的交流就可以把它 , 把它完成 。
所以这个事情对我来说是一个非常大的一个 , 呃 , 这个冲击吧 , 或者说让我重新认识的这样一件事情 。
对 , 大概是这样 。
对 , 对 , 那个其实我最开始用 OpenClaw 的时候是不太适应的 ,因为我习惯于这种 , 呃 , 跟大模型聊天的这种交流方式 , 然后发现啊 ,OpenClaw 感觉好像反应好慢 , 就这种感觉 。
但是后来我意识到一个问题 , 就是它和之前的这种聊天机器人有一个很大的 , 呃 ,不一样 , 就是它其实应该是一个能够帮我完成一个大型任务的一个人。
所以我其实后面开始给它提交一些更复杂的任务的时候 , 我就发现其实它能够做得很好 。 然后这件事情呢 , 对我来说有个很大的感触就是 , 呃 ,其实在这个模型从最开始的按照 token 去聊天 , 到现在能够变成一个 Agent, 变成一个 , 呃 , 龙虾能够帮你去完成任务 , 它对于我们整个的 AI 的想象力空间已经做了一个很大的提升 ,但同时它对于整个这个系统
的能力的要求也变得很大 。 这也是为什么我一开始用 OpenClaw 会觉得它有点卡的这个原因 。 对 , 那 , 呃 , 所以呢 , 我作为这样的一个基础设施层的一个厂商 , 那我其实看到的是 Claud 对于整个 AI 后边的一个 , 呃 , 整个大型的系统和生态都带来了更多的机遇和挑战 。
啊 ,因为我们现在的这个所有的能够用到的资源 , 想要支撑起这样一个快速增长的时代是不够的 。
比如说就拿我们公司来说 , 我们公司在 , 呃 ,1 月底开始 , 基本上每两周我们的 token 量就翻一番 , 到现在基本上翻了十倍 。
呃 , 对 , 上次见到这个速度还是那个当时 3G 的时候手机流量的那种感觉 。 啊 , 对 , 所以呢 , 我现在有种感觉就是 , 就是现在的这个 token 用量就跟当年我们有 100 兆的每 , 每 100 兆每个月的这个手机流量一样 , 啊 , 的那个时代 。
那 , 呃 , 这种情况下其实我们所有的资源是需要进行更好的优化 , 进行更好的整合 , 然后让我们的每一个人 、 每一个 , 呃 ,不是这个不仅仅在 AI 领域 ,而是在整个社会上就是每一个鲜活的人, 都能够去把这个 OpenClaw, 把这样的 AI 能力给用起来 。
啊 , 所以我作为基础设施的玩家 ,其实 , 呃 , 对这个时代是非常激动和感触的 ,而且认为这里面有很多的优化空间 , 啊 ,是我们仍然应该去探索 , 应该去尝试的 。
啊 , 谢谢 。
嗯 , 我自己是把 OpenClaw 当作 Agent 框架的一个非常革命性和颠覆性的一个事件来看待的 。 呃 , 虽然我知道就是其实我身边所有在进行非常 , 嗯 , 深度 coding 的人, 可能他的第一选择还是 Claude Code,但是 , 呃 , 我相信只有用过 OpenClaw 的人会 , 呃 , 独特地感受到这个框架 , 它其实有很多在 Agent 框架上的设计性是领先于 Claude Code 的 , 包括最近 Claude Code 有很多最新的更新 , 嗯 ,其实都是这样在 OpenClaw 去靠
近 。 嗯 , 我自己去使用 OpenClaw 的话 , 呃 , 我 , 我 , 我感觉这个框架给我自己带来 , 哎 , 更多是一个想象力的随时随地的一个扩展 。
就 , 呃 ,Claude Code 可能最最开始我只能在我的桌面上, 然后去延展我的创创创意 ,但是在 OpenClaw 我可以随时随地去延展我的创意 。
呃 , 我后面发现其实 , 呃 ,OpenClaw 其实它带来的主要核心的价值在于两个 , 第一个是它是开源 , 嗯 , 开源其实是一个非常有利于整个社区去 , 呃 , 深入去参与 , 去重视改进 , 去 , 呃 , 投入到 Agent 框架这个事儿一个非常重要的一个前置条件 。
嗯 , 像 OpenClaw 像 Claude Code 这样的一些 Agent 框架 , 我认为它 , 呃 , 很大的一个价值是在把国内的可能没有非常接近于闭源模型 ,但是水平还是在次闭源模型的这样一个赛道上的模型的上限给拉到非常高 。在绝大部分的场景其实我们能发现它的任务的完成度已经非常接近 Claude 的最新的模型 , 然后同时它又把下限给保保证得非常好 ,因为它可以靠一套 hardest 的系统 , 或者说可以靠
靠它的 skills 的体系等等很多的诸多的设计 , 保证它的任务的完成度和准确率 。 所以我觉得 OpenClaw 其实给我自己带来的一个 , 呃 , 我认为 , 哎 , 从一个基础大模型的角度来说 , 它是保证了基础大模型的下限 , 然后拉伸了它的上限 。
然后此外我我自己认为 OpenClaw 它其实给整个社区带来的价值是 , 它更多去点燃了大家发现原来在 , 呃 , 大模型外的这一层 , 更更重要的 Agent 的这一层 , 它有非常多的 , 呃 , 想象力和空间可以做 。
然后这是我看到最近社区在 , 哎 ,有有有更多除了 , 呃 , 呃 , 研究员以外的人在去参与到这个 AGI 的变革当中, 然后也有更多人去借助到更强的 , 呃 ,Agent 框架 ,hardest 或者 skill for 的等等 , 然后, 呃 , 去去 , 呃 , 呃 , 一定程度上说是是在去替代自己的工作 , 然后一定程度上是在 , 哎 , 释放自己的 , 呃 , 时间 , 然后去做更有想象力的事情 。
对 , 嗯 。
呃 , 我感觉首先可能从交互模式上来讲的话 , 为什么 OpenClaw 这次会爆火的话 , 我感觉首先可能第一个就是给了大家一种更有活人感的一种感觉 。
因为比如说我们其实做 Agent 也有一两年了 ,但之前包括像 Cursor 啊 、Claude Code 啊这些 Agent,其实大家给人感觉更强的是一种有种工具感 。
对 , 然后我觉得 OpenClaw 它首先第一次它的交互模式以这种 IAM 软件嵌入的方式 , 可以让大家可能更有一种活人感 , 更有一点更接近于自己想象中的个人加贾维斯这样的一个概念 。
所以我觉得这可能是交互模式上的 。 然后另另外一个我觉得它带给整个大家的一个启发的话是说 , 可能从 , 呃 , 当它的架构 Agent loop 这种非常简单但高效的一种框架 ,其实也是再次被证明 。
然后还有就是它可能整体来说就会让我们重新思考就是说我们是否需要一个 all in one 非常强大的智能体 , 然后能够帮我们做很多事情 , 还是需要一个比较好的一个像这种类似于一个轻量级操作系统或者脚手架一样的一个小管家 。
我觉得它带来的是说可以通过一个小的这样的一个 OpenClaw 或者是这样的一个龙虾的一个操系统的一个一个生态 , 可以去把整个的这种包括让大家都我觉得整整让整个社区大家更有玩起来的心态 , 然后是撬动整个生态里面所有的工具 , 包括随着像 skills 啊或者 harness 这些 , 大家也越来越多的人可以去设计更 , 呃 , 面向于像 OpenClaw 这样的一些系统里面的一些应用啊 , 然后去赋赋能于各行
各业 。 我觉得它这个其实和天然就和整个的开源生态结合得非常紧密 。 所以我觉得这两点其实相对来说是我觉得是带给我们最大的一个启发 。
GLM5 Turbo8:54
那顺着这个刚刚一直在讨论 OpenClaw, 然后看想问一下, 呃 , 张鹏就是看到最近智谱也发布了就是新的这个 GLM5 Turbo 模型 , 然后我理解就是对这个 Agent 能力其实也做了很大的增强 , 所以能不能给大家介绍一下就是这个这个新模型和其他模型的不同之处 ,以及就是说我们也观察到 , 呃 ,有一个这种提价的这个这个策略 , 对吧 , 然后那这个反映了什么
样的一个市场的信号 。
好 , 呃 , 这是个很好的问题啊 , 就是前两天确实我们也这个紧急地更新了一波 , 呃 , 当然这个是其实是在我们这个整个的发展路标当中的其中的一个阶段 , 我们提前可能把它放出来 。
那这个事情其实最主要的目的还是要 , 呃 , 主打一个从原来的简单的对话到干活 , 就是也也是刚才各位讲的非常赞同的一点 , 就是 OpenClaw 真的让大家觉得大模型不再是简单的能够 , 呃 , 聊天 , 真的能帮我干活 。
但这个干活的背后隐含的这个能力的需求是非常高的 , 就是它需要自己去长程的做任务的规划 ,不断地重试 ,不断地去压缩自己的上下文 , 然后 debug 等等 , 还有可能涉及到多模态信息的处理 。
所以这个对模型本身的能力的要求其实是有跟传统的面向对话的机器人的这种通用泛用模型其实是有有一些不一样的 。
所以 GLM5 Turbo 呢是在这方面做了一些专门的这个加强 , 尤其是你刚才你提到的 , 比如说我们要它干活长程的 72 小时, 如何能够不停地自己去 loop 这个事儿 , 呃 , 这里边是做了很多的 , 呃 , 一些工作 。
另外呢 , 就是大家也提到就是关于这个 token 消耗量的问题 , 所以你让它这个聪明的模型让它干这种复杂的任务 ,其实 token 的消耗量是非常巨大的 , 可能一般人可能体会不出来 ,但是只会看到自己的账单上的那个钱在不停地往下掉 。
所以在这方面我们也做了一些优化 , 呃 ,在面临复杂任务的时候 , 它可能会用更高效的 token 效率去完成这些事情 。
所以这个是主要在 , 呃 , 这几个方面做了一些优化 ,但本质上它的模型的 , 呃 , 架构还是一种就是多任务协同的这样的一种 , 呃 , 通用的模型的这种架构 , 只是在能力上有一些偏向性的加强 。
那么提价这个事情其实也很顺畅地能够跟大家解释 , 就刚才也提到了 , 我们现在不再是简单地问一个问题 , 它回答 , 它背后有思考的这个链路是很长的 , 然后包括很多任务它通过写代码的方式跟底层的这些 , 呃 , 去这个基础设施进行打交道 , 还要去 debug, 随时地去改正自己的错误 ,其实这个消耗量非常非常地大 。
完成一个任务可能它需要的 token 量是原来的回答一个简单的问题的 token 量的可能十倍甚至百倍 。 所以这个价格上, 呃 ,是是是是需要成本上是要有一定提高的 , 呃 , 所以模型也变得更大了 , 然后它的推理的成本也相应地提高了 。
所以我们也把它回归到一个正常的这个商业价值上来 , 呃 ,因为长期地靠这个低价这个竞争也不利于整个行业的发展 。
所以这是我们的一个考量吧 ,也让我们能够持续地在商业化的路径上有一个很好的良性的闭环 ,不断地去优化 , 呃 , 模型的能力 , 能够跟持续地给大家提供更好的这样的模型和相应的这些 token 的服务 。
啊 。
对 , 非 , 呃 , 非常好的这个这个分享 。 那其实因为现在有这个开源模型 , 然后跟这个 , 呃 , 呃 , 推理算力我感觉现在也开始形成一个生态 , 对吧 , 然后各种各样的开源模型可以在各种各样的推理算力上, 然后呢去给用户提供更多的价值 , 然后随着这个 token 量的爆炸 , 现在也可能逐渐从训练时代变成了这个推理时代 。
Agentic Infra12:24
所以想请教一下立雪 , 就是说从 Infra 的层面 , 呃 , 这个这个推理时代对于这个无问来说它它意味着什么 。
好的 , 感谢指点 。 对 , 确实因为我们是一个 , 呃 , 诞生在 AI 时代的一个基础设施的厂商 , 然后我们现在也为 Kimi、 为智谱 , 包括也在跟 MiMo, 呃 , 去做合作 , 然后让大家能够把我们这样一个 token 工厂更高效地给用起来 。
然后当然我们也在 , 呃 , 跟很多高校科研所也在合作 。 所以我们其实一直都在思考一件事情啊 , 就是 , 呃 ,AGI 时代需要的基础设施它会是什么样子的 , 然后我们怎么能够一步步地去在这个过程中去实现它和推演它 。
那我们现在呢也是做好了充分的准备 ,也看到了就是 , 呃 , 短就是短期 、 中期和长期不同阶段我们需要解决的问题 。
那当前脚下的一个问题其实就是刚刚大家也聊到的 , 现在整个 , 呃 , 这个大的这个像 Claude 带起来的整个 token 量的这个暴增 , 对于我们的系统效率其实带来了更大的优化的需求啊 , 包括其实价格的增长也是大家在这个需求下的一种解决方式 。
那我们呢其实一直以来都是从这种软硬件达通的方式来去做 , 呃 , 布局和解决的 , 包括我们其实接入了 , 呃 , 我们能够看到的几乎所有的种类的这种计算芯片 , 我们把国内的几十 , 呃 , 十几种的这种芯片和几十个不同的算力集群都给统一地连接起来 , 这样呢我们能够去解决就是 AI 的这样一个系统中对于算力资源的一个紧缺的问题 。
因为 , 呃 , 我们当资源不足的时候 , 最好的办法就是第一把能够用的资源都用起来 , 第二让每一个算力都用在刀刃上, 让每一个资源都 , 呃 , 发挥出最大的这样一个转化效率的价值 。
所以在这个时代呢 , 我们在当前脚下要解决的就是怎么能够去进一步地打造一个更高效的 token 工厂 。
对 , 啊 , 那这里边我们做了很多的优化 , 那包括我们让这个模型和硬件上的各种的这种 , 呃 , 显存啊 , 各种各样的这些技术进行一个最优质的适配 , 包括我们也在看 , 呃 , 会不会在最新的模型结构和模硬件结构下能够进行一些更深度的化学反应 。
对 , 那解决这个脚下的效率问题呢 ,其实我们还只是打造了一个 token 的一个标准化的一个 token 工厂 ,但是面向 Agent 时代我们认为这还是不够的 ,因为就像刚刚说的 Agent 它更像是一个人, 就是我们能够交给它一个任务 , 对吧 。
那 , 呃 , 我认为我我其实很坚定地认为 , 呃 , 当前的很多的云计算时代的基础设施其实是为 , 呃 , 服务一个 , 呃 , 程序 , 服务一个人类工程师所设计的 ,而不是为 AI 设计的 。
对 , 那有点像什么呢 , 我们做了一个基础设施 , 然后它上面有一个接口 , 这个接口是为人类工程师做的 , 然后再上面要再包一层再去接入 Agent。
啊 , 那这种方式其实是用人的这个操作的一些能力限制了 Agent 的发挥空间 。 我举一个例子 , 比如说 Agent 它能够做到秒到毫秒级别去思考和发起任务 。
对 , 那这件事情其实在我们之前的这些 , 比如说底层的 K8S 这些能力上 ,其实是没有做好这个准备的 ,因为人类大概发起一个任务是分钟级别的 。
啊 , 那我们这样的一些功能其实是需要进一步的能力 , 我们将它称作 Agentic Infra, 就是我们叫做我们需要打造一个更智慧化的一个 token 工厂 。
那这个是我们 , 呃 , 无问芯穹现在正在做的事情 。 然后, 呃 , 从更长远的未来 , 就是真正 AGI 的时代到来的时候 , 那我们认为连基础设施都应该是一个智能体 , 就是我们认为我们自己所打造的这套 , 呃 , 工厂本身也应该是一个能够自我进化 、 自我迭代的 。
啊 , 它能够形成一个自主的组织 , 然后相当于它有一个 CEO, 这个 CEO 是一个 Agent, 它可能是一个 Claude 在管理整个基础设施 , 然后根据它的 AI 客户的需求自己去提需求 , 迭代自己的基础设施 , 然后这样 AI 和 AI 之间才能够去 , 呃 , 更好地形成耦合 。
所以我 , 呃 , 我们也在做一些 , 比如说我们能够让 Agent 和 Agent 之间更好地通信 , 然后做 cash to cash 这样一些复制的能力 。
啊 , 所以我们其实一直都在思考就是 , 呃 , 基础设施和 AI 的发展不应该是一个隔离的状态 , 说我接受一个需求我就去制作 ,而是应该是产产生非常丰富的化学反应 。
那这件事情才是我认为真正地做到所谓的软硬协同 , 做到这种算法和基础设施的协同 , 这也是无问芯穹一直想实现的一个自己的使命 。
啊 , 谢谢 。
接下来想问问福利 。 啊 , 小米最近也是通过 , 呃 , 发布新的模型 , 包括开源一些背后的技术 , 我觉得对这个社区做出了很大的贡献 。
结构创新17:04
呃 , 所以想问一下, 呃 , 小米在 , 呃 , 做大模型方面你觉得会有什么独特的优势 ?
我觉得 , 呃 , 我们先抛开小米在做大模型方面有什么独特优势 , 呃 , 这个话题 , 就是 , 呃 , 我更想谈一下就是 , 呃 ,其实中国的做大模型的团队在做大模型上的一个优势 , 我觉得这个话题更具备更广泛的一个价值 。
嗯 ,其实在 , 呃 , 呃 , 大概两年前就是我看到中国的基座大模型团队已经在开始了一个非常好的 , 呃 , 突破 , 这个突破叫做我们在怎么在有限的算力 , 尤其是在一些 , 呃 ,Vlink 互联带宽受限的一些算力的情况下, 啊 , 怎么去突破这些 , 呃 , 低端算力的限制 , 然后去做一些 , 呃 , 看看似是为了效率妥协的一些模型结构的创新 , 像 DeepSeek V2、V3 系列的 , 呃 , 细细
度 MoE 和 MoAJ 等等。 但是其实我们后面能看到 , 呃 ,由这样一些创新引发的是一个变革 , 这个变革就是 , 呃 , 我们怎么在算 , 呃 , 算力一定的情况下, 然后怎么去 , 呃 , 发挥一定算力的最高的智能水平 。
我觉得这个是由 DeepSeek 带来给所有国内的基座大模型 , 基座大模型团队的一个一个勇气 , 一个信心 。 呃 , 虽然 , 呃 ,在在在今天我们其实 , 呃 , 呃 , 我们自己的国产芯片也好 , 啊 , 尤其是推理芯片以及我们的训练芯片 ,其实是以 ,是是 , 呃 ,不再受这个限制 ,但是我们能看到在这样的限制的情况下, 催生了我们对于 , 呃 , 更高的训练效率 、 更低的推理
效率的模型结构的全新的探索 , 就像最近的这种 , 呃 ,Hybrid 的 , 呃 ,Sparse 或者是 Linear Attention 的结构 , 呃 ,DSA、NSA, 然后 Kimi 也有 KSA, 然后, 呃 , 小米也有新的面向下一代结构的 High Sparse 的结构 。
这是区别于 MiMo V2 这一代结构 , 我们面向于 Agent 的这个时代去思考的如何在 , 呃 ,Agent 的这个时代我们去做更好的模型结构的创新 。
我为什么觉得 , 呃 , 结构的创新是如此地重要 ,是因为我们其实刚刚探讨到 OpenClaw 这个话题 , 呃 ,OpenClaw 其实 , 呃 , 大家如果真舍去用会发现你越用越好用 , 越用越聪明 。
那么它的一个前提是你的推理的 context, 呃 ,其实 non-context 是一个很 , 呃 , 我们谈论了很久的一个话题 。 嗯 ,但是其实真正现在你发现能有一个模型它在 non-context 的情况下表现非常好 , 呃 , 性能非常地强劲 , 呃 , 推理成本非常地低 。其实很多模型它不是做不到比如说 1 兆或 10 兆的 context,而是因为它去推 1 兆 、10 兆 , 它的成本太贵了 , 呃 , 效 , 呃 , 这个速度太慢了 。
那么怎么你能做到在 1 兆或 10 兆这个 context 的情况下, 推理的成本够低 , 速度够快 , 然后在这样的情况下, 啊 , 才会有真真正的高高生产力价值的任务交给这个模型 , 从而去激发在这种 non-context 的情况下, 它去完成更高复杂度的任务 , 可能我们才能在这样 10 兆甚至 100 兆 context 的情况下实现模型的自迭代 。
所谓模型的自迭代就是它可以在一个复杂的环境里边依靠于超长的 context, 然后完成对自我的这个进化 , 这个进化有可能是对 Agent 框架本身的 ,也有可能是对模型参数本身的 ,因为我们认为 non-context 本身其实就是对参数的一个进化 。
呃 , 所以其实 , 呃 , 呃 , 怎么实现一个 , 呃 ,non-context inflation 的架构 ,以及怎么在推理侧做到 non-context inflation 的 ,其实它是一个全方位的竞争 。
除了我刚刚提到的在预训练做好一个 non-context inflation 的架构 , 这个可能是我们一年前就去探索的一个问题 。 然后而当今你怎么做到 non-context, 呃 , 这个真实的这种 , 嗯 , 长长程距离的任务上的一个稳定性和非常高上限的一个效果 , 这是我们现在后训练再再去迭代的创新的一个范式 。
我们在想怎么去构造 , 呃 , 呃 , 更有效的学习算法 , 然后怎么去 , 呃 , 采集到真实的这种 , 呃 , 呃 ,在 1 兆 、10 兆 、100 兆上下文里边真的都具有长期依赖的这种这种文本以及结合复杂的环境产生的这个 trajectory, 这是我们现在在后训练正在经历的事情 。
但是我能看到更长期的事情是 , 呃 ,由于大模型 , 嗯 , 本身 , 嗯 ,在飞速的进步 ,由于我们有 Agent 的框架更好的一个加持 , 它我们能看到就像刚刚立雪说的 , 我们推理需求 , 我相信在今年, 啊 , 已经发生的事情是在过去一段时间内已经近 10 倍的一个增长 。
那么今年整个 token 的增长会不会到 100 倍 ? 那么这里边其实我们又到了另外一个维度的一个竞争 , 这个竞争就是 , 呃 , 算力或者说是推理芯片 , 甚至下到能源 。
对 , 所以我我我我我认为我们 , 呃 , 如果大家去思考这个问题 , 然后, 呃 , 我我认为可能 , 呃 , 我我会从从大家身上学到更多 。
对 , 嗯 。
OK, 非常有 insight 的分享 。 那下面想问一下黄超 , 就是说因为你也开发了一些非常有影响力的这个 , 呃 , 这个 Agent 的这个项目 , 啊 , 包括像这个 nanobot,也也有很多这个社区的粉丝 , 然后想问一下就是你自己觉得说从 Agent 的这个 harness 或者说应用的这个层面 , 接下来会有什么技术上方向是你觉得比较比较重要 , 可能大家需要去关注的 ?
Agent痛点22:52
对 , 呃 , 感谢志麟啊 。 我觉得首先就是从如果我们是把 Agent 的一些技术抽象出来 , 它关键几个点 , 比如说 planning, 然后还有就是 memory 和 tool use 这几个模块的话 , 比如说从 , 呃 ,planning 来讲的话 , 我觉得现在的问题就是还是面向于一些长程的任务或者非常复杂的一些上下文 , 比如说 500 步甚至更长的步数的 , 这样它很多模型我觉得它不一定能够去做
很好的一个 planning,是因为我觉得它本质上可能不具备这样的一个隐性的知识 , 比如特别是在一些很多一些复杂的一些垂直领域 。
我觉得这块可能 planning 我觉得未来可能是需要去对于很多把已有的各种一些比如说复杂任务的知识把它固化到模型里面去做 , 这块我觉得可能会是一个点 。
对 , 当然其实从 skill 我觉得本质 , 呃 , 一定程度上可能 , 呃 , 包括 harness harness 这种也是我觉得缓解了这种 planning 里面带来的错误 ,因为它提供了一些比如说高质量的 skill, 它本质上也是在 guide 模型去完成一些比较难的一些 task。
我觉得这个是针对于 planning。 然后的话就是 memory 的话 , 我觉得就是 memory 肯定我感觉 memory 带给我们的一种感受就是好像它永远都会存在着一个就是比如说信息压缩不准确 , 包括说不准这样的一些问题 。
我觉得这个是整个 memory 的 , 然后现在包括你的整个的长程任务的体现 , 还有一些复杂场景的话 ,其实 memory 就会暴增 。
我觉得这个其实是带来一个对 memory 的一个一个压力 。 但是现在其实包括像各类的龙虾们 ,其实大家都采用的是最简单的一些像文件系统这样的 markdown 格式的一些 memory, 通过我们是否去共享一些文件啊这样的方式来去去做 。
我觉得这一点其实可能未来 memory 应该是做可能类似于会走向一些分层的设计啊 , 包括如何去更加地去让 memory 做得更通用 。
因为其实 , 呃 , 老实讲现在我觉得整个 memory 机制其实很难做得很通用 ,因为比如说 coding 场景的 、deep research 的 、 呃 , 多媒体领域的 ,其实它的整个的数据的模态差别会很大 , 如何去对它这些 memory 进行很好的一个检索索引 , 然后更高效地 , 我觉得这个永远是在做一个 trade-off, 就是可能是我觉得这一点是整个 memory 的 。
然后当另外的一点就是说现在其实龙虾其实让大家对于 , 呃 , 创建 Agent 的这件事情的门槛大幅降低之后 ,其实未来可能不止一个龙虾 。
我看到 Kimi 其实也有 Agent swarm 这样的一些一些整个的机制出来 ,其实我觉得相当于是未来可能每个人会拥有一群龙虾 ,在这样一群龙虾相比于一个龙虾 , 那它的上下文的暴增 , 我觉得这个大家可以想象会非常地大 。
我觉得这个也是带给 memory 的一个压力 , 就如何在我觉得现在其实还没有一套很好的一套机制如何去管理这种一群龙虾带来的一个上下文 ,因为这个我们感觉特别是对于复杂的 coding 啊 、 科研发现这种 , 我觉得这个其实带给不管是模型还是整个的这种就是 Agent 的一个架构 ,其实都是压力挺大的 。
然后对于整个我觉得 tool use 这块的话 ,其实就 skill, 现在整个 skill 我觉得 , 呃 ,因为当时 MCP 其实当时大家的我觉得 MCP 本身存在的问题 ,其实现在 skill 其实还是会存在 , 比如说 MCP 当时是有 , 呃 , 质量不不保障 , 然后包括它可能会存在一些安全问题 。
然后现在 skill 的话 , 我觉得存在的首先就是 , 呃 , 现在看似确实会有很多 skill,但是高质量的 skill 我们觉得是比较少的 。
然后这样的话其实不低质量 skill 会很影响整个 Agent 的完成任务的一个一个完成度 。 然后另外的话还有就是 skill 这个就是我们觉得 , 呃 , 很难就很多时候也会存在一些恶意注入的问题 , 所以我们觉得从 tool use 这块的话 , 我觉得可能得需要靠整个社区 , 然后来去把整个样子把整个 skill 发展得更好 , 甚至让如何去通过这种在执行过程中去进化出来一些新 skill。
所以我觉得这个可能是整个不管是从 planning、memory 还是 skill 里面 , 我们觉得当下 Agent 可能存在的一些一些痛点和未来可能会潜在的一些方向 。
对 , 可以看到刚刚两位嘉宾也是从不同的其实视角 , 呃 , 然后去讨论一个问题 , 就是说现在随着复 , 呃 , 任务复杂度的增加 , 你的上下文会暴涨 , 那可能从模型层面是可以去提升你的 , 呃 , 原生的上下文强度 , 然后可能从 Agent harness 层面 , 可能像刚刚说的这种 planning、memory, 啊 , 包括 multi-agent 的 harness, 实际上也是能让可能你在一个特定的 , 呃 , 模型的能力下能够去支持更复
杂任务 。 我觉得可能这两个方向接下来也会 , 呃 ,有更多的这种产生化学反应 , 然后能够 , 呃 , 提升去 , 呃 , 完成这个任务的这个这个难度 。
对 , 那最后我们来一个这个开放式的展望 , 所以 , 呃 , 想请各位用一个词来描述一下接下来 12 个月大模型发展的趋势以及你的期望 。
未来展望27:37
那这次我们先从这个 , 呃 , 黄超这边开始 。
对 , 我感觉 12 个月在 AI 看起来已经好遥远 , 都不知道 12 个月之后会发展成什么样子 。
我看这里面原来写的是 5 年, 我感觉看起来像 。
对 , 对 , 对 , 我觉得首先我感觉可能从我这边的话 , 我感觉一个词应该叫生态吧 。 我觉得未来其实现在龙虾让大家这么活跃了 ,但是我觉得未来 Agent 真的是要去从真正的个人助手 , 特别是转换为打工人, 我觉得还是很重要的 。
因为现在可能大家很多时候玩龙虾也是一个新鲜感 , 然后可能是觉得好玩 ,但是我觉得未来可能真正得让龙虾们真的沉淀下来 , 真的应该是成为大家的一个一个搬砖的工具 , 或者是成为真正的一个 coworker 这样的一个状态 。
所以我觉得这块的话可能真的是需要整个生态的努力 , 包括整个我觉得开源这块其实就是一个很重要的把所有的相关的一些一些技术探索啊 , 包括整个模型的很多技术都开源出去之后 ,其实我需要整个生态大家一起来共建 ,不管是对于这种模型的迭代 , 还是对于这种 skills 平台的迭代 , 还有各种工具的 , 我觉得这块都需要去更好地去面向龙虾去创造更
好的生态 。 就从我自己感觉比较 , 呃 , 明显的就是我觉得未来的很多软件 , 对吧 , 包括现在有了龙虾 , 然后大家又会在考虑一个问题 , 就是未来软件是不是还是会给人用的吗 ?
我们相信可能未来大部分很多的软件都不一定会是面向面向人类了 ,因为人类是需要 GUI, 然后可能是面向 Agent 原生的去使用的 。
那这样我感觉一个比较有趣的就是人只会去使用让自己快乐的 GUI,有可能会有这样的一个感受 。 所以我觉得现在整个的生态又从 , 呃 ,不管是 GUI 还是 MCP 又转到了 CLI 这样的一个模式 , 所以我觉得这个就是需要一个整个生态 , 就需要生态去把不管是软件系统还是我们的整个的这种数据还是整个的这种就是各种的一些各种技术 ,其实都需要把它变成 Agent 原生化 ,Agent native 的模
式 , 这样可能能够才能让整个的这种 , 呃 ,Agent 的发展可能会更加丰富 。
对 , 我觉得 , 呃 , 把这个问题缩小到一年我觉得非常有意义 ,因为我觉得 5 年从我心目中对于 AGI 定义而言 , 我觉得已经实现了 。
但是所以所以就是 , 嗯 , 呃 , 如果说要用一个词来描述接下来一年, 我觉得 , 呃 ,AGI 历程里边最关键的一个事情的话 , 我我认为会是自进化 。
呃 , 虽然这个词它是一个非常 , 呃 ,有点玄幻的一个概念 , 我觉得在过去一年大家也多次提到 , 呃 ,但是我我也是最近才对这个词有了一个更深的一个体会 , 呃 , 或者说具体自进化这个事怎么做 , 会有一个 , 呃 , 更务实的一个 , 呃 , 实操可行的方案 。
对 , 然后呢 , 这这这里边的原因是确实是借助于很强大的模型 ,其实我们之前在 Chat 那个范式下根本没有发挥出来这个预训练模型它的上限 , 然后这个上限现在是被 Agent 的框架给激活到了 , 呃 , 我们现在触到了它可能 , 呃 , 当它执行更长时间的任务的时候 , 然后我们发现这个模型它可以自己去学习和进化 。
呃 , 呃 , 很简单一个尝试就是说当你在现有的 Agent 框架里边给它叠加一个可以 verify 的这样的一个条件限制 , 然后再给它设置一个 loop, 然后让这个模型就 , 呃 ,不停下来持续去迭代优化这个目标 , 我们就能发现这个模型会持续 , 呃 , 拿出 , 呃 , 更好的方案 。
如果这样的一种自进化能持续 , 现在其实能已经能跑一一两天了 ,其实国内的模型基本上能跑一两天了 , 当然跟任务的难度有关 。
我们发现做它在一些科学研究上, 比如说去探索一个更好的模型结构 , 然后因为模型结构它有评估标准 , 比如说我们看更低的 PPL, 这是一个评估标准 , 然后在这种很确定的任务上, 我们发现它已经能自主地运化和执行两三天了 。
所以 , 呃 , 从我的角度上来看 , 我觉得自进化是一个唯一可以创造一个新的东西的地方 , 它不是去替代我们现有的人的生产力 ,而是说它是像顶尖的科学家一样去探索出来 , 哎 , 哎 , 这个世界上没有的一个东西 。
然后我我其实在一年前我会觉得这个时间历程会拉到 3 到 5 年, 但是也就是在近期我会觉得这个时间历程确实我们应该缩小到最近一到两年, 可能我们就可以让 , 嗯 , 嗯 , 大模型叠加一个非常强的自 , 呃 , 自进化的一个 Agent 的框架 , 实现对于科科学研究的一个 , 呃 , 至少成 , 嗯 , 指数级的一个加速 。
因为我最近已经发现我们组内做大模型研究的同学基本上, 呃 ,其实他的 workflow 是非常不确定的 ,是高度创造力的 。
然后其实我们发现借助 Claude Code 加 Claude 加加非常顶尖的模型 , 然后, 呃 , 呃 , 基本上已经能够加速我们自己的研究效率近十倍了 。
所以 , 呃 , 我我很期待这样的一种范式辐射到更广的学科和领域 , 然后, 呃 , 我觉得自进化是非常重要的 。
嗯 。
好的 , 那个我的关键词叫可持续 token, 呃 ,因为我也看到了就是现在整个 AI 的发展呢 , 还在一个 , 呃 , 长期持续的一个过程中呢 , 我们也希望呢它是能够有长久的生命力的 。
那这里边呢 , 我们作为基础设施角度看到的一个很大的问题就是我们的资源终究是有限的 , 那就像我们当年在讲可持续发展一样 , 那我们现在作为一个 token 工厂能否给大家提供持续稳定 , 然后大规模能够用起来的这些 token, 让我们顶尖的模型真正能够继续为更多的下游去服务 , 啊 ,是我们看到的一个很重要的问题 。
啊 , 所以我们现在呢也是需要的 , 就相当于把整个的视角放宽到刚刚说到的整个生态 , 那从最早的能源到转化到算到算力 , 然后再转化到 token, 最终再转换成 ReGP 这样的一个链路 , 能够去进行一个 , 呃 , 持续的经济化的迭代 。
啊 , 包括我们其实不只在把国内的各种算力用起来 ,也在把这些能力输出到海外, 让全球的这个资源都能够进行打通和整合 。
对 , 所以我也认为这个可持续呢也是其实也是想把就是我们中国特色的这个 token 经济学给做起来 。
对 , 啊 ,因为其实我们在之前的时代我们是叫 Made in China, 对吧 , 我们会发现我们能够把中国的低价的这个 , 呃 , 这种制造能力 , 然后变成好的产好的商品输出到全球 。
那我们现在想做的呢就是有点像 AI Made in China, 就是我们能够把中国的这些能源上的优势 , 然后转通过这些 token 工厂 , 啊 , 可持续地转化成为优质的这种 token 输出到全球 。
对 , 那成为一个世界的这个 token 工厂 , 啊 , 这是我想要在今年看到的这个整个中国给世界的人工智能带来的价值 。
嗯 。
呃 , 我就简短一点吧 , 大家就可能都在仰望星空 , 我就落地一点 。 我觉得关键词让我说未来 12 个月面临的最大的问题可能就是算力 , 呵 ,因为刚才也说了所有的这个技术 , 包括 , 呃 , 智能体框架让很多人有很好的创造力 , 效率提升十倍 ,但前提条件就是大家能够用得起用得起来 。
你不能因为说算力不够一个问题提出去让他思考半天也不给我答案 , 这个肯定是不行的 。 然后, 呃 , 对 ,也是因为这样的一些原因 , 可能甚至连我们的这个这个研究的进展 , 包括很多想要做的一些事情其实都受阻了 。
前两年我记得是雅琴院士应该也是在中关村论坛谈了一天 , 说了一句话叫 , 呃 , 没卡没感情 , 谈卡伤感情 。
我觉得今天又又到了这个地步了 ,但情况又不一样了 。 就是你刚才讲的就是可能我们又到了这个推理的这个阶段 , 转向推理阶段 ,是因为需求真的在爆发 , 十倍百倍的爆发 。
刚才你也说过去十倍 ,其实需求是 100 倍 。
