AIAI智识录2026年7月17日· 12:53

Kimi K3 技术报告解读

本期节目解读月之暗面(Kimi)于7月16日发布的旗舰大模型 Kimi K3:全球首个突破三万亿量级并开源的模型,参数量达2.8万亿,官方坦言其整体实力仍落后 Claude Fable 5 与 GPT-5.6 Sol,但稳居开源第一梯队。技术上,K3 采用自研 KDA 增量注意力机制与注意力残差技术,配合896个专家(每次激活16个)的 MoE 架构,规模化效率较上一代 K2 提升2.5倍,并具备原生视觉能力和100万字上下文窗口。节目用大白话拆解了这些架构原理,并复盘官方实战案例:K3 在24小时内独立优化 GPU 算子,性能比肩 Opus 4.8 与 GPT-5.6 Sol;从零手搓出与行业标杆 Triton 打平的 MiniTriton 编译器;在48小时内基于45纳米工艺自主设计出一枚4平方毫米、含100多万个标准单元的微型 AI 芯片。科研场景中,它翻阅20多篇论文、敲下3000多行 Python 代码复现天体物理规律,甚至揪出人类论文中的公式错误,把研究员一两周的工作压缩到约2小时。配合 Kimi Work 平台,K3 能生成出版级交互报告、Widgets 小组件与 Dashboard 仪表盘、3Blue1Brown 风格科普动画,并自动完成视频剪辑;底层则采用 MXFP-4/MXFP-8 低精度格式与完全平衡的专家训练,官方建议企业用64张以上加速卡部署。主播同时坦承 K3 在交互体验上仍有不足,片尾介绍了赞助产品 UNAVI。

  1. 0:00K3 发布
  2. 2:27架构拆解
  3. 4:01长程编程
  4. 4:48GPU 算子优化
  5. 5:33手搓编译器
  6. 6:17芯片设计
  7. 7:00科研复现
  8. 7:55Kimi Work
  9. 9:25动画剪辑
  10. 10:14部署与开源
  11. 11:22总结反思
  12. 12:13结尾广告

PodHood 提供支持

文字稿

K3 发布0:00

Host0:00

Hello 大家好 , 今天咱们来聊一个刚出炉的大新闻 : 就在刚刚 , 月之暗面 ,也就是大家非常熟悉的 Kimi 团队 , 正式发布了他们家有史以来最强悍的大模型 , 名字叫 Kimi K3。

这次的发布可以用四个字来形容 : 大力出奇迹 。 官方给出的数据非常震撼 :Kimi K3 的参数量直接飙到了 2.8 万亿 , 这是个什么概念呢 ?

我们经常说 , 大模型的参数量就像是人类大脑里的神经元连接数 , 参数越大 , 模型肚子里装的墨水就越多 , 能处理的逻辑也就越复杂 。

而 K3 是目前全球第一个突破 3 万亿量级 ,并且还选择对外开源的模型 , 这绝对是开源界的一颗重磅炸弹 。

这台性能猛兽的底座技术 , 用了他们自研的叫做 KDA 机制和注意力残差技术 , 咱们后面会详细用大白话解释 。

除了参数大 , 它还有两个杀手锏 : 原生视觉能力和 100 万字的超长上下文窗口 。 原生视觉意味着它不是个只能读文字的书呆子 , 它长了眼睛 , 能直接看懂图片和视频 。

而 100 万字的上下文 , 就相当于你可以一口气把好几套 《 冰与火之歌 》 原著全塞给它 , 它不仅能记住 , 还能帮你分析得头头是道 。

官方给它的定位很明确 : 这是一个为了攻克长时间编程 、 复杂的脑力劳动 、 以及高难度逻辑推理而生的前沿智能体 。

那很多人肯定会问 : 既然这么强 , 它现在算是天下第一了吗 ?Kimi 官方这次非常坦诚 ,他们说如果拿来跟目前市面上最最顶尖的 、 不开源的闭源模型比 , 比如 Claude 加 、 最新的 Fable 5、 或者 OpenAI 加的 GPT-5.6 Sol K3, 整体上还是有差距的 。

咱们还得认 ,但是 ,在所有的前沿跑分测试里 ,K3 稳稳地站在了第一梯队 , 把除了那两个老大哥之外的其他所有测试过的模型全都甩在了身后 。

刚才咱们提到 ,K3 最大的标签是 " 首个 2.8 万亿级别的开源模型 "。 熟悉 Kimi 的朋友可能知道 ,在过去一年里 ,Kimi 团队简直就像是开源界的 " 卷王 "。

过去 12 个月里 ,有 9 个月的时间 , 都是 Kimi 加的模型在顶着开源模型尺寸的天花板 。 这次的 K3,不仅是这个拼搏过程的最新成果 , 更是把开源底线又猛地往上推了一大截 。

接下来咱们稍微硬核一点 , 用大白话拆解一下 :K3 的发动机到底更新了什么 ? 官方提到了两个很关键的技术 : 一个叫 KDA,也就是 Kimi 增量注意力机制 ; 另一个叫注意力残差 。

架构拆解2:27

Host2:40

听着特别学术 , 对吧 ? 你这么理解 : 以前的大模型处理长文章 , 就像是一个层层汇报的官僚机构 , 信息要从底层一层一层往上递 ,不仅慢 , 还容易 " 传话传丢了 "。

而 K3 现在的这套机制 , 就像是给公司搞了 " 扁平化管理 ", 信息不需要机械地一层层堆积 , 遇到需要的信息 , 高管可以直接跨过部门 , 去底层的档案库里精准抽取 。

这样一来 ,不管文章有多长 、 模型思考有多深 , 信息都能顺畅地流动 。 除此之外,K3 还在混合专家系统 ,也就是 MoE 技术上, 疯狂堆料 。

它总共有 896 个专家 , 每次处理一个问题的时候 , 它会非常精准地挑出 16 个 " 最对口 " 的专家来干活 。

这就好比你开了一家有将近 900 号顶级顾问的咨询公司 , 遇到一个具体案子 , 你不用让所有人都在那儿空转耗电 ,而是瞬间叫出最懂行的 16 个人, 开个会就把事办了 。

得益于这些架构的翻新 , 再加上训练方法的优化 ,K3 相比于上一代 K2,在规模化效率上足足提升了 2.5 倍 。

通俗点说 , 就是用同样多的电和算力 ,K3 能转化出比以前多 2 倍半的智商 。 说完了底座 , 咱们来看看 K3 到底能干啥 。

长程编程4:01

Host4:01

首先 , 它在长周期编程上强得离谱 。 什么叫长周期 ? 以前我们用 AI 写代码是你说一句 , 它写一段函数 。

而 K3 呢 , 它完全可以自己接管你的电脑终端 ,在没有你盯着的情况下, 像一个老练的资深程序员一样 , 自己去阅读那些极其庞大复杂的代码库 , 自己发现问题 , 自己运行测试 , 一口气连续工作好几个小时, 甚至好几天 。

而且因为它长了眼睛 , 它在把 " 写代码 " 和 " 看图 " 结合起来的任务上大放异彩 。 比如你想做个游戏 , 或者写个前端网页 , 甚至是搞工业画图的 CAD, 你只要把设计图或者游戏画面的截图丢给它 , 它就能自己看着画面去改代码 , 调整到完美为止 。

官方在这儿举了几个非常炸裂的实战案例 。 第一个案例是 " 优化 GPU 算子 "。 这其实是 AI 研发里最硬核 、 最底层的工作之一 。

GPU 算子优化4:48

Host4:59

官方给了 K3 一个沙盒环境 , 让它自己待在里面 , 花了 24 个小时, 独立对好几个极度复杂的底层算法进行了重写 、 优化和跑分 。

结果呢 ?K3 干出来的活儿 , 直接把原来非常出名的 Opus 4.8、GPT-5.6 Sol, 还有 GPT-5.5 按在地上摩擦 , 甚至能跟 Claude Fable 5 打得有来有回 。

更戏剧性的是 , 官方透露 ,在 K3 研发的后期 ,有一大半这种极其底层的优化工作 ,其实就是拿早期的 K3 自己去完成的 。

这就有点 " 我自己研发我自己 " 的科幻感了 。 第二个案例更是离谱 : 从头写一个 GPU 编译器 。 大家知道 , 编译器是把人类写的高级代码翻译给底层硬件听的翻译官 。K3 居然从零开始 , 手搓了一个叫做 MiniTriton 的编译器 。

手搓编译器5:33

Host5:49

它不是在修修补补 ,而是从最前端的语言设计 , 到中间的优化 , 再到最后生成给显卡跑的机器码 , 全链路包圆了 。

写出来之后一测 , 性能居然跟业内非常有名的行业标杆 Triton 编译器打平手 , 甚至在某些场景下还跑赢了 。

拿它来训练模型 , 曲线非常平稳 , 一点都没拉垮 。 这说明 K3 拥有了从零构建一套极其庞大且逻辑严密的系统的能力 。

但如果这还没吓到你 , 你听听第三个案例 : 游戏开发与数字制造 。 确切地说是 " 设计芯片 "。 是的 , 你没听错 ,K3 自己画了一块芯片 。

芯片设计6:17

Host6:29

官方仅仅给了它一个概念 , 让它设计一块能跑微型 AI 模型的芯片 。在 48 个小时的纯自主运行里 ,K3 调用了开源的电子设计工具 , 基于 45 纳米的工艺库 , 从头开始画图 、 布线 、 优化 、 验证 。

最终 , 它硬是设计出了一块只有 4 平方毫米大小 、 塞进了 100 多万个标准单元的芯片 。 而且在仿真测试里 , 这块芯片跑得飞快 : 一个 AI 模型为另一个 AI 模型画出了一张芯片图纸 。

这绝对是 K3 这种超长线思考能力的最完美体现 。 第四个案例 , 咱们跨界到科研领域 。 做科研最头疼的是什么 ?

科研复现7:00

Host7:10

看文献和写代码复现 。K3 现在能自动把复杂的学术论文变成可以直接运行的代码 。 比如官方让它去复现天体物理学里一个非常复杂的规律 ,K3 怎么干的呢 ?

它自己翻了 20 多篇枯燥的学术论文 , 互相交叉验证 , 然后徒手敲了 3000 多行 Python 代码 , 测算了 300 多种不同的状态 。

这还没完 , 它居然还在这过程中, 挑出了那些公开发表的人类论文里的公式错误 。 最后, 它还非常贴心地给你做了一个可以交互的网页仪表盘 , 让你直观地看结果 。

官方说 , 这活儿要是交给一个经验丰富的资深研究员 , 起码得没日没夜干上一两个礼拜 ,而 K3 只用了大约 2 个小时 。

Kimi Work7:55

Host7:55

说到那个交互网页仪表盘 , 这就引出了 K3 在它自家的 Kimi Work 平台上的另一个绝活 : 做 " 带交互的数据可视化报告 "。

比如它自己搜了 11000 多个网页 , 读了 80 多份财报和将近 100 份原版 PDF, 经历了 120 多次自己给自己挑毛病和修改 , 最终写出了一份涵盖 AI 芯片行业整整 42 年发展史的深度报告 。

这报告可不是干巴巴的文字 , 里面全是定制的图表 、 带动画的示意图 , 你还能点进去互动 。

再比如核聚变行业的咨询报告 , 里面的干特图 、 漏斗图 , 全都是直接能拿去给客户做路演的出版级别 。

还有针对几百次引力波事件的分析 ,K3 同时派出了 20 多个小号 ,也就是子智能体 , 一块儿并发干活 , 最后生成了详尽的科学图表和文献总结 。K3 真的非常非常擅长做那种极其精美的信息图表 、 热力图 , 全都是可以直接在 Kimi 里编辑的 。

为了让你更好地用这些功能 ,Kimi Work 这次推出了两个新东西 :Widgets( 小组件 ) 和 Dashboard( 仪表盘 )。 这有啥用呢 ?

以前咱们跟 AI 聊天 , 生成的图表或者代码滚过去就没了 。 现在 , 它可以在对话里直接给你生成一个活的小组件 。

如果你觉得好 , 可以直接钉在你的个人仪表盘上 。 这个仪表盘可以根据你的项目 、 你的目标持续更新数据 。

动画剪辑9:25

Host9:25

它让 AI 从一个 " 陪聊的 ", 变成了一个真的帮你监控业务的工作台 。此外,K3 还有一个出圈的技能 , 就是做动效 、 动画和视频剪辑 。

这得益于它从娘胎里带出来的原生多模态能力 : 它能在同一个脑子里同时理解文字 、 图片和视频 。

比如它模仿国外那个超火的 " 硬核数学科普频道 3Blue1Brown" 的风格 , 给自己做了一段科普动画 , 把你刚才听得头晕的底层架构 , 全都变成各种平滑过渡的几何动画讲给你听 。

又比如这次的发布会预告片 ,其实是它自己从 56 段零碎素材里挑出来的 。 它不仅能挑画面 , 还能跟着音乐的鼓点踩节拍 、 剪辑 , 甚至自己处理音频 , 来回改了好几版 。

如果是熟练的剪辑师 , 怎么也得干个一两天 , 新手得剪一个礼拜 , 它瞬间就搞定了 。 最后, 官方还给搞硬核技术的朋友留了一点基础设施的干货 : 这么大的模型 , 怎么跑起来呢 ?K3 从训练阶段开始 , 就用了一种叫 MXFP-4 和 MXFP-8 的极低精度数据格式 。

部署与开源10:14

Host10:38

这就像是让长跑运动员扔掉多余的负重 , 极大地兼容了各种硬件 。 为了防止刚才说的 "800 多个专家只有几个人忙死 ,其他人闲死 " 的问题 , 它们设计了一种完全平衡的专家训练方法 , 一点都不拖慢速度 。

官方建议 : 如果企业想自己部署 K3, 最好用 64 张以上加速卡组成的超级节点来跑 。 同时, 为了回馈社区 ,Kimi 团队还把 KDA 机制带来的一种全新的缓存技术 , 免费贡献给了开源社区 。

正是因为这些底层的极致抠门和优化 ,K3 才能在规模这么大 、 记忆力这么长的情况下, 依然把调用的 API 价格打到了一个极具竞争力的 " 白菜价 "。

最后总结一下 : 官方测试 K3 的这些成绩 , 都是把它的思考努力度拉满的情况下测出来的 。 官方也非常实在地在播客末尾做了一个自我批评 : 虽然 K3 的实力摆在这里 ,但在真实使用的体感上, 它确实还存在一些让人不那么顺手的小毛病 。

总结反思11:22

Host11:41

比如有时候它过于 " 积极主动 ",也就是细太多 ; 又或者它有时候太纠结于之前的思考历史 。在这一点上, 相比于体验极佳的 Claude Fable 5 和 GPT-5.6 Sol K3, 还有明显的追赶空间 。

不管怎么说 ,2.8 万亿参数的开源模型 、 自主设计芯片 、 手搓编译器 , 这绝对是今天 AI 圈最具里程碑意义的事件 。

未来这个模型还能玩出什么花样 , 我们拭目以待 。 以上就是 Kimi K3 发布博客的全部精华 , 希望能对你有所帮助 。

结尾广告12:13

Host12:13

好了 , 今天的分享就到这里 , 欢迎订阅 《AI 知识路 》, 获取最新鲜的 AI 领域最新知识 。 最后插播一个广告 : 主播自己的 AI 创业产品 UNAVI, 一个能一键整合你的飞书 、 钉钉 、 腾讯会议 、Claude 和其他录音卡 、 录音豆 , 随时随地帮您解读日常会议与沟通背后的深意 。

锁定关键信息的 Agent 应用已经正式上线 , 最新的版本也支持了直接给它播客链接 , 它就能轻松完成转写 、 总结 、 分析 , 甚至多个播客的关联解读和分析 。

如果你有兴趣 , 欢迎在本播客的公告栏查看体验方式 , 我们下期见 。