# Kimi K3 技术报告解读

AI智识录 · 2026-07-17

<https://ai.podhood.com/ababcb10-a957-477d-9ac8-392c3a2b95f5>

本期节目解读月之暗面（Kimi）于7月16日发布的旗舰大模型 Kimi K3：全球首个突破三万亿量级并开源的模型，参数量达2.8万亿，官方坦言其整体实力仍落后 Claude Fable 5 与 GPT-5.6 Sol，但稳居开源第一梯队。技术上，K3 采用自研 KDA 增量注意力机制与注意力残差技术，配合896个专家（每次激活16个）的 MoE 架构，规模化效率较上一代 K2 提升2.5倍，并具备原生视觉能力和100万字上下文窗口。节目用大白话拆解了这些架构原理，并复盘官方实战案例：K3 在24小时内独立优化 GPU 算子，性能比肩 Opus 4.8 与 GPT-5.6 Sol；从零手搓出与行业标杆 Triton 打平的 MiniTriton 编译器；在48小时内基于45纳米工艺自主设计出一枚4平方毫米、含100多万个标准单元的微型 AI 芯片。科研场景中，它翻阅20多篇论文、敲下3000多行 Python 代码复现天体物理规律，甚至揪出人类论文中的公式错误，把研究员一两周的工作压缩到约2小时。配合 Kimi Work 平台，K3 能生成出版级交互报告、Widgets 小组件与 Dashboard 仪表盘、3Blue1Brown 风格科普动画，并自动完成视频剪辑；底层则采用 MXFP-4/MXFP-8 低精度格式与完全平衡的专家训练，官方建议企业用64张以上加速卡部署。主播同时坦承 K3 在交互体验上仍有不足，片尾介绍了赞助产品 UNAVI。

## Questions this episode answers

### Kimi K3 的参数量有多大？它在开源模型中处于什么地位？

主播介绍，Kimi K3 参数量达 2.8 万亿，是全球第一个突破 3 万亿量级并选择开源的模型。官方坦诚其整体实力仍落后于 Claude Fable 5 和 GPT-5.6 Sol 等顶尖闭源模型，但在所有前沿跑分测试中稳居第一梯队，把其他模型全部甩在身后。

[0:14](https://ai.podhood.com/ababcb10-a957-477d-9ac8-392c3a2b95f5?t=14000)

### K3 的 KDA 增量注意力机制是什么原理？

主播用大白话解释：以前的大模型处理长文章像层层汇报的官僚机构，信息逐层上传，慢且容易传丢。KDA 相当于给公司搞扁平化管理，遇到需要的信息，高管可以直接跨过部门，到底层档案库精准抽取，让信息在长文和深度思考中顺畅流动。

[2:40](https://ai.podhood.com/ababcb10-a957-477d-9ac8-392c3a2b95f5?t=160000)

### K3 自主设计芯片是怎么回事？

主播讲道，官方只给 K3 一个设计能跑微型 AI 模型芯片的概念，它在 48 小时纯自主运行中调用开源电子设计工具，基于 45 纳米工艺库从头画图、布线、优化、验证，最终设计出仅 4 平方毫米、塞进 100 多万个标准单元的芯片，仿真测试跑得飞快。

[6:29](https://ai.podhood.com/ababcb10-a957-477d-9ac8-392c3a2b95f5?t=389000)

### K3 在科研复现论文方面表现如何？

主播介绍，官方让 K3 复现天体物理学里一个复杂规律，它自己翻了 20 多篇学术论文交叉验证，徒手敲了 3000 多行 Python 代码，测算 300 多种不同状态，还挑出了公开人类论文里的公式错误，并做了可交互网页仪表盘，全程只花约 2 个小时。

[7:23](https://ai.podhood.com/ababcb10-a957-477d-9ac8-392c3a2b95f5?t=443000)

## Key moments

- **[0:00] K3 发布**
  - [0:00] 月之暗面发布 Kimi K3：2.8 万亿参数，全球首个突破三万亿量级并开源的模型
  - [0:45] Kimi K3 配备原生视觉能力和 100 万字超长上下文，定位为攻克长程编程与高难推理的前沿智能体
  - [1:58] Kimi 官方坦诚：K3 整体仍落后 Claude Fable 5 和 GPT-5.6 Sol，但稳居开源第一梯队
- **[2:27] 架构拆解**
  - [2:40] KDA 增量注意力与注意力残差：K3 用「扁平化管理」解决长文信息层层传递丢失的问题
- **[4:01] 长程编程**
  - [4:01] 896 个专家的 MoE 架构加训练优化，让 K3 相比 K2 规模化效率提升 2.5 倍
- **[4:48] GPU 算子优化**
  - [4:48] K3 用 24 小时独立优化底层 GPU 算子，跑分碾压 Opus 4.8 和 GPT-5.6 Sol，且 K3 后期研发大半靠早期 K3 自己完成
- **[5:33] 手搓编译器**
  - [5:33] K3 从零手搓 MiniTriton 编译器，全链路覆盖，性能与行业标杆 Triton 打平甚至部分场景反超
- **[6:17] 芯片设计**
  - [6:17] K3 在 48 小时内自主设计出一枚 4 平方毫米、含 100 多万个标准单元的微型 AI 芯片，仿真验证全链路闭环
- **[7:00] 科研复现**
  - [7:10] K3 翻 20 多篇论文、敲 3000 行 Python 复现天体物理规律，还揪出人类已发表论文中的公式错误，全程仅约 2 小时
- **[7:55] Kimi Work**
  - [7:55] Kimi Work 新推 Widgets 小组件和 Dashboard 仪表盘，让 AI 从陪聊变成持续监控业务的工作台
  - [9:05] K3 凭原生多模态模仿 3Blue1Brown 风格做科普动画，还能踩着音乐鼓点自动剪辑发布会预告片
- **[9:25] 动画剪辑**
- **[10:14] 部署与开源**
  - [10:14] K3 采用 MXFP-4/MXFP-8 低精度格式训练，官方建议企业用 64 张以上加速卡部署，API 价格打到白菜价
- **[11:22] 总结反思**
  - [11:22] Kimi 官方自我批评：K3 有时过于主动、纠结思考历史，交互体验仍明显落后 Claude Fable 5 和 GPT-5.6 Sol
- **[12:13] 结尾广告**

## Topics

AI开源与Agent生态, 自动化AI研究

## Mentioned

月之暗面 (company), Claude Fable (product), GPT-5.6 Sol (product), Kimi K3 (product), Kimi Work (product), MiniTriton (product), Triton (product)

## Transcript

### K3 发布

**Host** [0:00]
Hello 大家好 ， 今天咱们来聊一个刚出炉的大新闻 ： 就在刚刚 ， 月之暗面 ，也就是大家非常熟悉的 Kimi 团队 ， 正式发布了他们家有史以来最强悍的大模型 ， 名字叫 Kimi K3。

这次的发布可以用四个字来形容 ： 大力出奇迹 。 官方给出的数据非常震撼 ：Kimi K3 的参数量直接飙到了 2.8 万亿 ， 这是个什么概念呢 ？

我们经常说 ， 大模型的参数量就像是人类大脑里的神经元连接数 ， 参数越大 ， 模型肚子里装的墨水就越多 ， 能处理的逻辑也就越复杂 。

而 K3 是目前全球第一个突破 3 万亿量级 ，并且还选择对外开源的模型 ， 这绝对是开源界的一颗重磅炸弹 。

这台性能猛兽的底座技术 ， 用了他们自研的叫做 KDA 机制和注意力残差技术 ， 咱们后面会详细用大白话解释 。

除了参数大 ， 它还有两个杀手锏 ： 原生视觉能力和 100 万字的超长上下文窗口 。 原生视觉意味着它不是个只能读文字的书呆子 ， 它长了眼睛 ， 能直接看懂图片和视频 。

而 100 万字的上下文 ， 就相当于你可以一口气把好几套 《 冰与火之歌 》 原著全塞给它 ， 它不仅能记住 ， 还能帮你分析得头头是道 。

官方给它的定位很明确 ： 这是一个为了攻克长时间编程 、 复杂的脑力劳动 、 以及高难度逻辑推理而生的前沿智能体 。

那很多人肯定会问 ： 既然这么强 ， 它现在算是天下第一了吗 ？Kimi 官方这次非常坦诚 ，他们说如果拿来跟目前市面上最最顶尖的 、 不开源的闭源模型比 ， 比如 Claude 加 、 最新的 Fable 5、 或者 OpenAI 加的 GPT-5.6 Sol K3， 整体上还是有差距的 。

咱们还得认 ，但是 ，在所有的前沿跑分测试里 ，K3 稳稳地站在了第一梯队 ， 把除了那两个老大哥之外的其他所有测试过的模型全都甩在了身后 。

刚才咱们提到 ，K3 最大的标签是 " 首个 2.8 万亿级别的开源模型 "。 熟悉 Kimi 的朋友可能知道 ，在过去一年里 ，Kimi 团队简直就像是开源界的 " 卷王 "。

过去 12 个月里 ，有 9 个月的时间 ， 都是 Kimi 加的模型在顶着开源模型尺寸的天花板 。 这次的 K3，不仅是这个拼搏过程的最新成果 ， 更是把开源底线又猛地往上推了一大截 。

接下来咱们稍微硬核一点 ， 用大白话拆解一下 ：K3 的发动机到底更新了什么 ？ 官方提到了两个很关键的技术 ： 一个叫 KDA，也就是 Kimi 增量注意力机制 ； 另一个叫注意力残差 。

### 架构拆解

**Host** [2:40]
听着特别学术 ， 对吧 ？ 你这么理解 ： 以前的大模型处理长文章 ， 就像是一个层层汇报的官僚机构 ， 信息要从底层一层一层往上递 ，不仅慢 ， 还容易 " 传话传丢了 "。

而 K3 现在的这套机制 ， 就像是给公司搞了 " 扁平化管理 "， 信息不需要机械地一层层堆积 ， 遇到需要的信息 ， 高管可以直接跨过部门 ， 去底层的档案库里精准抽取 。

这样一来 ，不管文章有多长 、 模型思考有多深 ， 信息都能顺畅地流动 。 除此之外，K3 还在混合专家系统 ，也就是 MoE 技术上， 疯狂堆料 。

它总共有 896 个专家 ， 每次处理一个问题的时候 ， 它会非常精准地挑出 16 个 " 最对口 " 的专家来干活 。

这就好比你开了一家有将近 900 号顶级顾问的咨询公司 ， 遇到一个具体案子 ， 你不用让所有人都在那儿空转耗电 ，而是瞬间叫出最懂行的 16 个人， 开个会就把事办了 。

得益于这些架构的翻新 ， 再加上训练方法的优化 ，K3 相比于上一代 K2，在规模化效率上足足提升了 2.5 倍 。

通俗点说 ， 就是用同样多的电和算力 ，K3 能转化出比以前多 2 倍半的智商 。 说完了底座 ， 咱们来看看 K3 到底能干啥 。

### 长程编程

**Host** [4:01]
首先 ， 它在长周期编程上强得离谱 。 什么叫长周期 ？ 以前我们用 AI 写代码是你说一句 ， 它写一段函数 。

而 K3 呢 ， 它完全可以自己接管你的电脑终端 ，在没有你盯着的情况下， 像一个老练的资深程序员一样 ， 自己去阅读那些极其庞大复杂的代码库 ， 自己发现问题 ， 自己运行测试 ， 一口气连续工作好几个小时， 甚至好几天 。

而且因为它长了眼睛 ， 它在把 " 写代码 " 和 " 看图 " 结合起来的任务上大放异彩 。 比如你想做个游戏 ， 或者写个前端网页 ， 甚至是搞工业画图的 CAD， 你只要把设计图或者游戏画面的截图丢给它 ， 它就能自己看着画面去改代码 ， 调整到完美为止 。

官方在这儿举了几个非常炸裂的实战案例 。 第一个案例是 " 优化 GPU 算子 "。 这其实是 AI 研发里最硬核 、 最底层的工作之一 。

### GPU 算子优化

**Host** [4:59]
官方给了 K3 一个沙盒环境 ， 让它自己待在里面 ， 花了 24 个小时， 独立对好几个极度复杂的底层算法进行了重写 、 优化和跑分 。

结果呢 ？K3 干出来的活儿 ， 直接把原来非常出名的 Opus 4.8、GPT-5.6 Sol， 还有 GPT-5.5 按在地上摩擦 ， 甚至能跟 Claude Fable 5 打得有来有回 。

更戏剧性的是 ， 官方透露 ，在 K3 研发的后期 ，有一大半这种极其底层的优化工作 ，其实就是拿早期的 K3 自己去完成的 。

这就有点 " 我自己研发我自己 " 的科幻感了 。 第二个案例更是离谱 ： 从头写一个 GPU 编译器 。 大家知道 ， 编译器是把人类写的高级代码翻译给底层硬件听的翻译官 。K3 居然从零开始 ， 手搓了一个叫做 MiniTriton 的编译器 。

### 手搓编译器

**Host** [5:49]
它不是在修修补补 ，而是从最前端的语言设计 ， 到中间的优化 ， 再到最后生成给显卡跑的机器码 ， 全链路包圆了 。

写出来之后一测 ， 性能居然跟业内非常有名的行业标杆 Triton 编译器打平手 ， 甚至在某些场景下还跑赢了 。

拿它来训练模型 ， 曲线非常平稳 ， 一点都没拉垮 。 这说明 K3 拥有了从零构建一套极其庞大且逻辑严密的系统的能力 。

但如果这还没吓到你 ， 你听听第三个案例 ： 游戏开发与数字制造 。 确切地说是 " 设计芯片 "。 是的 ， 你没听错 ，K3 自己画了一块芯片 。

### 芯片设计

**Host** [6:29]
官方仅仅给了它一个概念 ， 让它设计一块能跑微型 AI 模型的芯片 。在 48 个小时的纯自主运行里 ，K3 调用了开源的电子设计工具 ， 基于 45 纳米的工艺库 ， 从头开始画图 、 布线 、 优化 、 验证 。

最终 ， 它硬是设计出了一块只有 4 平方毫米大小 、 塞进了 100 多万个标准单元的芯片 。 而且在仿真测试里 ， 这块芯片跑得飞快 ： 一个 AI 模型为另一个 AI 模型画出了一张芯片图纸 。

这绝对是 K3 这种超长线思考能力的最完美体现 。 第四个案例 ， 咱们跨界到科研领域 。 做科研最头疼的是什么 ？

### 科研复现

**Host** [7:10]
看文献和写代码复现 。K3 现在能自动把复杂的学术论文变成可以直接运行的代码 。 比如官方让它去复现天体物理学里一个非常复杂的规律 ，K3 怎么干的呢 ？

它自己翻了 20 多篇枯燥的学术论文 ， 互相交叉验证 ， 然后徒手敲了 3000 多行 Python 代码 ， 测算了 300 多种不同的状态 。

这还没完 ， 它居然还在这过程中， 挑出了那些公开发表的人类论文里的公式错误 。 最后， 它还非常贴心地给你做了一个可以交互的网页仪表盘 ， 让你直观地看结果 。

官方说 ， 这活儿要是交给一个经验丰富的资深研究员 ， 起码得没日没夜干上一两个礼拜 ，而 K3 只用了大约 2 个小时 。

### Kimi Work

**Host** [7:55]
说到那个交互网页仪表盘 ， 这就引出了 K3 在它自家的 Kimi Work 平台上的另一个绝活 ： 做 " 带交互的数据可视化报告 "。

比如它自己搜了 11000 多个网页 ， 读了 80 多份财报和将近 100 份原版 PDF， 经历了 120 多次自己给自己挑毛病和修改 ， 最终写出了一份涵盖 AI 芯片行业整整 42 年发展史的深度报告 。

这报告可不是干巴巴的文字 ， 里面全是定制的图表 、 带动画的示意图 ， 你还能点进去互动 。

再比如核聚变行业的咨询报告 ， 里面的干特图 、 漏斗图 ， 全都是直接能拿去给客户做路演的出版级别 。

还有针对几百次引力波事件的分析 ，K3 同时派出了 20 多个小号 ，也就是子智能体 ， 一块儿并发干活 ， 最后生成了详尽的科学图表和文献总结 。K3 真的非常非常擅长做那种极其精美的信息图表 、 热力图 ， 全都是可以直接在 Kimi 里编辑的 。

为了让你更好地用这些功能 ，Kimi Work 这次推出了两个新东西 ：Widgets（ 小组件 ） 和 Dashboard（ 仪表盘 ）。 这有啥用呢 ？

以前咱们跟 AI 聊天 ， 生成的图表或者代码滚过去就没了 。 现在 ， 它可以在对话里直接给你生成一个活的小组件 。

如果你觉得好 ， 可以直接钉在你的个人仪表盘上 。 这个仪表盘可以根据你的项目 、 你的目标持续更新数据 。

### 动画剪辑

**Host** [9:25]
它让 AI 从一个 " 陪聊的 "， 变成了一个真的帮你监控业务的工作台 。此外，K3 还有一个出圈的技能 ， 就是做动效 、 动画和视频剪辑 。

这得益于它从娘胎里带出来的原生多模态能力 ： 它能在同一个脑子里同时理解文字 、 图片和视频 。

比如它模仿国外那个超火的 " 硬核数学科普频道 3Blue1Brown" 的风格 ， 给自己做了一段科普动画 ， 把你刚才听得头晕的底层架构 ， 全都变成各种平滑过渡的几何动画讲给你听 。

又比如这次的发布会预告片 ，其实是它自己从 56 段零碎素材里挑出来的 。 它不仅能挑画面 ， 还能跟着音乐的鼓点踩节拍 、 剪辑 ， 甚至自己处理音频 ， 来回改了好几版 。

如果是熟练的剪辑师 ， 怎么也得干个一两天 ， 新手得剪一个礼拜 ， 它瞬间就搞定了 。 最后， 官方还给搞硬核技术的朋友留了一点基础设施的干货 ： 这么大的模型 ， 怎么跑起来呢 ？K3 从训练阶段开始 ， 就用了一种叫 MXFP-4 和 MXFP-8 的极低精度数据格式 。

### 部署与开源

**Host** [10:38]
这就像是让长跑运动员扔掉多余的负重 ， 极大地兼容了各种硬件 。 为了防止刚才说的 "800 多个专家只有几个人忙死 ，其他人闲死 " 的问题 ， 它们设计了一种完全平衡的专家训练方法 ， 一点都不拖慢速度 。

官方建议 ： 如果企业想自己部署 K3， 最好用 64 张以上加速卡组成的超级节点来跑 。 同时， 为了回馈社区 ，Kimi 团队还把 KDA 机制带来的一种全新的缓存技术 ， 免费贡献给了开源社区 。

正是因为这些底层的极致抠门和优化 ，K3 才能在规模这么大 、 记忆力这么长的情况下， 依然把调用的 API 价格打到了一个极具竞争力的 " 白菜价 "。

最后总结一下 ： 官方测试 K3 的这些成绩 ， 都是把它的思考努力度拉满的情况下测出来的 。 官方也非常实在地在播客末尾做了一个自我批评 ： 虽然 K3 的实力摆在这里 ，但在真实使用的体感上， 它确实还存在一些让人不那么顺手的小毛病 。

### 总结反思

**Host** [11:41]
比如有时候它过于 " 积极主动 "，也就是细太多 ； 又或者它有时候太纠结于之前的思考历史 。在这一点上， 相比于体验极佳的 Claude Fable 5 和 GPT-5.6 Sol K3， 还有明显的追赶空间 。

不管怎么说 ，2.8 万亿参数的开源模型 、 自主设计芯片 、 手搓编译器 ， 这绝对是今天 AI 圈最具里程碑意义的事件 。

未来这个模型还能玩出什么花样 ， 我们拭目以待 。 以上就是 Kimi K3 发布博客的全部精华 ， 希望能对你有所帮助 。

### 结尾广告

**Host** [12:13]
好了 ， 今天的分享就到这里 ， 欢迎订阅 《AI 知识路 》， 获取最新鲜的 AI 领域最新知识 。 最后插播一个广告 ： 主播自己的 AI 创业产品 UNAVI， 一个能一键整合你的飞书 、 钉钉 、 腾讯会议 、Claude 和其他录音卡 、 录音豆 ， 随时随地帮您解读日常会议与沟通背后的深意 。

锁定关键信息的 Agent 应用已经正式上线 ， 最新的版本也支持了直接给它播客链接 ， 它就能轻松完成转写 、 总结 、 分析 ， 甚至多个播客的关联解读和分析 。

如果你有兴趣 ， 欢迎在本播客的公告栏查看体验方式 ， 我们下期见 。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
