# Kimi K3 正式发布：2.8 万亿参数全开源，这次真的不一样

> 月之暗面发布 Kimi K3：2.8 万亿参数、全球首个开源 3T 级模型、100 万 token 上下文、原生多模态。本文深度解读 KDA 与 AttnRes 架构创新、Artificial Analysis 全球第四的评测成绩、对齐 Claude Sonnet 5 的定价信号，以及开源前沿模型对整个行业的四层长远影响。

- 作者: zhuermu
- 发布: 2026-07-17
- 网页版: https://zhuermu.com/blog/kimi-k3-release-deep-dive/

---
**史上最大开源模型 · 前沿智能 · 开源生态的分水岭时刻**

7 月 16 日，月之暗面（Moonshot AI）正式发布 Kimi K3——2.8 万亿参数，全球首个开源 3T 级模型，权重将在 7 月 27 日前全部放出。这篇文章不只聊参数和跑分，更想聊聊：把一个前沿级模型的权重直接开放出来，对整个行业意味着什么。

## 先说发生了什么

7 月 16 日周四，月之暗面上线了 Kimi K3，同步开放了 API 和开发者文档。官方博客的措辞很克制，但几个数字放在一起，分量不轻：

- **2.8 万亿总参数**：全球首个开源 3T 级模型，比 DeepSeek V4 Pro（约 1.6T）大 75%
- **100 万 token 上下文**：一整个大型代码库塞进去都够
- **原生多模态**：文本、图像、视频在同一个模型里处理，不是外挂视觉编码器
- **7 月 27 日前开源全部权重**：不是"阉割版"，是完整模型

发布时间点也很微妙——正好卡在 2026 上海世界人工智能大会（WAIC）之前。前一天 DeepSeek V4 刚刷完屏，这边 K3 直接跟上。中国开源模型的"军备竞赛"，已经卷到了以周为单位。

> 💡 官方博客里有一句挺有意思的话：过去 12 个月里，有 9 个月开源模型的"尺寸上限"是由 Kimi 系列保持的。K3 是这条路线的延续，也是目前的顶点。

## 技术上到底新在哪

2.8T 参数听起来吓人，但 K3 真正值得聊的不是"大"，而是它怎么把"大"变得可训练、可部署、可负担。

### 极致稀疏的 MoE：896 选 16

K3 用了 896 个专家的混合专家（MoE）架构，每个 token 只激活其中 16 个。说白了，虽然总参数 2.8T，但每次推理真正"干活"的只是一小部分。这个稀疏度在业界是相当激进的，为此月之暗面配套了 Stable LatentMoE 框架和一套叫 Quantile Balancing 的路由均衡方法，直接从路由分数的分位数推导专家分配，砍掉了一个特别难调的超参数。

### 两个架构杀手锏：KDA 和 AttnRes

**Kimi Delta Attention（KDA）** 负责让注意力在超长序列上跑得动——据 The Decoder 报道，KDA 让百万 token 上下文的解码速度最高提升 6.3 倍。**Attention Residuals（AttnRes）** 则改变了信息在模型深度方向的流动方式：不是逐层均匀累积，而是有选择地跨层检索表征。官方数据是训练效率提升约 25%，额外计算开销不到 2%。

这些加起来的结果：K3 相比 K2 的**整体 scaling 效率提升了约 2.5 倍**。同样的算力，换来更多的智能。这一点后面聊行业影响时还会再提。

### 为开源部署提前铺路

还有一个容易被忽略的细节：K3 从 SFT 阶段就开始做量化感知训练（QAT），用 MXFP4 权重加 MXFP8 激活。翻译一下：模型出厂就是为低精度推理设计的，硬件兼容性直接拉满。月之暗面还提前给 vLLM 社区贡献了 KDA 的 prefix cache 实现，会随模型一起发布。

> 🔍 这个动作值得细品：一般公司是"先发模型，社区自己想办法跑"。月之暗面是"发模型之前先把推理框架的适配代码写好"。开源不只是扔权重，是把整个可用性链路都准备好。当然，官方也说了，推荐用 64 卡以上的超节点部署——这个门槛对个人玩家还是太高了，K3 的开源红利主要属于企业和云厂商。

## 性能：离最强还差一点，但已经够吓人

先说官方自己的定调，这点我觉得月之暗面挺实诚：**K3 整体表现仍落后于 Claude Fable 5 和 GPT-5.6 Sol**，但在其余所有被测模型中稳定领先。

独立评测机构 Artificial Analysis 的结果也印证了这个说法。在它的智能指数上，K3 拿了 57 分，排全球第四：

| 模型 | 智能指数 | 是否开源 |
|------|---------|---------|
| Claude Fable 5 | 60 | 否 |
| GPT-5.6 Sol | 59 | 否 |
| **Kimi K3** | **57** | **是** |
| Claude Opus 4.8 | 56 | 否 |

注意这个排名的含义：**一个即将完全开源的模型，超过了 Anthropic 的 Opus 4.8**。开源和闭源最前沿之间的差距，从"代差"缩到了"半个身位"。

单项上更有看头。K3 在 Terminal Bench 2.1（88.3）、BrowseComp（91.2）、SWE Marathon（42.0）、OmniDocBench（91.1）等多个基准上直接做到了第一梯队甚至榜首。最出圈的是 Arena.ai 的前端代码竞技场——**K3 排名第一，把发布仅六周的 Claude Fable 5 挑落马下**。

![Kimi K3 编程基准测试对比](/images/blog/kimi-k3-release-deep-dive/benchmarks-coding.jpg)
*官方编程基准对比：K3 在 Terminal Bench、Program Bench、SWE Marathon 上领跑 | 图源：月之暗面官方博客*

> ✦ **Arena CEO 的原话**：Arena 首席执行官 Anastasios Angelopoulos 在 X 上说："这可能是年度最大的一次发布，标志着中国开源模型超越美国模型的时刻。在 Code Arena 上，Kimi K3 击败了 Fable——距离 Fable 发布仅仅六周。"前白宫 AI 政策顾问 Sriram Krishnan 也评价这是"一个大时刻，对整个行业有多重影响"。

在 agentic（智能体）任务上，进步幅度更夸张。GDPval v2 的 Elo 分从上一代 K2.6 的 1190 直接跳到 1668；长程知识工作评测 AA-Briefcase 上涨了 732 个 Elo 点。这不是"迭代"，这是"换代"。

![Kimi K3 通用智能体与视觉智能体基准对比](/images/blog/kimi-k3-release-deep-dive/benchmarks-agentic.jpg)
*通用/视觉智能体基准：K3 在 Automation Bench、BrowseComp、SpreadsheetBench 2 上排第一 | 图源：月之暗面官方博客*

## 它想干什么：不是聊天，是"长程干活"

从产品定位看，K3 瞄准的完全不是"聊天机器人"，而是**长时间自主工作的智能体**：读大型代码库、编排终端工具、在最少人工干预下持续推进任务。几个官方案例挺能说明问题：

- **48 小时自主设计芯片**：K3 用开源 EDA 工具在 Nangate 45nm 工艺库上，独立完成了一颗 AI 推理芯片的构建、优化和验证——4 平方毫米、146 万标准单元、仿真解码吞吐超 8700 tokens/s。官方的说法很妙："一颗由模型设计、为模型服务的芯片。"
- **从零写了个 GPU 编译器**：K3 开发的 MiniTriton，带自己的 IR 层、优化 pass 和 PTX 代码生成，在多个基准上追平甚至超过 Triton 和 torch.compile，还能撑住 nanoGPT 端到端训练。
- **2 小时复现天体物理研究**：交叉验证 20 多篇论文、评估 300 多个状态方程、写了 3000 多行 Python，复现 I-Love-Q 普适关系——这活儿一个有经验的研究员通常要干一到两周。

另一个关键词是 **"vision in the loop"**：K3 能看截图、改代码、再看结果，形成闭环。这让它在游戏开发、前端、CAD 这类"眼见为实"的场景里特别能打——前面说的 Code Arena 击败 Fable，靠的就是这个。

![Kimi K3 内部知识工作评测](/images/blog/kimi-k3-release-deep-dive/knowledge-work.jpg)
*官方内部知识工作评测：在线体验、幻灯片制作、金融分析三项 K3 均居首 | 图源：月之暗面官方博客*

## 定价：超便宜中国 AI 的时代，结束了

这可能是这次发布里最值得玩味的信号。K3 的 API 定价：输入 3 美元/百万 token（缓存命中 0.3 美元），输出 15 美元/百万 token。对比一下：

| 模型 | 输入 $/M | 输出 $/M |
|------|---------|---------|
| **Kimi K3** | **3.00** | **15.00** |
| Kimi K2.6（上一代） | 0.95 | 4.00 |
| Claude Sonnet 5 | 3.00 | 15.00 |
| GPT-5.6 Sol | 5.00 | 30.00 |
| Claude Fable 5 | 10.00 | 50.00 |

看出来了吗？K3 的定价**和 Claude Sonnet 5 一分不差**，比自家上一代贵了三倍多。The Decoder 给这个现象下了个判断：中国厂商也不再用地板价卖前沿模型了，"超便宜中国 AI 的时代"正在结束。

但换个角度看，这个定价其实很聪明。按 Artificial Analysis 的测算，K3 每任务成本约 0.94 美元，和 GPT-5.6 Sol（1.04 美元）基本持平，只有 Opus 4.8（1.80 美元）的一半——**用中端的价格，卖准前沿的能力**。而且 K3 的 token 效率也提升了：完成同样的评测，输出 token 比 K2.6 少 21%，分数反而高 13 分。

![Artificial Analysis 每任务成本与智能-成本散点图](/images/blog/kimi-k3-release-deep-dive/cost-analysis.jpg)
*每任务成本对比与"智能 vs 成本"散点图：K3 落在准前沿智能、中端价格的位置 | 图源：Artificial Analysis*

> ⚠️ 提醒一句：K3 定价"不分上下文长度"，一百万 token 的超长上下文也是这个价。再加上官方 API 在编码场景下缓存命中率超过 90%（背后是 Mooncake 分离式推理架构），实际用起来的成本可能比表价低不少。做 agent 应用的同学可以重点算算这笔账。

## 开源 3T 级模型，长远看意味着什么

好，重头戏来了。参数、跑分、价格都是"当下"，但把 2.8T 权重放出来这件事，影响是"长期"的。我想分四层来说。

### 第一层：前沿能力不再是少数公司的专属

过去两年，行业里有一条默认的鄙视链：最强的模型永远是闭源的，开源模型能追到"上一代闭源水平"就算胜利。K3 把这条线打破了——它在智能指数上压过了 Opus 4.8，在前端代码上击败了当打之年的 Fable 5，然后说：**十天后，权重归大家**。

这意味着任何有算力的机构——大学实验室、主权 AI 项目、对数据合规有硬要求的银行和医院——都可以在自己的机房里跑一个准前沿模型，不用把数据交给任何一家 API 厂商。对闭源厂商来说，"能力领先"这个护城河的折旧速度，从按年计变成了按月计。Fable 5 领先了六周，就在一个单项上被追平了。

### 第二层：研究生态拿到了一份"前沿模型解剖图"

KDA、AttnRes、Stable LatentMoE、Quantile Balancing、Per-Head Muon……这些不只是营销名词，它们随权重和技术报告开放之后，会变成全世界研究者可以复现、魔改、证伪的对象。DeepSeek 当年开源 MLA 和 GRPO 之后，多少论文和后续模型直接站在了它的肩膀上？K3 这套"如何把 MoE 撑到 3T 而不训崩"的完整工程答案，价值可能比模型本身还大。

而且别忘了那个细节：月之暗面提前把 KDA 的 prefix cache 实现贡献给了 vLLM。开源基础设施（vLLM、SGLang 这些）每接住一个新架构，整个社区消化下一个新架构的速度就更快。这是复利。

### 第三层：又一个"DeepSeek 时刻"？地缘牌桌重新洗牌

很多外媒把 K3 和 2025 年初的 DeepSeek R1 相提并论。当年 R1 发布后美股科技板块一度蒸发约万亿美元市值，白宫因此收紧对华技术出口。这次 K3 发布，SiliconANGLE 的判断是："美国 AI 公司领先中国同行几个月"这个共识，已经站不住脚了。

更微妙的是背景：几个月前 Anthropic 刚指控过月之暗面、DeepSeek 和 MiniMax 违规"蒸馏"Claude 的能力。K3 发布后，围绕蒸馏、出口管制、开源模型安全审查的争论大概率会再起一轮。但有一个事实很难反驳——**在算力受限的条件下，中国团队正在用架构创新和工程效率把差距补回来**。K3 相比 K2 那个 2.5 倍的 scaling 效率提升，就是最直接的证据。

### 第四层：开源的商业模式正在自证

"都开源了还怎么赚钱？"K3 给了一个越来越清晰的答案：权重开放，但官方 API 靠 Mooncake 推理架构做到 90% 以上的缓存命中率，成本和体验别人短期抄不走；上层还有 Kimi Work、Kimi Code、Kimi Enterprise 企业版和托管 Agent 平台。**模型开源引流建生态，基础设施和产品收钱**——这套打法跟当年的 Linux/Red Hat 越来越像了。

## 给同行的四点思考

不管你是做模型的、做应用的，还是在大厂里做 AI 战略的，K3 这次发布有几个信号值得认真想想。

> ✦ **思考一：卷参数的前提是先卷架构**。K3 敢上 2.8T，不是因为算力多，而是因为 KDA + AttnRes + 极稀疏 MoE 把单位算力的产出提高了 2.5 倍。反过来说：没有架构和训练方法的突破，堆参数只是烧钱。"Scaling 没死，但裸奔的 Scaling 死了。"

> ✦ **思考二：模型竞争的主战场已经换到"长程 Agent"**。K3 的所有肌肉展示——48 小时设计芯片、从零写编译器、两小时复现科研——全都是"长时间自主干活"。聊天体验的差异化空间越来越小，谁能让模型独立、可靠地跑完一个几天的工程任务，谁才有下一轮的定价权。做应用的同学，护城河也要往这个方向重新想。

> ✦ **思考三：开源不是慈善，是战略武器**。对追赶者来说，开源是最锋利的进攻手段：用免费权重瓦解领先者的 API 溢价，用生态占领换取标准制定权。Meta 当年用 Llama 打过这张牌，现在轮到中国公司把这张牌打到前沿级别。如果你是闭源阵营的，就得回答一个难题：当"够好的开源"只落后你半个身位、价格还打三折时，客户为什么留下？答案只能在模型之外——工具链、可靠性、合规、服务。

> ✦ **思考四：低价内卷正在退潮，价值定价回归**。K3 定价对齐 Claude Sonnet 5、较上一代涨三倍，说明头部中国厂商不打价格战了——能力到了，就按能力收钱。对下游应用公司，这是个提醒：把"模型便宜"当商业模式的窗口正在关闭，真正的成本优化要靠缓存、token 效率、任务编排这些工程能力。

## 冷静一下：它不是没有短板

吹完了，也得泼点冷水。有几个问题官方和第三方都摆在了台面上：

- **幻觉率不降反升**：Artificial Analysis 测出 K3 的幻觉率从上一代的 39% 涨到了 51%——答对的更多了，但瞎编的也更多了。对严肃场景，这是硬伤，必须靠工程手段兜底。
- **"过度主动"**：官方自己承认，K3 遇到模糊指令时爱替用户做决定。做严肃业务的 agent，得在系统提示里给它上紧箍咒。
- **对思考历史敏感**：K3 要求 harness 完整回传历史思考内容，中途从别的模型切过来会不稳定。生态适配需要时间。
- **综合体验仍有差距**：官方原话——与 Claude Fable 5 和 GPT-5.6 Sol 相比，用户体验上仍有"可感知的差距"。
- **部署门槛极高**：推荐 64 卡以上超节点。"开源"不等于"人人可用"，普通开发者短期内还是得走 API 或云厂商。

## 写在最后

K3 不是"最强模型"，官方自己都没这么说。但它可能是**最重要的一次开源发布**：它证明了开源模型可以站到前沿俱乐部的门口，证明了架构效率能对冲算力劣势，也宣告了开源 AI 从"平替"走向"正面竞争"的时代。

7 月 27 日权重放出之后，真正的故事才开始：谁来接住这 2.8T 参数？会长出什么样的微调模型、蒸馏模型、行业模型？闭源巨头会用降价还是加速迭代来回应？这些问题的答案，会比任何一张跑分表都更能定义 2026 下半年的 AI 行业。

技术报告发布后，我会跟进一篇 KDA 和 AttnRes 的架构详解。感兴趣的话，别走远。

---

*文中性能数据以官方博客与第三方评测发布时点为准，部分基准由不同 harness 测得，横向对比请留意口径差异。*

---

**把这些数字放到自己的用量上**：K3 的定价和跑分可以在[模型对比](/tools/model-comparison/)里
和其他模型并排看，月度花费用 [LLM 成本计算器](/tools/llm-cost-calculator/) 估。
1M 上下文听起来很大，但真正决定成本的是你每次实际塞进去多少——先用
[Token 计数器](/tools/token-counter/)量一下自己的典型输入。

---

## 常见问题

### Kimi K3 是什么？有多大？

Kimi K3 是月之暗面（Moonshot AI）于 2026 年 7 月 16 日发布的大模型：2.8 万亿总参数，全球首个开源 3T 级模型，支持 100 万 token 上下文和原生多模态，全部权重将在 7 月 27 日前开源。

### Kimi K3 的性能处于什么水平？

在 Artificial Analysis 智能指数上 K3 得 57 分，排全球第四，仅次于 Claude Fable 5（60）和 GPT-5.6 Sol（59），超过了 Claude Opus 4.8（56）。在 Arena.ai 前端代码竞技场上排名第一，击败了发布仅六周的 Claude Fable 5。

### Kimi K3 的 API 定价是多少？

输入 3 美元/百万 token（缓存命中 0.3 美元），输出 15 美元/百万 token，与 Claude Sonnet 5 完全一致，是上一代 K2.6 的三倍多。定价不分上下文长度，编码场景官方缓存命中率超过 90%。

### 普通开发者能本地部署 Kimi K3 吗？

门槛很高：官方推荐 64 卡以上的超节点部署。K3 从 SFT 阶段就做了量化感知训练（MXFP4 权重 + MXFP8 激活），并提前向 vLLM 贡献了 KDA 的 prefix cache 实现，但开源红利短期内主要属于企业和云厂商。


---

## 参考资料

- [Kimi K3: Open Frontier Intelligence](https://kimi.com/blog/kimi-k3) — Moonshot AI 官方博客
- [China's Moonshot throws down the gauntlet with Kimi K3](https://siliconangle.com/) — SiliconANGLE
- [Kimi's open model K3 nears GPT-5.6 Sol and Fable 5](https://the-decoder.com/) — The Decoder
- [Artificial Analysis Intelligence Index](https://artificialanalysis.ai/) — Artificial Analysis
