Kimi K3
月之暗面 Kimi K3 · Moonshot AI 月之暗面 · 发布 2026-07-16 · 当前代
2.8T 参数的开源多模态 agent 旗舰,LMArena 开源第一。
- 类型
- Hybrid(线性 + 全注意力)
- 注意力
- KDA 线性注意力 69 层 + Gated MLA 24 层(96 头)
- 层数
- 93
- 专家
- 896 · 激活 16 + 共享
- 隐藏维
- 7168
- 词表
- 163,840
首个开源 3T 级模型。93 层(1 层 Dense)中 69 层为 Kimi Delta Attention(线性,固定状态),24 层为带输出门的 MLA(kv_lora 512 + RoPE 64,按「1 KV 头 × 288」等价表示)。Attention Residuals(AttnRes)、SiTU-GLU 激活、Latent MoE(潜维 3584);2 个共享专家。原生 MXFP4 权重 / MXFP8 激活 QAT。视觉编码器 MoonViT-V2(401M)。
类型:混合线性注意力 MoE,2.8T 总 / 104B 激活。
- 93 层(含 1 层 Dense):69 层 Kimi Delta Attention(KDA) + 24 层 Gated MLA,每 3 层 KDA 接 1 层 MLA
- 隐藏维 7168,96 注意力头,词表 163,840
- 专家:896 路由 + 2 共享,每 token 激活 16 个;Latent MoE(潜维 3584),专家中间维 3072
- MLA:kv_lora 512,qk_nope 128 + RoPE 64,v_head 128,带输出门(mla_use_output_gate)
- KDA:head_dim 128,短卷积核 4,full-rank gate
- Attention Residuals(AttnRes):每 12 层一个注意力残差块
- 激活:SiTU-GLU
- 上下文 1,048,576
- 视觉:MoonViT-V2(401M),patch 14,2×2 merge
- 原生 MXFP4:从 SFT 阶段起做 QAT,权重 MXFP4 / 激活 MXFP8
参考:Kimi K3 技术报告(GitHub)。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | — | 暂无 |
| FP8 | 2820 GB | |
| Q8 | — | 暂无 |
| Q4 | 1561 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 不可行
- 单卡 80GB
- 不可行
- 8×80GB 节点
- MXFP4 权重 1,561 GB 已超单节点 8×H200(1,128 GB),需 16×H200 / 16×H100 双节点或 8×B300 级
KV Cache:仅 24 层 MLA 存 per-token KV:576 × 2 B × 24 ≈ 27 KiB/token;69 层 KDA 为固定状态(每层 96 头 × 128 × 128 × 2 B ≈ 3 MiB,每请求约 207 MiB 常量)。 ≈ 27 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 参考显存 |
|---|---|---|
| MXFP4(原生) | 1,561 GB(官方文件) | 16×H200 |
无 BF16 发布版本(MXFP4 即官方精度)。
KV Cache:≈ 27 KiB/token(仅 24 层 MLA)+ 每请求约 207 MiB KDA 固定状态。1M 上下文单请求 KV ≈ 27 GB,比 GLM-5.2 小 3 倍。
参考配置:
- 24GB / 80GB / 单节点 8×H100:不可行
- 8×H200 141GB(1,128 GB):权重放不下
- 16×H200 双节点:可服务;官方部署指南基于 vLLM / SGLang / TokenSpeed
参数量未知或超出本站硬件表(> 8×B200),无法给出配置。
编程Terminal-Bench 2.1 88.3、DeepSWE 67.5、ProgramBench 77.8、SciCode 58.7、FrontierSWE 81.2(官方)。
推理GPQA Diamond 93.5、HLE-Full 43.5 / 56.0(工具)、CritPt 23.4(官方)。
数学官方未披露 AIME;MathVision 94.3 / 97.8(Python)。
AgentBrowseComp 91.2、MCP-Atlas 84.2、Toolathlon-Verified 76.5、OSWorld-Verified 84.8、τ³-Banking 33.4(官方)。
多模态MMMU-Pro 81.6 / 83.4(工具)、Video-MME 90.0、OmniDocBench 91.1(官方)。
中文中文顶级。
工程型与 agent 推理是核心:Terminal-Bench 2.1 88.3、DeepSWE 67.5、FrontierSWE 81.2、SWE-Marathon 42.0,BrowseComp 91.2 为公开最高。考试型推理顶级(GPQA 93.5、HLE-Full 43.5 / 带工具 56.0),但 CritPt 23.4 明显低于 GPT-5.6 Sol。思考默认开启,reasoning_effort 可调 low/high/max。常见问题:low 档 AA 指数掉到 48,差距大;无工具纯文本对话偏冗长。
- 1.2.8T/104B 激活,KDA 线性 + Gated MLA 混合,1M 上下文;LMArena 文本榜 1489(第 10,开源最高)、AA 指数 60
- 2.Terminal-Bench 2.1 88.3、BrowseComp 91.2、GPQA 93.5,官方对标 Claude Fable 5 / GPT-5.6 Sol 仅小幅落后
- 3.原生 MXFP4 QAT 发布,1.56 TB 即「全精度」;文本 + 图像 + 视频原生多模态
- 1.Kimi K3 License:月活 > 1 亿或月收入 > 2000 万美元须在界面标注「Kimi K3」;MaaS 年收入 > 2000 万美元须另签协议
- 2.1.56 TB 权重超出单节点 8×H200,自建需双节点,几乎只有云厂商能跑
- 3.API 价 $3/$15 是 K2.6 的 3–4 倍;思考不可关,max 档 token 消耗大;多轮必须原样回传 reasoning_content
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1489 | LMArena Text (style control) | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 60 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 93.5% | Kimi K3 模型卡 | 2026-08-28 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 43.5% | Kimi K3 模型卡 | 2026-08-28 | 厂商公布 |
| Terminal-Bench终端 agent | 88.3% | Kimi K3 模型卡 | 2026-08-28 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 60 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 93.5% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 46.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 58.7% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| MMMU-Pro多模态理解(Pro) | 80.5% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 85% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 46% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1531 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。