Kimi K2 Thinking
月之暗面 K2 推理版 · Moonshot AI 月之暗面 · 发布 2025-11-06 · 已被替代 → Kimi K3
1T 参数、原生 INT4 的开源 agent 推理旗舰,HLE 开源第一。
- 类型
- MoE
- 注意力
- MLA(64 头)
- 层数
- 61
- 专家
- 384 · 激活 8 + 共享
- 隐藏维
- 7168
- 词表
- 160,000
DeepSeek-V3 同构放大:384 专家 / 8 激活 + 1 共享,MLA。原生 INT4 QAT 发布(权重即 4 bit)。MuonClip 优化器。
类型:MoE,1.04T 总 / 32B 激活。
- 61 层(含 1 层 Dense),隐藏维 7168,词表 160K
- 专家:384 路由 + 1 共享,每 token 激活 8 个
- 注意力:MLA,64 头,KV 潜向量 512 + RoPE 64
- 与 DeepSeek-V3 同构但专家数 ×1.5、注意力头数减半(为降低长上下文推理开销)
- 上下文 256K
- 训练用 MuonClip 优化器解决 attention logit 爆炸
- 原生 INT4 QAT:后训练阶段做量化感知训练,MoE 部分权重以 INT4 发布
参考:Kimi K2 技术报告(arXiv 2507.20534)。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | — | 暂无 |
| FP8 | — | 暂无 |
| Q8 | — | 暂无 |
| Q4 | 594 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 不可行
- 单卡 80GB
- 不可行
- 8×80GB 节点
- INT4 权重 594 GB,8×H100 80GB 勉强(KV 余量小),推荐 8×H200
KV Cache:MLA,与 DeepSeek-V3 同:≈ 70 KiB/token。 ≈ 70 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 参考显存 |
|---|---|---|
| INT4(原生) | 594 GB | 8×H200 |
无 BF16 发布版本(INT4 即官方精度)。
KV Cache:≈ 70 KiB/token(MLA)。
参考配置:
- 24GB / 80GB:不可行
- 8×H100 80GB:合计 640 GB,权重后仅剩 ~46 GB 给 KV,并发受限
- 8×H200 141GB:舒适
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 8× RTX PRO 6000 Blackwell 96GB工作站 | Q5_K_M估 | 700 GB / 768 GB | 348 | 14063 | 1001K |
| 8× A100 80GB数据中心 | Q4_K_M | 604 GB / 640 GB | 469 | 17550 | 532K |
| 8× H20 96GB数据中心 | Q5_K_M估 | 700 GB / 768 GB | 776 | 4163 | 1001K |
| 8× H100 80GB PCIe数据中心 | Q4_K_M | 604 GB / 640 GB | 460 | 42525 | 532K |
| 8× H100 80GB SXM数据中心 | Q4_K_M | 604 GB / 640 GB | 770 | 55631 | 532K |
| 4× AMD MI300X 192GB数据中心 | Q5_K_M估 | 695 GB / 768 GB | 514 | 36759 | 1.0M |
| 8× H200 141GB数据中心 | FP8估 | 1010 GB / 1128 GB | 654 | 55631 | 3.4M |
| 4× B200 192GB数据中心 | Q5_K_M估 | 695 GB / 768 GB | 776 | 63281 | 1.0M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程SWE-bench Verified 71.3%、LiveCodeBench v6 83.1%(官方)。
推理HLE 44.9%(工具)、GPQA 84.5%(官方)。
数学AIME 2025 99.1%(Python)、94.5%(无工具,官方)。
AgentBrowseComp 60.2%、τ²-bench 74.3%(官方)。
中文中文顶级,BrowseComp-ZH 62.3%。
工程型与工具增强推理是核心:BrowseComp 60.2%、SWE-bench Verified 71.3%。考试型推理带工具时极强(AIME 99.1% with Python),无工具时略低于 GPT-5。思考链交错工具调用(interleaved thinking)是其特色。常见问题:无工具纯文本对话时偶尔过度冗长;数学题喜欢调 Python 而非心算。
- 1.HLE(带工具)44.9%,发布时超过所有闭源模型
- 2.官方称可连续 200–300 次工具调用不漂移,agent 长任务稳定
- 3.原生 INT4 QAT:权重 594 GB 即为「全精度」,推理速度翻倍
- 1.Modified MIT:月活 > 1 亿或月收入 > 2000 万美元的产品须在界面标注「Kimi K2」
- 2.1T 体量,8×H100 部署 KV 余量很小,实际要 H200
- 3.思考模式 token 消耗大,简单任务性价比差(用 K2-0905 非思考版)
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1436 | LMArena Text (style control) | 2025-12-20 | 独立复测 |
| SWE-bench Verified真实仓库修 bug | 71.3% | Moonshot 发布页 | 2025-12-20 | 厂商公布 |
| LiveCodeBench竞赛编程 | 83.1% | Moonshot 发布页 | 2025-12-20 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 84.5% | Moonshot 发布页 | 2025-12-20 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 23.9% | Moonshot 发布页 | 2025-12-20 | 厂商公布 |
| AIME 2025美国数学邀请赛 | 94.5% | Moonshot 发布页 | 2025-12-20 | 厂商公布 |
| τ²-bench工具调用 agent | 74.3% | Moonshot 发布页 | 2025-12-20 | 厂商公布 |
| Terminal-Bench终端 agent | 47.1% | Moonshot 发布页 | 2025-12-20 | 厂商公布 |
| LMArena Chinese Elo中文人类偏好 Elo | 1442 | LMArena Text · Chinese | 2025-12-20 | 独立复测 |
更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。