开源权重可下已被替代限制许可 · Modified MIT License
Moonshot AI logo

Kimi K2 Instruct

Kimi K2(0711 原版) · Moonshot AI 月之暗面 · 发布 2025-07-11 · 已被替代Kimi K2 Instruct (0905)

首个万亿参数开放权重,非推理 agent 模型的高峰。

参数
1T 总 / 32B 激活
MOE
上下文
128K
价格 / 1M tok
$0.60 / $2.50
Moonshot 官方 AP · 2026-08-28
最低可跑
8× A100
Q4_K_M · 631 GB · ≈469 tok/s
Arena Elo
AA 综合指数
真实仓库修 bug65.8
2025-07-11
GPQA 推理75.1
2025-07-11
类型
MoE
注意力
MLA(kv_lora_rank 512 + rope 64,64 头)
层数
61
专家
384 · 激活 8 + 共享
隐藏维
7168
词表
163,840

DeepSeek-V3 式结构放大:384 专家 top-8 + 1 共享;MuonClip 优化器;128K;非推理。

完善中

Token Embedding词表 163,840× 61 层注意力:MLAKV 头 64 · head_dim 192路由top-8E1E2E3共享专家384 专家 · 激活 8 · d=7168LM Head1T / 32B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF162052 GB官方精度
FP81026 GB
Q81088 GB
Q4621 GBGGUF Q4_K_M 或等效
消费级 24GB
不可行
单卡 80GB
不可行
8×80GB 节点
官方 FP8 ≈ 1 TB 需 16×80GB 或 8×H200;Q4 621 GB 8×80GB 勉强

KV Cache:MLA ≈ 68.6 KiB/token。68.6 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

完善中

硬件配置与预估吞吐
最低可跑(8K 上下文)
8 × A100 80GB
云 ≈$1.5/h × 8 · 合计 ≈¥480,000 · 数据中心
量化
Q4_K_M
解码
469 tok/s
最大上下文
143K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
8 × H200 141GB
云 ≈$3.5/h × 8 · 合计 ≈¥2,080,000 · 数据中心
量化
FP8
解码
637 tok/s
最大上下文
2.7M
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
8× RTX PRO 6000 Blackwell 96GB工作站Q5_K_M718 GB / 768 GB34814063753K
8× A100 80GB数据中心Q4_K_M631 GB / 640 GB46917550143K
8× H20 96GB数据中心Q5_K_M718 GB / 768 GB7774163753K
8× H100 80GB PCIe数据中心Q4_K_M631 GB / 640 GB46042525143K
8× H100 80GB SXM数据中心Q4_K_M631 GB / 640 GB77055631143K
4× AMD MI300X 192GB数据中心Q5_K_M713 GB / 768 GB51536759825K
8× H200 141GB数据中心FP81036 GB / 1128 GB654556312.7M
4× B200 192GB数据中心Q5_K_M713 GB / 768 GB77763281825K

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程SWE-bench Verified 65.8%、LiveCodeBench v6 53.7%(官方)。

推理GPQA Diamond 75.1%、HLE 4.7%(官方)。

数学AIME 2025 49.5%(官方)。

AgentTau2 retail 70.6 / airline 56.5 / telecom 65.8,Terminal-bench 30.0(官方)。

中文中文顶级。

逻辑能力

非推理模型中顶级:GPQA 75.1%、AIME 2025 49.5%、LiveCodeBench v6 53.7%、SWE-bench Verified 65.8%(官方)。工具调用与多步 agent 稳定,但没有思考链,深度数学不及推理模型。

亮点
  1. 1.1T 总参 / 32B 激活,SWE-bench Verified 65.8%(官方)
  2. 2.非思考模式即达强 agent 能力,延迟低
  3. 3.MuonClip 优化器,15.5T token 训练零 loss spike
  1. 1.Modified MIT:月活 1 亿或月收 2000 万美元以上需标注 Kimi K2
  2. 2.1T 权重本地几乎不可行
  3. 3.0905 版把上下文扩到 256K 并提升前端代码,建议直接用新版
适合:agent / 工具调用后端 · 代码 agent
不适合:本地部署 · 竞赛数学
基准分数来源日期证据
SWE-bench Verified真实仓库修 bug65.8%Kimi K2 模型卡(LiveCodeBench v6)2025-07-11厂商公布
LiveCodeBench竞赛编程53.7%Kimi K2 模型卡(LiveCodeBench v6)2025-07-11厂商公布
GPQA Diamond研究生级科学问答75.1%Kimi K2 模型卡(LiveCodeBench v6)2025-07-11厂商公布
Humanity's Last Exam人类最后考试4.7%Kimi K2 模型卡(LiveCodeBench v6)2025-07-11厂商公布
AIME 2025美国数学邀请赛49.5%Kimi K2 模型卡(LiveCodeBench v6)2025-07-11厂商公布
Terminal-Bench终端 agent30%Kimi K2 模型卡(LiveCodeBench v6)2025-07-11厂商公布

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。