开源权重可下推理模型已被替代限制许可 · Modified MIT
Moonshot AI logo

Kimi K2 Thinking

月之暗面 K2 推理版 · Moonshot AI 月之暗面 · 发布 2025-11-06 · 已被替代Kimi K3

1T 参数、原生 INT4 的开源 agent 推理旗舰,HLE 开源第一。

参数
1T 总 / 32B 激活
MOE
上下文
256K
输出 64K
价格 / 1M tok
$0.60 / $2.50
Moonshot 开放平台 · 2025-12-20
最低可跑
8× A100
Q4_K_M · 604 GB · ≈469 tok/s
Arena Elo1436
2025-12-20
AA 综合指数
真实仓库修 bug71.3
2025-12-20
GPQA 推理84.5
2025-12-20
类型
MoE
注意力
MLA(64 头)
层数
61
专家
384 · 激活 8 + 共享
隐藏维
7168
词表
160,000

DeepSeek-V3 同构放大:384 专家 / 8 激活 + 1 共享,MLA。原生 INT4 QAT 发布(权重即 4 bit)。MuonClip 优化器。

类型:MoE,1.04T 总 / 32B 激活。

  • 61 层(含 1 层 Dense),隐藏维 7168,词表 160K
  • 专家:384 路由 + 1 共享,每 token 激活 8 个
  • 注意力:MLA,64 头,KV 潜向量 512 + RoPE 64
  • 与 DeepSeek-V3 同构但专家数 ×1.5、注意力头数减半(为降低长上下文推理开销)
  • 上下文 256K
  • 训练用 MuonClip 优化器解决 attention logit 爆炸
  • 原生 INT4 QAT:后训练阶段做量化感知训练,MoE 部分权重以 INT4 发布

参考:Kimi K2 技术报告(arXiv 2507.20534)。

Token Embedding词表 160,000× 61 层注意力:MLAKV 头 1 · head_dim 288路由top-8E1E2E3共享专家384 专家 · 激活 8 · d=7168LM Head1T / 32B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF16暂无
FP8暂无
Q8暂无
Q4594 GBGGUF Q4_K_M 或等效
消费级 24GB
不可行
单卡 80GB
不可行
8×80GB 节点
INT4 权重 594 GB,8×H100 80GB 勉强(KV 余量小),推荐 8×H200

KV Cache:MLA,与 DeepSeek-V3 同:≈ 70 KiB/token。70 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考显存
INT4(原生)594 GB8×H200

无 BF16 发布版本(INT4 即官方精度)。

KV Cache:≈ 70 KiB/token(MLA)。

参考配置

  • 24GB / 80GB:不可行
  • 8×H100 80GB:合计 640 GB,权重后仅剩 ~46 GB 给 KV,并发受限
  • 8×H200 141GB:舒适
硬件配置与预估吞吐
最低可跑(8K 上下文)
8 × A100 80GB
云 ≈$1.5/h × 8 · 合计 ≈¥480,000 · 数据中心
量化
Q4_K_M
解码
469 tok/s
最大上下文
532K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
8 × H200 141GB
云 ≈$3.5/h × 8 · 合计 ≈¥2,080,000 · 数据中心
量化
FP8
解码
637 tok/s
最大上下文
3.4M
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
8× RTX PRO 6000 Blackwell 96GB工作站Q5_K_M700 GB / 768 GB348140631001K
8× A100 80GB数据中心Q4_K_M604 GB / 640 GB46917550532K
8× H20 96GB数据中心Q5_K_M700 GB / 768 GB77641631001K
8× H100 80GB PCIe数据中心Q4_K_M604 GB / 640 GB46042525532K
8× H100 80GB SXM数据中心Q4_K_M604 GB / 640 GB77055631532K
4× AMD MI300X 192GB数据中心Q5_K_M695 GB / 768 GB514367591.0M
8× H200 141GB数据中心FP81010 GB / 1128 GB654556313.4M
4× B200 192GB数据中心Q5_K_M695 GB / 768 GB776632811.0M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程SWE-bench Verified 71.3%、LiveCodeBench v6 83.1%(官方)。

推理HLE 44.9%(工具)、GPQA 84.5%(官方)。

数学AIME 2025 99.1%(Python)、94.5%(无工具,官方)。

AgentBrowseComp 60.2%、τ²-bench 74.3%(官方)。

中文中文顶级,BrowseComp-ZH 62.3%。

逻辑能力

工程型与工具增强推理是核心:BrowseComp 60.2%、SWE-bench Verified 71.3%。考试型推理带工具时极强(AIME 99.1% with Python),无工具时略低于 GPT-5。思考链交错工具调用(interleaved thinking)是其特色。常见问题:无工具纯文本对话时偶尔过度冗长;数学题喜欢调 Python 而非心算。

亮点
  1. 1.HLE(带工具)44.9%,发布时超过所有闭源模型
  2. 2.官方称可连续 200–300 次工具调用不漂移,agent 长任务稳定
  3. 3.原生 INT4 QAT:权重 594 GB 即为「全精度」,推理速度翻倍
  1. 1.Modified MIT:月活 > 1 亿或月收入 > 2000 万美元的产品须在界面标注「Kimi K2」
  2. 2.1T 体量,8×H100 部署 KV 余量很小,实际要 H200
  3. 3.思考模式 token 消耗大,简单任务性价比差(用 K2-0905 非思考版)
适合:深度搜索 / 研究型 agent · 长链工具调用 · 自建高端推理服务
不适合:任何单机部署 · 简单对话(成本高)
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1436LMArena Text (style control)2025-12-20独立复测
SWE-bench Verified真实仓库修 bug71.3%Moonshot 发布页2025-12-20厂商公布
LiveCodeBench竞赛编程83.1%Moonshot 发布页2025-12-20厂商公布
GPQA Diamond研究生级科学问答84.5%Moonshot 发布页2025-12-20厂商公布
Humanity's Last Exam人类最后考试23.9%Moonshot 发布页2025-12-20厂商公布
AIME 2025美国数学邀请赛94.5%Moonshot 发布页2025-12-20厂商公布
τ²-bench工具调用 agent74.3%Moonshot 发布页2025-12-20厂商公布
Terminal-Bench终端 agent47.1%Moonshot 发布页2025-12-20厂商公布
LMArena Chinese Elo中文人类偏好 Elo1442LMArena Text · Chinese2025-12-20独立复测

更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。