开源权重可下推理模型限制许可 · Modified MIT
Kimi K2.7 Code
月之暗面 Kimi K2.7 Code · Moonshot AI 月之暗面 · 发布 2026-06-11 · 当前代
K2.6 编程特化版,长程编程任务成功率更高。
参数
1T 总 / 32B 激活
MOE
上下文
256K
价格 / 1M tok
$0.95 / $4.00
Kimi 开放平台 · 2026-08-28
最低可跑
8× A100
Q4_K_M · 605 GB · ≈469 tok/s
Arena Elo—
AA 综合指数43
2026-08-28
代码—
GPQA 推理89.6
2026-08-28
架构简图
- 类型
- MoE
- 注意力
- MLA(64 头)
- 层数
- 61
- 专家
- 384 · 激活 8 + 共享
- 隐藏维
- 7168
- 词表
- 160,000
基于 K2.6 的编程特化后训练版,结构完全相同;强制思考 + preserve_thinking,思考 token 比 K2.6 少约 30%。原生 INT4。
完善中
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | — | 暂无 |
| FP8 | — | 暂无 |
| Q8 | — | 暂无 |
| Q4 | 595 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 不可行
- 单卡 80GB
- 不可行
- 8×80GB 节点
- INT4 595 GB,推荐 8×H200
KV Cache:MLA,≈ 70 KiB/token。 ≈ 70 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
完善中
硬件配置与预估吞吐
最低可跑(8K 上下文)
8 × A100 80GB
云 ≈$1.5/h × 8 · 合计 ≈¥480,000 · 数据中心
量化
Q4_K_M
解码
469 tok/s
最大上下文
518K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
8 × H200 141GB
云 ≈$3.5/h × 8 · 合计 ≈¥2,080,000 · 数据中心
量化
FP8
解码
637 tok/s
最大上下文
3.4M
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 8× RTX PRO 6000 Blackwell 96GB工作站 | Q5_K_M估 | 700 GB / 768 GB | 348 | 14063 | 1001K |
| 8× A100 80GB数据中心 | Q4_K_M | 605 GB / 640 GB | 469 | 17550 | 518K |
| 8× H20 96GB数据中心 | Q5_K_M估 | 700 GB / 768 GB | 776 | 4163 | 1001K |
| 8× H100 80GB PCIe数据中心 | Q4_K_M | 605 GB / 640 GB | 460 | 42525 | 518K |
| 8× H100 80GB SXM数据中心 | Q4_K_M | 605 GB / 640 GB | 770 | 55631 | 518K |
| 4× AMD MI300X 192GB数据中心 | Q5_K_M估 | 695 GB / 768 GB | 514 | 36759 | 1.0M |
| 8× H200 141GB数据中心 | FP8估 | 1010 GB / 1128 GB | 654 | 55631 | 3.4M |
| 4× B200 192GB数据中心 | Q5_K_M估 | 695 GB / 768 GB | 776 | 63281 | 1.0M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程Kimi Code Bench v2 62.0、ProgramBench 53.6(官方)。
AgentMCP Atlas 76.0、MCP Mark Verified 81.1(官方)。
逻辑能力
工程型推理专用:ProgramBench 53.6、MLS Bench Lite 35.1,官方对比仍低于 GPT-5.5 / Opus 4.8。
亮点
- 1.Kimi Code Bench v2 62.0(K2.6 50.9)、MCP Mark Verified 81.1
- 2.思考 token 比 K2.6 少约 30%,highspeed 版 180–260 tok/s
- 3.AA 指数 43;与 K2.6 同权重规模,INT4 595 GB
坑
- 1.纯文本,不带视觉;思考与 preserve_thinking 强制开启不可关
- 2.Modified MIT 品牌标注条款同 K2.6
- 3.官方仅披露自家 Kimi Code Bench 等少量基准
适合:Kimi Code CLI / Claude Code 后端 · 长程多文件编程
不适合:通用对话与多模态 · 单机部署
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| Artificial Analysis Intelligence IndexAA 综合指数 | 43 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 43 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 89.6% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 35% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 47.5% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench Hard终端 agent(AA 困难子集) | 44.7% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| τ²-Bench Telecom工具调用 agent(电信域) | 90.1% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| IFBench指令遵循 | 63.1% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 67.4% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 20.2% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。