开源权重可下推理模型多模态限制许可 · Kimi K3 License(Modified MIT)
Moonshot AI logo

Kimi K3

月之暗面 Kimi K3 · Moonshot AI 月之暗面 · 发布 2026-07-16 · 当前代

2.8T 参数的开源多模态 agent 旗舰,LMArena 开源第一。

参数
2.8T 总 / 104B 激活
HYBRID
上下文
1M
价格 / 1M tok
$3.00 / $15
Kimi 开放平台 · 2026-08-28
最低可跑
多节点
超出单机
Arena Elo1489
2026-08-28
AA 综合指数60
2026-08-28
代码
GPQA 推理93.5
2026-08-28
类型
Hybrid(线性 + 全注意力)
注意力
KDA 线性注意力 69 层 + Gated MLA 24 层(96 头)
层数
93
专家
896 · 激活 16 + 共享
隐藏维
7168
词表
163,840

首个开源 3T 级模型。93 层(1 层 Dense)中 69 层为 Kimi Delta Attention(线性,固定状态),24 层为带输出门的 MLA(kv_lora 512 + RoPE 64,按「1 KV 头 × 288」等价表示)。Attention Residuals(AttnRes)、SiTU-GLU 激活、Latent MoE(潜维 3584);2 个共享专家。原生 MXFP4 权重 / MXFP8 激活 QAT。视觉编码器 MoonViT-V2(401M)。

类型:混合线性注意力 MoE,2.8T 总 / 104B 激活。

  • 93 层(含 1 层 Dense):69 层 Kimi Delta Attention(KDA) + 24 层 Gated MLA,每 3 层 KDA 接 1 层 MLA
  • 隐藏维 7168,96 注意力头,词表 163,840
  • 专家:896 路由 + 2 共享,每 token 激活 16 个;Latent MoE(潜维 3584),专家中间维 3072
  • MLA:kv_lora 512,qk_nope 128 + RoPE 64,v_head 128,带输出门(mla_use_output_gate)
  • KDA:head_dim 128,短卷积核 4,full-rank gate
  • Attention Residuals(AttnRes):每 12 层一个注意力残差块
  • 激活:SiTU-GLU
  • 上下文 1,048,576
  • 视觉:MoonViT-V2(401M),patch 14,2×2 merge
  • 原生 MXFP4:从 SFT 阶段起做 QAT,权重 MXFP4 / 激活 MXFP8

参考:Kimi K3 技术报告(GitHub)。

Token Embedding词表 163,840× 93 层(24 层全注意力)注意力:KDA 线性注意力 69 层 + Gated MLA 24 层KV 头 1 · head_dim 288路由top-16E1E2E3共享专家896 专家 · 激活 16 · d=7168LM Head2.8T / 104B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF16暂无
FP82820 GB
Q8暂无
Q41561 GBGGUF Q4_K_M 或等效
消费级 24GB
不可行
单卡 80GB
不可行
8×80GB 节点
MXFP4 权重 1,561 GB 已超单节点 8×H200(1,128 GB),需 16×H200 / 16×H100 双节点或 8×B300 级

KV Cache:仅 24 层 MLA 存 per-token KV:576 × 2 B × 24 ≈ 27 KiB/token;69 层 KDA 为固定状态(每层 96 头 × 128 × 128 × 2 B ≈ 3 MiB,每请求约 207 MiB 常量)。27 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考显存
MXFP4(原生)1,561 GB(官方文件)16×H200

无 BF16 发布版本(MXFP4 即官方精度)。

KV Cache:≈ 27 KiB/token(仅 24 层 MLA)+ 每请求约 207 MiB KDA 固定状态。1M 上下文单请求 KV ≈ 27 GB,比 GLM-5.2 小 3 倍。

参考配置

  • 24GB / 80GB / 单节点 8×H100:不可行
  • 8×H200 141GB(1,128 GB):权重放不下
  • 16×H200 双节点:可服务;官方部署指南基于 vLLM / SGLang / TokenSpeed
硬件配置与预估吞吐

参数量未知或超出本站硬件表(> 8×B200),无法给出配置。

用计算器按你的上下文与并发估算 →

编程Terminal-Bench 2.1 88.3、DeepSWE 67.5、ProgramBench 77.8、SciCode 58.7、FrontierSWE 81.2(官方)。

推理GPQA Diamond 93.5、HLE-Full 43.5 / 56.0(工具)、CritPt 23.4(官方)。

数学官方未披露 AIME;MathVision 94.3 / 97.8(Python)。

AgentBrowseComp 91.2、MCP-Atlas 84.2、Toolathlon-Verified 76.5、OSWorld-Verified 84.8、τ³-Banking 33.4(官方)。

多模态MMMU-Pro 81.6 / 83.4(工具)、Video-MME 90.0、OmniDocBench 91.1(官方)。

中文中文顶级。

逻辑能力

工程型与 agent 推理是核心:Terminal-Bench 2.1 88.3、DeepSWE 67.5、FrontierSWE 81.2、SWE-Marathon 42.0,BrowseComp 91.2 为公开最高。考试型推理顶级(GPQA 93.5、HLE-Full 43.5 / 带工具 56.0),但 CritPt 23.4 明显低于 GPT-5.6 Sol。思考默认开启,reasoning_effort 可调 low/high/max。常见问题:low 档 AA 指数掉到 48,差距大;无工具纯文本对话偏冗长。

亮点
  1. 1.2.8T/104B 激活,KDA 线性 + Gated MLA 混合,1M 上下文;LMArena 文本榜 1489(第 10,开源最高)、AA 指数 60
  2. 2.Terminal-Bench 2.1 88.3、BrowseComp 91.2、GPQA 93.5,官方对标 Claude Fable 5 / GPT-5.6 Sol 仅小幅落后
  3. 3.原生 MXFP4 QAT 发布,1.56 TB 即「全精度」;文本 + 图像 + 视频原生多模态
  1. 1.Kimi K3 License:月活 > 1 亿或月收入 > 2000 万美元须在界面标注「Kimi K3」;MaaS 年收入 > 2000 万美元须另签协议
  2. 2.1.56 TB 权重超出单节点 8×H200,自建需双节点,几乎只有云厂商能跑
  3. 3.API 价 $3/$15 是 K2.6 的 3–4 倍;思考不可关,max 档 token 消耗大;多轮必须原样回传 reasoning_content
适合:深度搜索 / 研究型 agent · 长程编程 agent(Kimi Code CLI) · 视觉 + 长上下文的文档 / 视频理解 · 云厂商级自建
不适合:任何单节点部署 · 简单对话(成本高,用 K2.6) · 超大 MAU 产品且不愿标注品牌
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1489LMArena Text (style control)2026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数60Artificial Analysis Intelligence Index v32026-08-28独立复测
GPQA Diamond研究生级科学问答93.5%Kimi K3 模型卡2026-08-28厂商公布
Humanity's Last Exam人类最后考试43.5%Kimi K3 模型卡2026-08-28厂商公布
Terminal-Bench终端 agent88.3%Kimi K3 模型卡2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数60Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答93.5%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试46.9%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程58.7%Artificial Analysis (v4.1.1)2026-08-28独立复测
MMMU-Pro多模态理解(Pro)80.5%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent85%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)46%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1531LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。