开源权重可下推理模型·可关可商用 · MIT
DeepSeek logo

DeepSeek-V4-Pro

深度求索 V4 Pro · DeepSeek 深度求索 · 发布 2026-08-13 · 当前代

MIT 许可 1.6T 旗舰,1M 上下文,Agent 榜追平闭源。

参数
1.6T 总 / 49B 激活
MOE
上下文
1M
输出 384K
价格 / 1M tok
$0.66 / $1.98
DeepSeek 官方 AP · 2026-08-28
最低可跑
8× AMD MI300X
FP8 · 903 GB · ≈471 tok/s
Arena Elo1462
2026-08-28
AA 综合指数53
2026-08-28
真实仓库修 bug80.6
2026-08-28
GPQA 推理92.8
2026-08-28
类型
MoE
注意力
CSA(Compressed Sparse Attention)+ HCA(Heavily Compressed Attention)混合,MLA 式潜向量
层数
61
专家
384 · 激活 6 + 共享
隐藏维
7168
词表
129,280

config:128 Q 头、q_lora_rank 1536、o_lora_rank 1024、RoPE 64 维;每层 KV 用 4× 或 128× token 压缩(compress_ratios 4/128 交错),稀疏 indexer 64 头、top-k 1024,滑窗 128,前 3 层为 hash 层。表内 kv_heads=1、head_dim=512 为 MLA 式潜向量的等效换算。384 路由 + 1 共享专家,每 token 激活 6;专家 FP4、其余 FP8 原生。mHC 超连接残差、Muon 优化器、1 层 MTP。官方称 1M 上下文下单 token FLOPs 仅为 V3.2 的 27%、KV 为 10%。

类型:MoE,1.6T 总参数 / 49B 激活。

项目数值
层数61(前 3 层 hash 层)
隐藏维7,168
专家384 路由 + 1 共享,每 token 激活 6,专家中间维 3,072
路由sqrtsoftplus 打分、noaux_tc、scaling 2.5
注意力头128 Q 头,head_dim 512,KV 单头(MLA 式潜向量)
低秩q_lora_rank 1536、o_lora_rank 1024(o_groups 16)
RoPE64 维,YaRN factor 16(原生 64K → 1M)
稀疏 indexer64 头 × 128 维,top-k 1024,滑窗 128
KV 压缩比逐层 4× / 128× 交错(CSA / HCA)
词表129,280
精度专家 FP4,其余 FP8(e4m3,块 128×128)
MTP1 层;0813 版附 DSpark 投机解码模块

CSA + HCA:HCA 层把 KV 按 128× 压缩做全局注意力,CSA 层按 4× 压缩后用 DSA 式 indexer 选 top-1024。官方:1M 上下文下单 token FLOPs 为 V3.2 的 27%、KV 为 10%。

mHC:Manifold-Constrained Hyper-Connections(hc_mult 4,Sinkhorn 20 步)替代普通残差。

参考:DeepSeek-V4 技术报告(arXiv 2606.19348)、config.json。

Token Embedding词表 129,280× 61 层注意力:CSAKV 头 1 · head_dim 512路由top-6E1E2E3共享专家384 专家 · 激活 6 · d=7168LM Head1.6T / 49B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF16暂无
FP8893 GB
Q8873 GB
Q4850 GBGGUF Q4_K_M 或等效
消费级 24GB
不可行
单卡 80GB
不可行(单卡)
8×80GB 节点
不可行(893 GB > 640 GB);需 8×H200 141GB(1.13 TB)或 8×B200 / GB300 级别单机

KV Cache:混合压缩注意力:HCA 层按 128× 压缩、CSA 层按 4× 压缩再稀疏选 top-1024,官方称 1M 上下文 KV 仅为 V3.2 的 10%;每 token 精确 KiB 官方未披露。fp8 一栏为官方 FP4(专家)+ FP8 混合原生权重 893 GB;Q4 一栏为 unsloth UD-Q4_K_XL,专家本就是 4-bit 所以几乎不缩。

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小说明
FP4 + FP8 混合893 GB官方原生发布,66 分片
Q8873 GBunsloth UD-Q8_K_XL
Q4850 GBunsloth UD-Q4_K_XL(专家本就 4-bit,几乎不缩)
BF16未提供官方不发 BF16

KV Cache:混合压缩注意力,官方称 1M 上下文 KV 为 V3.2 的 10%;每 token 精确值未披露。Think Max 建议 ≥ 384K 输出窗口。

参考配置

  • 24GB / 80GB 单卡:不可行
  • 单机 8×80GB:不可行(893 GB > 640 GB)
  • 8×H200 141GB / 8×B200 / GB300:可部署,vLLM 与 SGLang 均支持 DSpark 投机解码

警示:Q4 GGUF 不能省显存,「量化就能本地跑」对 V4-Pro 不成立。

硬件配置与预估吞吐
最低可跑(8K 上下文)
8 × AMD MI300X 192GB
云 ≈$3/h × 8 · 合计 ≈¥2,000,000 · 数据中心
量化
FP8
解码
471 tok/s
最大上下文
10.4M
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
8 × AMD MI300X 192GB
云 ≈$3/h × 8 · 合计 ≈¥2,000,000 · 数据中心
量化
FP8
解码
457 tok/s
最大上下文
10.4M
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
8× AMD MI300X 192GB数据中心FP8903 GB / 1536 GB4714801210.4M
8× H200 141GB数据中心FP8903 GB / 1128 GB427363313.7M
8× B200 192GB数据中心FP8903 GB / 1536 GB7118265310.4M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程SWE-bench Verified 80.6、LiveCodeBench 93.5、Codeforces 3206(预览版模型卡,Max);Terminal Bench 2.1 87.9、NL2Repo 61.5(0813 模型卡)。

推理GPQA Diamond 90.1(预览版);HLE 42.7 / 60.0 有工具(0813 模型卡)。

数学HMMT 2026 Feb 95.2、IMOAnswerBench 89.8(预览版模型卡);AIME 2025 未披露。

AgentDeepSWE 62.7、Toolathlon-Verified 74.1、Cybergym 83.3、DSBench-FullStack 71.1(0813 模型卡);BrowseComp 83.4(预览版)。

中文Chinese-SimpleQA 84.4(预览版模型卡),中文事实知识顶级。

逻辑能力

工程型强于考试型:预览版模型卡 SWE-bench Verified 80.6、LiveCodeBench 93.5、Codeforces 3206 已是开源第一梯队;0813 正式版重点补强 Agent,Terminal Bench 2.1 从 72.1 升到 87.9、DeepSWE 从 12.8 升到 62.7、Cybergym 83.3。考试型 GPQA Diamond 90.1、HLE 42.7(无工具)/ 60.0(有工具)距 Fable 5 仍有差距。三档 reasoning_effort(low / high / max),max 建议 ≥ 384K 输出窗口;非思考模式在 HLE 等题上骤降(预览版 7.7)。AA 智能指数 53,仅比 V4-Flash-0731 高 1 分,性价比不如 Flash。

亮点
  1. 1.MIT 许可 1.6T / 49B 激活权重可下,0813 正式版 Terminal Bench 2.1 87.9、DeepSWE 62.7 与 Opus-4.8 同档
  2. 2.CSA + HCA 混合压缩注意力:1M 上下文下 FLOPs 为 V3.2 的 27%、KV 为 10%
  3. 3.API $0.66 / $1.98(非高峰),Text Arena 1462 分;DSpark 投机解码模块随权重附带
  1. 1.893 GB 原生 FP4/FP8,单机 8×80GB 装不下,起步是 8×H200 或 B200 级别
  2. 2.0813 版 API 价格较 4 月预览版上涨(AA 称约 3.6×),且分高峰 / 非高峰计价
  3. 3.纯文本;HLE 42.7、GPQA 90.1 等考试型榜落后 Opus 4.8 / Fable 5 数分,SWE-bench Verified 80.6 为预览版数
适合:自建旗舰级 Coding / Terminal Agent · 1M 超长上下文文档与代码库 · 低成本 API 替代闭源旗舰
不适合:单机 8×80GB 及以下部署 · 视觉输入 · 对 Flash 已够用的场景(差距仅 1 分 AA)
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1462LMArena Text (style control)2026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数53Artificial Analysis Intelligence Index v32026-08-28独立复测
SWE-bench Verified真实仓库修 bug80.6%DeepSeek-V4-Pro 模型卡2026-08-28厂商公布
LiveCodeBench竞赛编程93.5%DeepSeek-V4-Pro 模型卡2026-08-28厂商公布
GPQA Diamond研究生级科学问答90.1%DeepSeek-V4-Pro 模型卡2026-08-28厂商公布
Humanity's Last Exam人类最后考试42.7%DeepSeek-V4-Pro 模型卡2026-08-28厂商公布
Terminal-Bench终端 agent87.9%DeepSeek-V4-Pro 模型卡2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数53Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答92.8%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试41%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程49.2%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent78.7%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)39.6%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1500LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。