DeepSeek-V4-Pro
深度求索 V4 Pro · DeepSeek 深度求索 · 发布 2026-08-13 · 当前代
MIT 许可 1.6T 旗舰,1M 上下文,Agent 榜追平闭源。
- 类型
- MoE
- 注意力
- CSA(Compressed Sparse Attention)+ HCA(Heavily Compressed Attention)混合,MLA 式潜向量
- 层数
- 61
- 专家
- 384 · 激活 6 + 共享
- 隐藏维
- 7168
- 词表
- 129,280
config:128 Q 头、q_lora_rank 1536、o_lora_rank 1024、RoPE 64 维;每层 KV 用 4× 或 128× token 压缩(compress_ratios 4/128 交错),稀疏 indexer 64 头、top-k 1024,滑窗 128,前 3 层为 hash 层。表内 kv_heads=1、head_dim=512 为 MLA 式潜向量的等效换算。384 路由 + 1 共享专家,每 token 激活 6;专家 FP4、其余 FP8 原生。mHC 超连接残差、Muon 优化器、1 层 MTP。官方称 1M 上下文下单 token FLOPs 仅为 V3.2 的 27%、KV 为 10%。
类型:MoE,1.6T 总参数 / 49B 激活。
| 项目 | 数值 |
|---|---|
| 层数 | 61(前 3 层 hash 层) |
| 隐藏维 | 7,168 |
| 专家 | 384 路由 + 1 共享,每 token 激活 6,专家中间维 3,072 |
| 路由 | sqrtsoftplus 打分、noaux_tc、scaling 2.5 |
| 注意力头 | 128 Q 头,head_dim 512,KV 单头(MLA 式潜向量) |
| 低秩 | q_lora_rank 1536、o_lora_rank 1024(o_groups 16) |
| RoPE | 64 维,YaRN factor 16(原生 64K → 1M) |
| 稀疏 indexer | 64 头 × 128 维,top-k 1024,滑窗 128 |
| KV 压缩比 | 逐层 4× / 128× 交错(CSA / HCA) |
| 词表 | 129,280 |
| 精度 | 专家 FP4,其余 FP8(e4m3,块 128×128) |
| MTP | 1 层;0813 版附 DSpark 投机解码模块 |
CSA + HCA:HCA 层把 KV 按 128× 压缩做全局注意力,CSA 层按 4× 压缩后用 DSA 式 indexer 选 top-1024。官方:1M 上下文下单 token FLOPs 为 V3.2 的 27%、KV 为 10%。
mHC:Manifold-Constrained Hyper-Connections(hc_mult 4,Sinkhorn 20 步)替代普通残差。
参考:DeepSeek-V4 技术报告(arXiv 2606.19348)、config.json。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | — | 暂无 |
| FP8 | 893 GB | |
| Q8 | 873 GB | |
| Q4 | 850 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 不可行
- 单卡 80GB
- 不可行(单卡)
- 8×80GB 节点
- 不可行(893 GB > 640 GB);需 8×H200 141GB(1.13 TB)或 8×B200 / GB300 级别单机
KV Cache:混合压缩注意力:HCA 层按 128× 压缩、CSA 层按 4× 压缩再稀疏选 top-1024,官方称 1M 上下文 KV 仅为 V3.2 的 10%;每 token 精确 KiB 官方未披露。fp8 一栏为官方 FP4(专家)+ FP8 混合原生权重 893 GB;Q4 一栏为 unsloth UD-Q4_K_XL,专家本就是 4-bit 所以几乎不缩。
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| FP4 + FP8 混合 | 893 GB | 官方原生发布,66 分片 |
| Q8 | 873 GB | unsloth UD-Q8_K_XL |
| Q4 | 850 GB | unsloth UD-Q4_K_XL(专家本就 4-bit,几乎不缩) |
| BF16 | 未提供 | 官方不发 BF16 |
KV Cache:混合压缩注意力,官方称 1M 上下文 KV 为 V3.2 的 10%;每 token 精确值未披露。Think Max 建议 ≥ 384K 输出窗口。
参考配置:
- 24GB / 80GB 单卡:不可行
- 单机 8×80GB:不可行(893 GB > 640 GB)
- 8×H200 141GB / 8×B200 / GB300:可部署,vLLM 与 SGLang 均支持 DSpark 投机解码
警示:Q4 GGUF 不能省显存,「量化就能本地跑」对 V4-Pro 不成立。
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 8× AMD MI300X 192GB数据中心 | FP8 | 903 GB / 1536 GB | 471 | 48012 | 10.4M |
| 8× H200 141GB数据中心 | FP8 | 903 GB / 1128 GB | 427 | 36331 | 3.7M |
| 8× B200 192GB数据中心 | FP8 | 903 GB / 1536 GB | 711 | 82653 | 10.4M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程SWE-bench Verified 80.6、LiveCodeBench 93.5、Codeforces 3206(预览版模型卡,Max);Terminal Bench 2.1 87.9、NL2Repo 61.5(0813 模型卡)。
推理GPQA Diamond 90.1(预览版);HLE 42.7 / 60.0 有工具(0813 模型卡)。
数学HMMT 2026 Feb 95.2、IMOAnswerBench 89.8(预览版模型卡);AIME 2025 未披露。
AgentDeepSWE 62.7、Toolathlon-Verified 74.1、Cybergym 83.3、DSBench-FullStack 71.1(0813 模型卡);BrowseComp 83.4(预览版)。
中文Chinese-SimpleQA 84.4(预览版模型卡),中文事实知识顶级。
工程型强于考试型:预览版模型卡 SWE-bench Verified 80.6、LiveCodeBench 93.5、Codeforces 3206 已是开源第一梯队;0813 正式版重点补强 Agent,Terminal Bench 2.1 从 72.1 升到 87.9、DeepSWE 从 12.8 升到 62.7、Cybergym 83.3。考试型 GPQA Diamond 90.1、HLE 42.7(无工具)/ 60.0(有工具)距 Fable 5 仍有差距。三档 reasoning_effort(low / high / max),max 建议 ≥ 384K 输出窗口;非思考模式在 HLE 等题上骤降(预览版 7.7)。AA 智能指数 53,仅比 V4-Flash-0731 高 1 分,性价比不如 Flash。
- 1.MIT 许可 1.6T / 49B 激活权重可下,0813 正式版 Terminal Bench 2.1 87.9、DeepSWE 62.7 与 Opus-4.8 同档
- 2.CSA + HCA 混合压缩注意力:1M 上下文下 FLOPs 为 V3.2 的 27%、KV 为 10%
- 3.API $0.66 / $1.98(非高峰),Text Arena 1462 分;DSpark 投机解码模块随权重附带
- 1.893 GB 原生 FP4/FP8,单机 8×80GB 装不下,起步是 8×H200 或 B200 级别
- 2.0813 版 API 价格较 4 月预览版上涨(AA 称约 3.6×),且分高峰 / 非高峰计价
- 3.纯文本;HLE 42.7、GPQA 90.1 等考试型榜落后 Opus 4.8 / Fable 5 数分,SWE-bench Verified 80.6 为预览版数
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1462 | LMArena Text (style control) | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 53 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| SWE-bench Verified真实仓库修 bug | 80.6% | DeepSeek-V4-Pro 模型卡 | 2026-08-28 | 厂商公布 |
| LiveCodeBench竞赛编程 | 93.5% | DeepSeek-V4-Pro 模型卡 | 2026-08-28 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 90.1% | DeepSeek-V4-Pro 模型卡 | 2026-08-28 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 42.7% | DeepSeek-V4-Pro 模型卡 | 2026-08-28 | 厂商公布 |
| Terminal-Bench终端 agent | 87.9% | DeepSeek-V4-Pro 模型卡 | 2026-08-28 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 53 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 92.8% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 41% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 49.2% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 78.7% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 39.6% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1500 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。