DeepSeek-V4-Flash
深度求索 V4 Flash · DeepSeek 深度求索 · 发布 2026-07-31 · 当前代
13B 激活跑出旗舰 Agent 分,MIT,167 GB 可自建。
- 类型
- MoE
- 注意力
- CSA(Compressed Sparse Attention)+ HCA(Heavily Compressed Attention)混合,MLA 式潜向量
- 层数
- 43
- 专家
- 256 · 激活 6 + 共享
- 隐藏维
- 4096
- 词表
- 129,280
config:64 Q 头、q_lora_rank 1024、o_lora_rank 1024、RoPE 64 维;每层 KV 用 4× 或 128× 压缩交错,indexer 64 头、top-k 512,滑窗 128,前 3 层 hash 层。表内 kv_heads=1、head_dim=512 为 MLA 式潜向量等效换算。256 路由 + 1 共享专家,每 token 激活 6,专家中间维 2,048;专家 FP4、其余 FP8。mHC、Muon、1 层 MTP。0731 版结构与 V4-Flash-DSpark 相同(附投机解码模块)。
类型:MoE,284B 总参数 / 13B 激活。
| 项目 | 数值 |
|---|---|
| 层数 | 43(前 3 层 hash 层) |
| 隐藏维 | 4,096 |
| 专家 | 256 路由 + 1 共享,每 token 激活 6,专家中间维 2,048 |
| 路由 | sqrtsoftplus、noaux_tc、scaling 1.5 |
| 注意力头 | 64 Q 头,head_dim 512,KV 单头(MLA 式潜向量) |
| 低秩 | q_lora_rank 1024、o_lora_rank 1024(o_groups 8) |
| RoPE | 64 维,YaRN factor 16(原生 64K → 1M) |
| 稀疏 indexer | 64 头 × 128 维,top-k 512,滑窗 128 |
| KV 压缩比 | 逐层 4× / 128× 交错(CSA / HCA) |
| 词表 | 129,280 |
| 精度 | 专家 FP4,其余 FP8 |
| MTP | 1 层;0731 版附 DSpark 投机解码 |
与 V4-Pro 同构、缩小一档:层数 61 → 43,隐藏维 7168 → 4096,专家 384 → 256,indexer top-k 1024 → 512。
参考:DeepSeek-V4 技术报告(arXiv 2606.19348)、config.json。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | — | 暂无 |
| FP8 | 167 GB | |
| Q8 | 162 GB | |
| Q4 | 155 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 不可行
- 单卡 80GB
- 不可行(单卡);Mac Studio / 128 GB 统一内存可用 IQ3_XXS 103 GB
- 8×80GB 节点
- FP4/FP8 原生 167 GB,2×H100 80GB 即可加载,8×80GB 可做高并发 + 长上下文;官方 vLLM 示例为单节点 4×GB300
KV Cache:混合压缩注意力,官方未披露每 token KiB;Think Max 建议 ≥ 384K 输出窗口。fp8 一栏为官方 FP4(专家)+ FP8 混合原生仓库 167 GB;Q4 为 unsloth UD-Q4_K_XL 155 GB,Q8 为 UD-Q8_K_XL 162 GB(专家原生 4-bit,量化几乎不缩);IQ3_XXS 103 GB 可塞进 128 GB 内存机器。
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 参考显存 | 说明 |
|---|---|---|---|
| FP4 + FP8 混合 | 167 GB | 2×80GB / 4×48GB | 官方原生,48 分片 |
| Q8 | 162 GB | 2×80GB | unsloth UD-Q8_K_XL(近无损) |
| Q4 | 155 GB | 2×80GB | unsloth UD-Q4_K_XL(专家本就 4-bit) |
| IQ3_XXS | 103 GB | 128 GB 统一内存 | unsloth,3-bit 有损 |
| IQ1_S | 82.5 GB | 96 GB | 质量损失大 |
KV Cache:混合压缩注意力,每 token 精确值官方未披露;DSpark 投机解码额外约 10 GB。Think Max 建议 ≥ 384K 输出窗口。
参考配置:
- 24GB 单卡:不可行
- 80GB 单卡:不可行;128 GB Mac Studio / DGX Spark 类可用 IQ3_XXS
- 2×H100 80GB:原生 FP4/FP8 可加载,中等上下文
- 8×80GB / 4×GB300:高并发 1M 上下文服务(官方 vLLM 示例)
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 8× L4 24GB工作站 | FP8 | 177 GB / 192 GB | 99 | 8308 | 367K |
| 4× RTX A6000 48GB工作站 | FP8 | 172 GB / 192 GB | 126 | 5331 | 481K |
| 4× RTX 6000 Ada 48GB工作站 | FP8 | 172 GB / 192 GB | 158 | 6300 | 481K |
| 4× L40S 48GB工作站 | FP8 | 172 GB / 192 GB | 142 | 6300 | 481K |
| 2× RTX PRO 6000 Blackwell 96GB工作站 | FP8 | 170 GB / 192 GB | 148 | 8654 | 538K |
| 8× A10 24GB数据中心 | FP8 | 177 GB / 192 GB | 198 | 8585 | 367K |
| 8× A100 40GB数据中心 | FP8 | 177 GB / 320 GB | 512 | 43200 | 3.3M |
| 2× A100 80GB数据中心 | Q4_K_M | 158 GB / 160 GB | 271 | 10800 | 31K |
| 2× H20 96GB数据中心 | FP8 | 170 GB / 192 GB | 329 | 2562 | 538K |
| 4× 昇腾 Ascend 910B 64GB数据中心 | FP8 | 172 GB / 256 GB | 263 | 19385 | 2.0M |
| 2× H100 80GB PCIe数据中心 | Q4_K_M | 158 GB / 160 GB | 266 | 26169 | 31K |
| 2× H100 80GB SXM数据中心 | Q4_K_M | 158 GB / 160 GB | 446 | 34235 | 31K |
| AMD MI300X 192GB数据中心 | FP8 | 169 GB / 192 GB | 258 | 22621 | 567K |
| 2× H200 141GB数据中心 | FP8 | 170 GB / 282 GB | 395 | 34235 | 2.6M |
| B200 192GB数据中心 | FP8 | 169 GB / 192 GB | 389 | 38942 | 567K |
| 2× DGX Spark 128GB统一内存 | FP8 | 170 GB / 240 GB | 20 | 2146 | 1.6M |
| Mac Studio M3 Ultra 256GB统一内存 | FP8 | 169 GB / 240 GB | 31 | 987 | 1.7M |
| Mac Studio M3 Ultra 512GB统一内存 | FP8 | 169 GB / 490 GB | 31 | 987 | 7.5M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程SWE-bench Verified 79.0、LiveCodeBench 91.6、Codeforces 3052(预览版模型卡,Max);Terminal Bench 2.1 82.7、NL2Repo 54.2(0731 模型卡)。
推理GPQA Diamond 88.1(预览版);HLE 37.8 / 51.5 有工具(0731 模型卡,引自 Pro-0813 对比表)。
数学HMMT 2026 Feb 94.8、IMOAnswerBench 88.4(预览版模型卡);AIME 2025 未披露。
AgentDeepSWE 54.4、Toolathlon-Verified 70.3、Cybergym 76.7、DSBench-FullStack 68.7(0731 模型卡);BrowseComp 73.2(预览版)。
中文Chinese-SimpleQA 78.9(预览版模型卡)。
13B 激活却有旗舰级推理:预览版模型卡 GPQA Diamond 88.1、LiveCodeBench 91.6、HMMT 2026 Feb 94.8、SWE-bench Verified 79.0(Max 档),与 V4-Pro 差距多在 1–3 分。0731 正式版把 Agent 补强到 Terminal Bench 2.1 82.7(预览 61.8)、DeepSWE 54.4(预览 7.3)、Toolathlon-Verified 70.3。短板在知识与长尾事实(SimpleQA-Verified 34.1 vs Pro 57.9)与 HLE。非思考模式推理骤降(GPQA 71.2、HLE 8.1),须开 high / max。常见问题:max 档输出冗长,工具调用链长时偶有格式漂移。
- 1.MIT,284B / 13B 激活,原生 167 GB,2×H100 或 128 GB 内存机器即可跑起 1M 上下文模型
- 2.0731 正式版 Terminal Bench 2.1 82.7、DeepSWE 54.4,AA 智能指数 52 仅比 V4-Pro 低 1 分
- 3.API $0.22 / $0.66(非高峰),缓存命中 $0.007;AA 实测约 119 tok/s
- 1.专家原生 FP4,Q4 GGUF(155 GB)几乎不比原版小,「量化省显存」不成立,最低 IQ3 也要 103 GB
- 2.纯文本;HLE 37.8、SimpleQA-Verified 34.1,知识面明显弱于 Pro
- 3.高峰 / 非高峰双价,Think Max 输出极长(AA 评为高冗长),实际成本按输出算
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1436 | LMArena Text (style control) | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 52 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| SWE-bench Verified真实仓库修 bug | 79% | DeepSeek-V4-Flash 模型卡 | 2026-08-28 | 厂商公布 |
| LiveCodeBench竞赛编程 | 91.6% | DeepSeek-V4-Flash 模型卡 | 2026-08-28 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 88.1% | DeepSeek-V4-Flash 模型卡 | 2026-08-28 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 37.8% | DeepSeek-V4-Flash 模型卡 | 2026-08-28 | 厂商公布 |
| Terminal-Bench终端 agent | 82.7% | DeepSeek-V4-Flash 模型卡 | 2026-08-28 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 52 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 90.8% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 38.6% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 49.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 78.7% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 39.4% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1480 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。