开源权重可下推理模型·可关可商用 · MIT
DeepSeek logo

DeepSeek-V4-Flash

深度求索 V4 Flash · DeepSeek 深度求索 · 发布 2026-07-31 · 当前代

13B 激活跑出旗舰 Agent 分,MIT,167 GB 可自建。

参数
284B 总 / 13B 激活
MOE
上下文
1M
输出 384K
价格 / 1M tok
$0.22 / $0.66
DeepSeek 官方 AP · 2026-08-28
最低可跑
Mac Studio M3 Ultra
FP8 · 169 GB · ≈31 tok/s
Arena Elo1436
2026-08-28
AA 综合指数52
2026-08-28
真实仓库修 bug79
2026-08-28
GPQA 推理90.8
2026-08-28
类型
MoE
注意力
CSA(Compressed Sparse Attention)+ HCA(Heavily Compressed Attention)混合,MLA 式潜向量
层数
43
专家
256 · 激活 6 + 共享
隐藏维
4096
词表
129,280

config:64 Q 头、q_lora_rank 1024、o_lora_rank 1024、RoPE 64 维;每层 KV 用 4× 或 128× 压缩交错,indexer 64 头、top-k 512,滑窗 128,前 3 层 hash 层。表内 kv_heads=1、head_dim=512 为 MLA 式潜向量等效换算。256 路由 + 1 共享专家,每 token 激活 6,专家中间维 2,048;专家 FP4、其余 FP8。mHC、Muon、1 层 MTP。0731 版结构与 V4-Flash-DSpark 相同(附投机解码模块)。

类型:MoE,284B 总参数 / 13B 激活。

项目数值
层数43(前 3 层 hash 层)
隐藏维4,096
专家256 路由 + 1 共享,每 token 激活 6,专家中间维 2,048
路由sqrtsoftplus、noaux_tc、scaling 1.5
注意力头64 Q 头,head_dim 512,KV 单头(MLA 式潜向量)
低秩q_lora_rank 1024、o_lora_rank 1024(o_groups 8)
RoPE64 维,YaRN factor 16(原生 64K → 1M)
稀疏 indexer64 头 × 128 维,top-k 512,滑窗 128
KV 压缩比逐层 4× / 128× 交错(CSA / HCA)
词表129,280
精度专家 FP4,其余 FP8
MTP1 层;0731 版附 DSpark 投机解码

与 V4-Pro 同构、缩小一档:层数 61 → 43,隐藏维 7168 → 4096,专家 384 → 256,indexer top-k 1024 → 512。

参考:DeepSeek-V4 技术报告(arXiv 2606.19348)、config.json。

Token Embedding词表 129,280× 43 层注意力:CSAKV 头 1 · head_dim 512路由top-6E1E2E3共享专家256 专家 · 激活 6 · d=4096LM Head284B / 13B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF16暂无
FP8167 GB
Q8162 GB
Q4155 GBGGUF Q4_K_M 或等效
消费级 24GB
不可行
单卡 80GB
不可行(单卡);Mac Studio / 128 GB 统一内存可用 IQ3_XXS 103 GB
8×80GB 节点
FP4/FP8 原生 167 GB,2×H100 80GB 即可加载,8×80GB 可做高并发 + 长上下文;官方 vLLM 示例为单节点 4×GB300

KV Cache:混合压缩注意力,官方未披露每 token KiB;Think Max 建议 ≥ 384K 输出窗口。fp8 一栏为官方 FP4(专家)+ FP8 混合原生仓库 167 GB;Q4 为 unsloth UD-Q4_K_XL 155 GB,Q8 为 UD-Q8_K_XL 162 GB(专家原生 4-bit,量化几乎不缩);IQ3_XXS 103 GB 可塞进 128 GB 内存机器。

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考显存说明
FP4 + FP8 混合167 GB2×80GB / 4×48GB官方原生,48 分片
Q8162 GB2×80GBunsloth UD-Q8_K_XL(近无损)
Q4155 GB2×80GBunsloth UD-Q4_K_XL(专家本就 4-bit)
IQ3_XXS103 GB128 GB 统一内存unsloth,3-bit 有损
IQ1_S82.5 GB96 GB质量损失大

KV Cache:混合压缩注意力,每 token 精确值官方未披露;DSpark 投机解码额外约 10 GB。Think Max 建议 ≥ 384K 输出窗口。

参考配置

  • 24GB 单卡:不可行
  • 80GB 单卡:不可行;128 GB Mac Studio / DGX Spark 类可用 IQ3_XXS
  • 2×H100 80GB:原生 FP4/FP8 可加载,中等上下文
  • 8×80GB / 4×GB300:高并发 1M 上下文服务(官方 vLLM 示例)
硬件配置与预估吞吐
最低可跑(8K 上下文)
Mac Studio M3 Ultra 256GB
≈¥50,000 · 合计 ≈¥50,000 · 统一内存
量化
FP8
解码
31 tok/s
最大上下文
1.7M
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
Mac Studio M3 Ultra 256GB
≈¥50,000 · 合计 ≈¥50,000 · 统一内存
量化
FP8
解码
28 tok/s
最大上下文
1.7M
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
8× L4 24GB工作站FP8177 GB / 192 GB998308367K
4× RTX A6000 48GB工作站FP8172 GB / 192 GB1265331481K
4× RTX 6000 Ada 48GB工作站FP8172 GB / 192 GB1586300481K
4× L40S 48GB工作站FP8172 GB / 192 GB1426300481K
2× RTX PRO 6000 Blackwell 96GB工作站FP8170 GB / 192 GB1488654538K
8× A10 24GB数据中心FP8177 GB / 192 GB1988585367K
8× A100 40GB数据中心FP8177 GB / 320 GB512432003.3M
2× A100 80GB数据中心Q4_K_M158 GB / 160 GB2711080031K
2× H20 96GB数据中心FP8170 GB / 192 GB3292562538K
4× 昇腾 Ascend 910B 64GB数据中心FP8172 GB / 256 GB263193852.0M
2× H100 80GB PCIe数据中心Q4_K_M158 GB / 160 GB2662616931K
2× H100 80GB SXM数据中心Q4_K_M158 GB / 160 GB4463423531K
AMD MI300X 192GB数据中心FP8169 GB / 192 GB25822621567K
2× H200 141GB数据中心FP8170 GB / 282 GB395342352.6M
B200 192GB数据中心FP8169 GB / 192 GB38938942567K
2× DGX Spark 128GB统一内存FP8170 GB / 240 GB2021461.6M
Mac Studio M3 Ultra 256GB统一内存FP8169 GB / 240 GB319871.7M
Mac Studio M3 Ultra 512GB统一内存FP8169 GB / 490 GB319877.5M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程SWE-bench Verified 79.0、LiveCodeBench 91.6、Codeforces 3052(预览版模型卡,Max);Terminal Bench 2.1 82.7、NL2Repo 54.2(0731 模型卡)。

推理GPQA Diamond 88.1(预览版);HLE 37.8 / 51.5 有工具(0731 模型卡,引自 Pro-0813 对比表)。

数学HMMT 2026 Feb 94.8、IMOAnswerBench 88.4(预览版模型卡);AIME 2025 未披露。

AgentDeepSWE 54.4、Toolathlon-Verified 70.3、Cybergym 76.7、DSBench-FullStack 68.7(0731 模型卡);BrowseComp 73.2(预览版)。

中文Chinese-SimpleQA 78.9(预览版模型卡)。

逻辑能力

13B 激活却有旗舰级推理:预览版模型卡 GPQA Diamond 88.1、LiveCodeBench 91.6、HMMT 2026 Feb 94.8、SWE-bench Verified 79.0(Max 档),与 V4-Pro 差距多在 1–3 分。0731 正式版把 Agent 补强到 Terminal Bench 2.1 82.7(预览 61.8)、DeepSWE 54.4(预览 7.3)、Toolathlon-Verified 70.3。短板在知识与长尾事实(SimpleQA-Verified 34.1 vs Pro 57.9)与 HLE。非思考模式推理骤降(GPQA 71.2、HLE 8.1),须开 high / max。常见问题:max 档输出冗长,工具调用链长时偶有格式漂移。

亮点
  1. 1.MIT,284B / 13B 激活,原生 167 GB,2×H100 或 128 GB 内存机器即可跑起 1M 上下文模型
  2. 2.0731 正式版 Terminal Bench 2.1 82.7、DeepSWE 54.4,AA 智能指数 52 仅比 V4-Pro 低 1 分
  3. 3.API $0.22 / $0.66(非高峰),缓存命中 $0.007;AA 实测约 119 tok/s
  1. 1.专家原生 FP4,Q4 GGUF(155 GB)几乎不比原版小,「量化省显存」不成立,最低 IQ3 也要 103 GB
  2. 2.纯文本;HLE 37.8、SimpleQA-Verified 34.1,知识面明显弱于 Pro
  3. 3.高峰 / 非高峰双价,Think Max 输出极长(AA 评为高冗长),实际成本按输出算
适合:性价比自建 Coding / Terminal Agent · 高吞吐低价 API 批处理 · 1M 长上下文检索问答(LongBench-V2 44.7)
不适合:消费级单卡 24GB · 知识密集型问答(用 Pro) · 视觉输入
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1436LMArena Text (style control)2026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数52Artificial Analysis Intelligence Index v32026-08-28独立复测
SWE-bench Verified真实仓库修 bug79%DeepSeek-V4-Flash 模型卡2026-08-28厂商公布
LiveCodeBench竞赛编程91.6%DeepSeek-V4-Flash 模型卡2026-08-28厂商公布
GPQA Diamond研究生级科学问答88.1%DeepSeek-V4-Flash 模型卡2026-08-28厂商公布
Humanity's Last Exam人类最后考试37.8%DeepSeek-V4-Flash 模型卡2026-08-28厂商公布
Terminal-Bench终端 agent82.7%DeepSeek-V4-Flash 模型卡2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数52Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答90.8%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试38.6%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程49.9%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent78.7%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)39.4%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1480LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。