DeepSeek-V3.2
深度求索 V3.2 · DeepSeek 深度求索 · 发布 2025-12-01 · 已被替代 → DeepSeek-V4-Pro
MIT 许可的开源旗舰,稀疏注意力把长上下文成本压到闭源 1/10。
- 类型
- MoE
- 注意力
- MLA + DSA(DeepSeek Sparse Attention)
- 层数
- 61
- 专家
- 256 · 激活 8 + 共享
- 隐藏维
- 7168
- 词表
- 129,280
在 V3.1-Terminus 基础上引入 DSA:lightning indexer 为每个 query 选 top-k 键,把注意力复杂度从 O(L²) 降到 O(L·k)。MLA 的 KV 压缩为 512 维潜向量 + 64 维 RoPE(表内 kv_heads=1、head_dim=288 为等效换算)。
类型:MoE,685B 总参数 / 37B 激活。
- 61 层,隐藏维 7168,词表 129,280
- 专家:256 路由专家 + 1 共享专家,每 token 激活 8 个路由专家
- 注意力:MLA(Multi-head Latent Attention):KV 压缩到 512 维潜向量 + 64 维解耦 RoPE
- DSA(DeepSeek Sparse Attention):轻量 indexer 打分,每个 query 只对 top-2048 个键做注意力
- 上下文 128K;RoPE 用 YaRN 扩展
- MTP(多 token 预测)头可用于投机解码
参考:DeepSeek-V3 技术报告、V3.2 技术报告(GitHub)。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | — | 暂无 |
| FP8 | 690 GB估 | |
| Q8 | — | 暂无 |
| Q4 | 380 GB估 | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 不可行
- 单卡 80GB
- 不可行(单卡)
- 8×80GB 节点
- FP8 权重 690 GB,8×H100/H200 可部署;官方推荐 H200 或 8×H100 + FP8
KV Cache:MLA:每 token 每层约 576 维 × 2 B ≈ 1.1 KiB,61 层 ≈ 70 KiB/token(远低于同规模 GQA)。 ≈ 70 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| FP8 | ≈ 690 GB | 官方原生发布精度 |
| BF16 | ≈ 1.37 TB | 由 FP8 反量化,通常不这么跑 |
| Q4 | ≈ 380 GB(估) | llama.cpp / AWQ 社区量化 |
KV Cache:MLA 每 token 每层约 576 维 → 61 层 ≈ 70 KiB/token(BF16)。128K 上下文单请求 ≈ 8.8 GB,比同规模 GQA 小一个量级。
参考配置:
- 消费级 24GB:不可行
- 单卡 80GB:不可行
- 8×H100 80GB:FP8 可部署,剩余显存留给 KV,高并发建议 H200
警示:能加载 ≠ 能高并发。DSA 的 indexer 也占算力。
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 8× RTX PRO 6000 Blackwell 96GB工作站 | FP8 | 700 GB / 768 GB | 211 | 12162 | 2.0M |
| 8× A100 80GB数据中心 | Q6_K估 | 558 GB / 640 GB | 297 | 15178 | 1.2M |
| 8× H20 96GB数据中心 | FP8 | 700 GB / 768 GB | 472 | 3600 | 2.0M |
| 8× 昇腾 Ascend 910B 64GB数据中心 | Q5_K_M估 | 483 GB / 512 GB | 270 | 13622 | 435K |
| 8× H100 80GB PCIe数据中心 | Q6_K估 | 558 GB / 640 GB | 292 | 36778 | 1.2M |
| 8× H100 80GB SXM数据中心 | Q6_K估 | 558 GB / 640 GB | 488 | 48114 | 1.2M |
| 2× AMD MI300X 192GB数据中心 | Q4_K_M | 383 GB / 384 GB | 264 | 15896 | 23K |
| 4× H200 141GB数据中心 | Q6_K估 | 553 GB / 564 GB | 350 | 24057 | 164K |
| 2× B200 192GB数据中心 | Q4_K_M | 383 GB / 384 GB | 399 | 27365 | 23K |
| Mac Studio M3 Ultra 512GB统一内存 | Q5_K_M估 | 474 GB / 490 GB | 16 | 347 | 236K |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程SWE-bench Verified 73.1%、Codeforces 2386(官方)。
推理GPQA Diamond 82.4%、HLE 25.1%(官方)。
数学AIME 2025 93.1%(官方)。
AgentTerminal-bench 37.7%,τ²-bench 80.3%(官方)。
中文中文能力顶级,训练语料中文占比高。
考试型与工程型均衡:AIME 2025 与 GPQA 接近闭源旗舰,SWE-bench Verified 73.1% 属开源第一梯队。思考模式下推理链较长但很少「过度思考」;非思考模式在复杂规划上明显下降。V3.2-Speciale 变体在竞赛题上更强但不适合日常。常见问题:长 agent 任务中工具调用格式偶尔漂移。
- 1.MIT 许可,685B MoE 权重可下,商用无附加条款
- 2.DSA 稀疏注意力:128K 上下文推理成本大幅下降,API 价 $0.28 / $0.42
- 3.思考 / 非思考双模式统一权重,工具调用与推理可交错
- 1.685B 体量,自建门槛 8×80GB 起,不是「开源就能本地跑」
- 2.DSA 为新算子,vLLM / SGLang 需较新版本,llama.cpp 支持滞后
- 3.多模态缺失,纯文本模型
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1424 | LMArena Text (style control) | 2025-12-20 | 独立复测 |
| SWE-bench Verified真实仓库修 bug | 73.1% | DeepSeek-V3.2 模型卡 | 2025-12-20 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 82.4% | DeepSeek-V3.2 模型卡 | 2025-12-20 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 25.1% | DeepSeek-V3.2 模型卡 | 2025-12-20 | 厂商公布 |
| AIME 2025美国数学邀请赛 | 93.1% | DeepSeek-V3.2 模型卡 | 2025-12-20 | 厂商公布 |
| τ²-bench工具调用 agent | 80.3% | DeepSeek-V3.2 模型卡 | 2025-12-20 | 厂商公布 |
| Terminal-Bench终端 agent | 37.7% | DeepSeek-V3.2 模型卡 | 2025-12-20 | 厂商公布 |
| LMArena Chinese Elo中文人类偏好 Elo | 1440 | LMArena Text · Chinese | 2025-12-20 | 独立复测 |
更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。