开源权重可下推理模型·可关已被替代可商用 · MIT
DeepSeek logo

DeepSeek-V3.2

深度求索 V3.2 · DeepSeek 深度求索 · 发布 2025-12-01 · 已被替代DeepSeek-V4-Pro

MIT 许可的开源旗舰,稀疏注意力把长上下文成本压到闭源 1/10。

参数
685B 总 / 37B 激活
MOE
上下文
128K
输出 64K
价格 / 1M tok
$0.28 / $0.42
DeepSeek 官方 AP · 2025-12-20
最低可跑
Mac Studio M3 Ultra
Q5_K_M · 474 GB · ≈16 tok/s
Arena Elo1424
2025-12-20
AA 综合指数
真实仓库修 bug73.1
2025-12-20
GPQA 推理82.4
2025-12-20
类型
MoE
注意力
MLA + DSA(DeepSeek Sparse Attention)
层数
61
专家
256 · 激活 8 + 共享
隐藏维
7168
词表
129,280

在 V3.1-Terminus 基础上引入 DSA:lightning indexer 为每个 query 选 top-k 键,把注意力复杂度从 O(L²) 降到 O(L·k)。MLA 的 KV 压缩为 512 维潜向量 + 64 维 RoPE(表内 kv_heads=1、head_dim=288 为等效换算)。

类型:MoE,685B 总参数 / 37B 激活。

  • 61 层,隐藏维 7168,词表 129,280
  • 专家:256 路由专家 + 1 共享专家,每 token 激活 8 个路由专家
  • 注意力:MLA(Multi-head Latent Attention):KV 压缩到 512 维潜向量 + 64 维解耦 RoPE
  • DSA(DeepSeek Sparse Attention):轻量 indexer 打分,每个 query 只对 top-2048 个键做注意力
  • 上下文 128K;RoPE 用 YaRN 扩展
  • MTP(多 token 预测)头可用于投机解码

参考:DeepSeek-V3 技术报告、V3.2 技术报告(GitHub)。

Token Embedding词表 129,280× 61 层注意力:MLA + DSAKV 头 1 · head_dim 288路由top-8E1E2E3共享专家256 专家 · 激活 8 · d=7168LM Head685B / 37B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF16暂无
FP8690 GB
Q8暂无
Q4380 GBGGUF Q4_K_M 或等效
消费级 24GB
不可行
单卡 80GB
不可行(单卡)
8×80GB 节点
FP8 权重 690 GB,8×H100/H200 可部署;官方推荐 H200 或 8×H100 + FP8

KV Cache:MLA:每 token 每层约 576 维 × 2 B ≈ 1.1 KiB,61 层 ≈ 70 KiB/token(远低于同规模 GQA)。70 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小说明
FP8≈ 690 GB官方原生发布精度
BF16≈ 1.37 TB由 FP8 反量化,通常不这么跑
Q4≈ 380 GB(估)llama.cpp / AWQ 社区量化

KV Cache:MLA 每 token 每层约 576 维 → 61 层 ≈ 70 KiB/token(BF16)。128K 上下文单请求 ≈ 8.8 GB,比同规模 GQA 小一个量级。

参考配置

  • 消费级 24GB:不可行
  • 单卡 80GB:不可行
  • 8×H100 80GB:FP8 可部署,剩余显存留给 KV,高并发建议 H200

警示:能加载 ≠ 能高并发。DSA 的 indexer 也占算力。

硬件配置与预估吞吐
最低可跑(8K 上下文)
Mac Studio M3 Ultra 512GB
≈¥75,000 · 合计 ≈¥75,000 · 统一内存
量化
Q5_K_M
解码
16 tok/s
最大上下文
236K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
8 × RTX PRO 6000 Blackwell 96GB
≈¥70,000 × 8 · 合计 ≈¥560,000 · 工作站
量化
FP8
解码
207 tok/s
最大上下文
2.0M
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
8× RTX PRO 6000 Blackwell 96GB工作站FP8700 GB / 768 GB211121622.0M
8× A100 80GB数据中心Q6_K558 GB / 640 GB297151781.2M
8× H20 96GB数据中心FP8700 GB / 768 GB47236002.0M
8× 昇腾 Ascend 910B 64GB数据中心Q5_K_M483 GB / 512 GB27013622435K
8× H100 80GB PCIe数据中心Q6_K558 GB / 640 GB292367781.2M
8× H100 80GB SXM数据中心Q6_K558 GB / 640 GB488481141.2M
2× AMD MI300X 192GB数据中心Q4_K_M383 GB / 384 GB2641589623K
4× H200 141GB数据中心Q6_K553 GB / 564 GB35024057164K
2× B200 192GB数据中心Q4_K_M383 GB / 384 GB3992736523K
Mac Studio M3 Ultra 512GB统一内存Q5_K_M474 GB / 490 GB16347236K

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程SWE-bench Verified 73.1%、Codeforces 2386(官方)。

推理GPQA Diamond 82.4%、HLE 25.1%(官方)。

数学AIME 2025 93.1%(官方)。

AgentTerminal-bench 37.7%,τ²-bench 80.3%(官方)。

中文中文能力顶级,训练语料中文占比高。

逻辑能力

考试型与工程型均衡:AIME 2025 与 GPQA 接近闭源旗舰,SWE-bench Verified 73.1% 属开源第一梯队。思考模式下推理链较长但很少「过度思考」;非思考模式在复杂规划上明显下降。V3.2-Speciale 变体在竞赛题上更强但不适合日常。常见问题:长 agent 任务中工具调用格式偶尔漂移。

亮点
  1. 1.MIT 许可,685B MoE 权重可下,商用无附加条款
  2. 2.DSA 稀疏注意力:128K 上下文推理成本大幅下降,API 价 $0.28 / $0.42
  3. 3.思考 / 非思考双模式统一权重,工具调用与推理可交错
  1. 1.685B 体量,自建门槛 8×80GB 起,不是「开源就能本地跑」
  2. 2.DSA 为新算子,vLLM / SGLang 需较新版本,llama.cpp 支持滞后
  3. 3.多模态缺失,纯文本模型
适合:自建高吞吐推理服务 · 低成本 API 替代闭源 · 长上下文文档处理
不适合:单卡 / 消费级部署 · 需要视觉输入
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1424LMArena Text (style control)2025-12-20独立复测
SWE-bench Verified真实仓库修 bug73.1%DeepSeek-V3.2 模型卡2025-12-20厂商公布
GPQA Diamond研究生级科学问答82.4%DeepSeek-V3.2 模型卡2025-12-20厂商公布
Humanity's Last Exam人类最后考试25.1%DeepSeek-V3.2 模型卡2025-12-20厂商公布
AIME 2025美国数学邀请赛93.1%DeepSeek-V3.2 模型卡2025-12-20厂商公布
τ²-bench工具调用 agent80.3%DeepSeek-V3.2 模型卡2025-12-20厂商公布
Terminal-Bench终端 agent37.7%DeepSeek-V3.2 模型卡2025-12-20厂商公布
LMArena Chinese Elo中文人类偏好 Elo1440LMArena Text · Chinese2025-12-20独立复测

更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。