计算器

全部在浏览器内计算,纯函数,假设写在底部。

查看 Qwen3-32B 说明书 →
权重
21 GB
Q4_K_M
KV Cache
9.6 GB
32K × 1
合计(估)
30 GB
建议
48 GB(A6000 / L40S / 双 24GB)
装不下
29 GB / 24 GB
解码
batch=1
预填充
本次假设
  • 权重:使用数据表中 Q4_K_M 文件大小 19.8 GB × 1.04 运行开销
  • KV ≈ 64 层 × 8 KV头 × 128 head_dim × 2(K,V) × 32,768 tok × 1 并发 × 2 B × 1.2 碎片系数

模型页备注:8 KV 头 × 128 × 2 × 64 层 × 2 B = 256 KiB/token。32K 上下文 ≈ 8 GB。

公式与假设

MVP 简化公式;能加载 ≠ 能在满上下文 / 高并发下舒服跑。

weight_mem ≈ params_b × bytes_per_param × 1.08
kv_mem     ≈ layers × kv_heads × head_dim × 2 × seq × batch × dtype_bytes × 1.2

bytes_per_param: BF16=2  FP8=1  Q8_0=1.06  Q6_K=0.8  Q5_K_M=0.69  Q4_K_M=0.58
· 若数据表有官方 / 社区 GGUF 文件大小,优先用该值 × 1.04
· MoE 权重全部驻留显存(不做专家 offload)
· KV dtype:BF16/Q 系列按 2 B,FP8 按 1 B(FP8 KV)
· MLA 模型(DeepSeek / Kimi)按 kv_heads=1、head_dim=288 等效换算 576 维潜向量
· 混合线性注意力(Qwen3-Next)只对全注意力层计 KV
· 滑窗模型(Gemma 3 / gpt-oss)只对全局层计 KV,滑窗层视为常数
· 不含 CUDA context(~0.5–1 GB)、激活、投机解码 draft 模型