架构图鉴

Dense vs MoE:总参数 vs 激活参数

MoE 模型「1T 总 / 32B 激活」意味着什么:显存按总参数算,算力按激活参数算。

一句话

Dense:每个 token 经过全部参数。MoE(Mixture of Experts):FFN 层被拆成 N 个「专家」,路由器为每个 token 只挑 k 个跑。

两个数字,两种成本

决定什么例子(Kimi K2)
总参数显存:权重要全部驻留1T → INT4 也要 594 GB
激活参数算力 / 延迟:每 token 的 FLOPs32B → 解码速度接近 32B Dense

所以「开源 1T 模型」并不意味着你能在家跑;「3B 激活」也不意味着它是 3B 模型(Qwen3-30B-A3B 权重仍要 18.6 GB Q4)。

常见设计参数

  • 专家数 / 激活数:DeepSeek-V3 256/8,Qwen3-235B 128/8,Qwen3-Next 512/10,gpt-oss 128/4。专家越多越细粒度,对推理引擎的专家并行要求越高。
  • 共享专家:DeepSeek / GLM / Kimi 有 1 个永远激活的共享专家,负责通用知识,路由专家负责专门化。Qwen3 系列没有。
  • 路由方式:top-k 门控 + 负载均衡损失(或 DeepSeek 的无辅助损失策略)。

对部署的影响

  1. 显存按总参数准备,KV Cache 按层数与注意力配置准备。
  2. 低并发时 MoE 的吞吐优势明显;高并发时专家负载不均会拖慢。
  3. 量化:MoE 专家权重对 4-bit 相对友好(Kimi K2 直接以 INT4 QAT 发布)。
  4. CPU offload 专家(如 KTransformers)可在单卡 + 大内存上跑 1T 模型,但速度只有几 tok/s。