架构图鉴
解释详情页里出现的术语,统一图例:实线 = 已公开,虚线 = 未披露。
01
Dense vs MoE:总参数 vs 激活参数
MoE 模型「1T 总 / 32B 激活」意味着什么:显存按总参数算,算力按激活参数算。
02
GQA / MHA / MLA:注意力与 KV 头
KV 头数直接决定 KV Cache 大小;MLA 用低秩压缩把它再压一个量级。
03
KV Cache 与长上下文显存
上下文 128K 不是免费的:KV Cache 随 序列长度 × 并发 线性增长,经常比权重还大。
04
量化:BF16 / FP8 / Q8 / Q4 在部署上的意义
同一模型四种精度,显存差 4 倍,质量差异从「几乎无损」到「明显退化」。
05
Thinking / 推理模型与普通指令模型
推理模型先写一段思维链再回答;分数更高,但延迟、成本、过度思考都是代价。
06
开源权重 vs 开放许可证 vs 可商用
「权重可下载」「OSI 开源」「可以商用」是三件不同的事,本站分别标注。