AI-Gallery
排行榜模型库对比计算器显卡架构图鉴方法论
中

架构图鉴

解释详情页里出现的术语,统一图例:实线 = 已公开,虚线 = 未披露。

01
Dense vs MoE:总参数 vs 激活参数

MoE 模型「1T 总 / 32B 激活」意味着什么:显存按总参数算,算力按激活参数算。

02
GQA / MHA / MLA:注意力与 KV 头

KV 头数直接决定 KV Cache 大小;MLA 用低秩压缩把它再压一个量级。

03
KV Cache 与长上下文显存

上下文 128K 不是免费的:KV Cache 随 序列长度 × 并发 线性增长,经常比权重还大。

04
量化:BF16 / FP8 / Q8 / Q4 在部署上的意义

同一模型四种精度,显存差 4 倍,质量差异从「几乎无损」到「明显退化」。

05
Thinking / 推理模型与普通指令模型

推理模型先写一段思维链再回答;分数更高,但延迟、成本、过度思考都是代价。

06
开源权重 vs 开放许可证 vs 可商用

「权重可下载」「OSI 开源」「可以商用」是三件不同的事,本站分别标注。

AI-Gallery

给工程师和选型者的模型决策站。排行榜当入口,说明书当核心资产;显存、价格与证据等级是一等公民。

GitHub·博客 tanzhuo.xyz
浏览
  • 排行榜
  • 模型库
  • 对比台
  • 显存 / 成本计算器
  • 我的显卡能跑谁
资料
  • 架构图鉴
  • 方法论
  • 更新日志
  • 关于 / 来源声明
数据
站点构建
2026-08-28
数据截止
2026-08-28
价格单位
USD / 1M tok
来源:官方模型卡与定价页、LMArena、Artificial Analysis、Hugging Face 配置文件。
排名供选型参考,基准会饱和、会泄漏、会过时。所有规格以官方来源为准;闭源参数量一律「未披露」。© 2026 AI-Gallery · 开源 MIT · 模型名称与 logo 归各厂商所有