方法论
榜单没有方法论就没有信任。这里是全部规则,代码里的算法与本页一致。
1. 数据来源与截止日期
- 本站没有自动抓取。所有分数、价格、规格都是仓库里的静态文件(
data/models/*.json、data/scores.json),由维护者手工更新后重新构建。 - 每条分数带
source、source_url、as_of、evidence。页面上任何数字都能追溯到这四项,或明确标「估计」/「未披露」。 - 当前快照数据截止 2026-08-28,站点构建于 2026-08-28。
分数与价格为仓库内手工维护的静态快照,来源与日期见每条记录。2026 年当前代模型数据于 2026-08-28 联网核对;被替代的旧代模型保留 2025-12 快照供对照。AA 指数为 v4.x 口径,旧代模型的 v3 指数已移除以免混比;Terminal-Bench 列混合 2.0 / 2.1 版本,详情页来源处可见。
2. 综合参考分怎么算
「综合参考分」只是默认排序键,不是真理。榜单同时展示 Arena Elo、AA 指数、代码、推理等原始分,详情页列出全部来源。
score = 0.35 × norm(independent_index)
+ 0.25 × norm(arena_elo)
+ 0.20 × norm(coding)
+ 0.20 × norm(reasoning)
independent_index = Artificial Analysis Intelligence Index
arena_elo = LMArena Text Elo (style control)
coding = SWE-bench Verified,缺则 LiveCodeBench
reasoning = GPQA Diamond,缺则 HLE
norm:在当前榜单集合(综合 / 开源 / 闭源分别)内做 min-max 归一到 0–100。开源榜与闭源榜分别归一化,避免开源被闭源绝对值压死;综合榜用全集归一化。- 缺项:该分量不计入,权重按现有项重分配,并在表格里标「部分」。已有分量权重之和 < 0.45(即只有一个分量)时不给参考分,只显示原始分,避免单一厂商数字把模型顶到榜首。
- 场景榜:对应场景权重提到 0.55,其余三项均分 0.45。
- 性价比:
score / log10(输入价格 × 10 + 2),只含有公开价格的模型。开源模型若无官方 API,使用第三方托管常见价并标「托管」。 - 单卡可跑:开源 + Q4 权重 × 1.1 ≤ 24 GB。
- 同分:先比独立复测条数,再比更新日期,再比名称字母序。
3. 开源 / 闭源分列
同时满足以下两条进「开源」:权重可下载;weights_available = true。仅 API、或「承诺开源但未放权重」归入闭源。许可证另列,「开源权重」≠「OSI 开源许可」≠「可商用」,见 架构图鉴 · 开源权重 vs 开放许可证。
4. 证据等级
| 等级 | 含义 | UI |
|---|---|---|
| official | 厂商公布(模型卡 / 发布公告) | ○ 灰 |
| independent | 第三方独立复测(LMArena、Artificial Analysis 等) | ● 绿 |
| community | 社区复测或本站估算 | ◐ 黄 |
| unknown | 缺失 | — |
厂商自称的数字一律标 official,不写成独立复测。
5. 显存估算假设
weight_mem ≈ params_b × bytes_per_param × 1.08
kv_mem ≈ layers × kv_heads × head_dim × 2 × seq × batch × dtype_bytes × 1.2
bytes_per_param:BF16 2 · FP8 1 · Q8 1.06 · Q6 0.8 · Q5 0.69 · Q4 0.58。有官方 / 社区文件大小时优先用实际值。MLA 按 576 维潜向量等效;混合线性注意力只对全注意力层计 KV;滑窗模型只计全局层。缺层数 / 头数 → 「KV 未建模」。
5.1 硬件配置与吞吐估算
占用 = 权重(量化) + KV(上下文) + 1.2 GB × 卡数
解码 tok/s = 带宽 × 卡数 × eff ÷ (激活参数 × 每参数字节 + KV/token × 上下文) eff:单卡 0.65 / 多卡 0.55 / 统一内存 0.5
预填充 = FP16 TFLOPS × 卡数 × 0.45 ÷ (2 × 激活参数)
显卡规格在 data/hardware.json。「最低可跑」= 8K 上下文下最便宜的可行配置;「推荐」= 能以 ≥Q8/FP8 跑 32K 上下文且 ≥15 tok/s 的最便宜配置。MoE 解码只读激活参数,权重全部驻留显存。误差 ±30%,多卡 PCIe 环境再打折。
6. 「未披露」政策
闭源模型的参数量、层数、架构一律写「未披露」,不猜、不引用传闻。厂商官方明确说过的(如「稀疏 MoE」「超过 1T」)按原话写并注明。
7. 收录的基准
- LMArena Text Elo(人类偏好 Elo,arena):LMArena 文本盲测人类偏好,style control 版。
- Artificial Analysis Intelligence Index(AA 综合指数,overall):Artificial Analysis 第三方综合评测指数(v4.x,2026-08 口径)。
- SWE-bench Verified(真实仓库修 bug,coding)
- LiveCodeBench(竞赛编程,coding)
- GPQA Diamond(研究生级科学问答,reasoning)
- Humanity's Last Exam(人类最后考试,reasoning):无工具版本除非标注。
- AIME 2025(美国数学邀请赛,math)
- τ²-bench(工具调用 agent,agent)
- Terminal-Bench(终端 agent,agent):终端 agent 任务完成率。2026 年厂商多报 Terminal-Bench 2.1,旧条目为 2.0,版本混用请看来源。
- MMMU(多模态理解,multimodal)
- LMArena Chinese Elo(中文人类偏好 Elo,chinese)
- AIME 2026(美国数学邀请赛 2026,math)
- Terminal-Bench Hard(终端 agent(AA 困难子集),agent):Artificial Analysis 统一复测的 Terminal-Bench 困难子集。
- τ²-Bench Telecom(工具调用 agent(电信域),agent)
- MMMU-Pro(多模态理解(Pro),multimodal)
- SciCode(科学计算编程,coding)
- IFBench(指令遵循,knowledge)
- τ³-Bench Banking(工具调用 agent(银行域),agent):Artificial Analysis 指数 v4 的 agent 分量。
8. 更新与联系
数据更新 = 改仓库 JSON → 重新构建 → 部署。发现错误请在仓库提 issue / PR。
排名供选型参考,基准会饱和、会泄漏、会过时。