Qwen3.8-2.4T-A95B
通义千问 3.8 · 2.4T-A95B(开源 Max 级) · Alibaba 阿里巴巴 · 发布 2026-08-13 · 当前代
首个可下载的 Max 级 Qwen,2.4T MoE,自定义许可。
- 类型
- MoE
- 注意力
- Gated DeltaNet × 3 + Gated Attention(GQA,64 Q / 4 KV)× 1 交错
- 层数
- 92
- 专家
- 512 · 激活 10 + 共享
- 隐藏维
- 8192
- 词表
- 248,320
92 层 = 23 × (3 × Gated DeltaNet → MoE + 1 × Gated Attention → MoE)。512 路由专家 + 1 共享专家,每 token 激活 10 路由 + 1 共享;专家中间维 2,048。DeltaNet 128 V 头 / 16 QK 头、head_dim 128;全注意力 64 Q / 4 KV、head_dim 256,RoPE 占 1/4。自带 1 层 MTP。表内 kv_heads / head_dim 指 23 层全注意力层。开源权重为纯文本;API 版 Qwen3.8-Max 在同一底座上加了视觉输入、非思考模式与默认 1M 上下文。 上下文:256K(可扩至 1M;API 版默认 1M)。
类型:MoE + 混合注意力,2.4T 总参数 / 95B 激活。
| 项目 | 数值 |
|---|---|
| 层数 | 92 = 23 × (3 × DeltaNet → MoE + 1 × Gated Attention → MoE) |
| 隐藏维 | 8,192 |
| 专家 | 512 路由 + 1 共享,每 token 激活 10 路由 + 1 共享 |
| 专家中间维 | 2,048(共享专家同) |
| 全注意力层 | 23 层,64 Q 头 / 4 KV 头,head_dim 256 |
| 线性注意力层 | 69 层,128 V 头 / 16 QK 头,head_dim 128 |
| RoPE | partial_rotary_factor 0.25(64 维),theta 1e7 |
| 词表 | 248,320(padded) |
| 原生上下文 | 262,144,可扩至 1,010,000 |
| MTP | 1 层 |
config.json:model_type: qwen3_5_moe_text,Qwen3_5MoeForCausalLM,纯文本。
与 Qwen3.8-Max 的关系:模型卡称 Qwen3.8-Max 是「基于 Qwen3.8-2.4T-A95B 的官方版本」,额外具备视觉输入、非思考模式、默认 1M 上下文与内置工具。API 名 qwen3.8-max。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 4890 GB | 官方精度 |
| FP8 | 2500 GB | |
| Q8 | 2600 GB | |
| Q4 | 1310 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 不可行
- 单卡 80GB
- 不可行(单卡)
- 8×80GB 节点
- 不可行(单机 8×80GB = 640 GB,远小于 FP8 2.5 TB);需多节点 H200 / B200 集群,或 IQ4_XS 1.31 TB 于 ≥ 2 台 8×H200
KV Cache:仅 23 层全注意力层有 KV:4 KV 头 × 256 × 2 × 2 B = 4 KiB/层 → 92 KiB/token(BF16)。69 层 DeltaNet 固定递归状态约 0.6 GB / 序列。256K 上下文 KV ≈ 23 GB。q4 一栏为 unsloth UD-IQ4_XS(1.31 TB),无 Q4_K_M。 ≈ 92 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 4.89 TB | 官方 safetensors,213 分片 |
| FP8 | ≈ 2.5 TB | 官方 Qwen3.8-2.4T-A95B-FP8 仓库 |
| Q8 | 2.6 TB | unsloth GGUF Q8_0 |
| IQ4_XS | 1.31 TB | unsloth UD-IQ4_XS |
| IQ2_XXS | 657 GB | unsloth UD-IQ2_XXS |
| IQ1_S | 508 GB | unsloth UD-IQ1_S(质量损失大) |
KV Cache:92 KiB/token(BF16,仅 23 层全注意力层);DeltaNet 状态约 0.6 GB / 序列。256K ≈ 23 GB。
参考配置:
- 24GB / 80GB 单卡:不可行
- 单机 8×80GB:不可行(640 GB < 最小可用量化)
- 多节点:FP8 需 ≥ 3–4 台 8×H200(141GB)级别;IQ4_XS 可在 2 台 8×H200 装下但精度有损
警示:模型卡未给官方硬件建议;上述节点数为按文件大小换算,未含 KV 与并发余量。
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 8× AMD MI300X 192GB数据中心 | Q4_K_M | 1320 GB / 1536 GB | 417 | 24764 | 2.4M |
| 8× B200 192GB数据中心 | Q4_K_M | 1320 GB / 1536 GB | 630 | 42632 | 2.4M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程Terminal Bench 2.1 86.6、SWE-bench Pro 67.7、DeepSWE 1.1 56.6、NL2Repo 55.9(官方模型卡,Qwen3.8-Max)。
推理GPQA Diamond 92.6、HLE 43.6 / 56.2(有工具)(官方模型卡)。
数学AIME 官方未披露。
指令遵循IFBench 82.8(官方模型卡)。
AgentToolathlon Verified 72.5、WideSearch 81.9、Agents' Last Exam 27.0 Pass@1、CoWorkBench 74.8(官方模型卡)。
中文中文旗舰级;PLawBench 73.2。
闭源旗舰级:GPQA Diamond 92.6、HLE 43.6(无工具)/ 56.2(有工具),Artificial Analysis 智能指数 58 仅次于 Anthropic 与 OpenAI 旗舰。强项在长程 Agent:Terminal Bench 2.1 86.6、PaperBench 93.0、DeepSWE 1.1 56.6,均远超上代 Qwen3.7-Max。思考强制开启,reasoning_effort xhigh 默认;AA 实测约 21 tok/s、输出极其冗长,不适合低延迟场景。常见问题:Agents' Last Exam Pass@1 仅 27.0,超长多步任务仍会失误。
- 1.Qwen 首次开放 Max 级权重:2.4T / 95B 激活,官方榜 Terminal Bench 2.1 86.6、GPQA Diamond 92.6
- 2.Artificial Analysis 智能指数 58,Agentic 指数一度全球第一;Text Arena 1479 分(qwen3.8-max)
- 3.3:1 DeltaNet 混合注意力,KV 仅 92 KiB/token,长上下文显存远小于同规模 GQA
- 1.非 Apache-2.0:Qwen3.8-Max License 对 >1 亿 MAU / 月收入 >$2000 万要求展示模型名,MaaS 年收入 >$5000 万需另签许可
- 2.开源权重为纯文本且思考不可关闭;视觉、非思考、1M 默认上下文与内置工具仅 API 版 Qwen3.8-Max 有
- 3.BF16 4.89 TB / FP8 2.5 TB,自建门槛为多节点集群;官方榜单数字来自 API 版 Qwen3.8-Max,开源权重复现可能有差
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1479 | LMArena Text (style control) | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 58 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 92.6% | Qwen3.8-2.4T-A95B 模型卡(Qwen3.8-Max 列) | 2026-08-28 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 43.6% | Qwen3.8-2.4T-A95B 模型卡(Qwen3.8-Max 列) | 2026-08-28 | 厂商公布 |
| Terminal-Bench终端 agent | 86.6% | Qwen3.8-2.4T-A95B 模型卡(Qwen3.8-Max 列) | 2026-08-28 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 58 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 93.5% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 42.4% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 51.6% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 82% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 49.1% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1538 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。