开源权重可下推理模型限制许可 · Qwen3.8-Max License
Alibaba logo

Qwen3.8-2.4T-A95B

通义千问 3.8 · 2.4T-A95B(开源 Max 级) · Alibaba 阿里巴巴 · 发布 2026-08-13 · 当前代

首个可下载的 Max 级 Qwen,2.4T MoE,自定义许可。

参数
2.4T 总 / 95B 激活
MOE
上下文
256K
输出 128K
价格 / 1M tok
$2.00 / $6.00
阿里云 Model Stud · 2026-08-28
最低可跑
8× AMD MI300X
Q4_K_M · 1320 GB · ≈417 tok/s
Arena Elo1479
2026-08-28
AA 综合指数58
2026-08-28
代码
GPQA 推理93.5
2026-08-28
类型
MoE
注意力
Gated DeltaNet × 3 + Gated Attention(GQA,64 Q / 4 KV)× 1 交错
层数
92
专家
512 · 激活 10 + 共享
隐藏维
8192
词表
248,320

92 层 = 23 × (3 × Gated DeltaNet → MoE + 1 × Gated Attention → MoE)。512 路由专家 + 1 共享专家,每 token 激活 10 路由 + 1 共享;专家中间维 2,048。DeltaNet 128 V 头 / 16 QK 头、head_dim 128;全注意力 64 Q / 4 KV、head_dim 256,RoPE 占 1/4。自带 1 层 MTP。表内 kv_heads / head_dim 指 23 层全注意力层。开源权重为纯文本;API 版 Qwen3.8-Max 在同一底座上加了视觉输入、非思考模式与默认 1M 上下文。 上下文:256K(可扩至 1M;API 版默认 1M)。

类型:MoE + 混合注意力,2.4T 总参数 / 95B 激活。

项目数值
层数92 = 23 × (3 × DeltaNet → MoE + 1 × Gated Attention → MoE)
隐藏维8,192
专家512 路由 + 1 共享,每 token 激活 10 路由 + 1 共享
专家中间维2,048(共享专家同)
全注意力层23 层,64 Q 头 / 4 KV 头,head_dim 256
线性注意力层69 层,128 V 头 / 16 QK 头,head_dim 128
RoPEpartial_rotary_factor 0.25(64 维),theta 1e7
词表248,320(padded)
原生上下文262,144,可扩至 1,010,000
MTP1 层

config.jsonmodel_type: qwen3_5_moe_textQwen3_5MoeForCausalLM,纯文本。

与 Qwen3.8-Max 的关系:模型卡称 Qwen3.8-Max 是「基于 Qwen3.8-2.4T-A95B 的官方版本」,额外具备视觉输入、非思考模式、默认 1M 上下文与内置工具。API 名 qwen3.8-max

Token Embedding词表 248,320× 92 层(23 层全注意力)注意力:Gated DeltaNet × 3 + Gated AttentionKV 头 4 · head_dim 256路由top-10E1E2E3共享专家512 专家 · 激活 10 · d=8192LM Head2.4T / 95B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF164890 GB官方精度
FP82500 GB
Q82600 GB
Q41310 GBGGUF Q4_K_M 或等效
消费级 24GB
不可行
单卡 80GB
不可行(单卡)
8×80GB 节点
不可行(单机 8×80GB = 640 GB,远小于 FP8 2.5 TB);需多节点 H200 / B200 集群,或 IQ4_XS 1.31 TB 于 ≥ 2 台 8×H200

KV Cache:仅 23 层全注意力层有 KV:4 KV 头 × 256 × 2 × 2 B = 4 KiB/层 → 92 KiB/token(BF16)。69 层 DeltaNet 固定递归状态约 0.6 GB / 序列。256K 上下文 KV ≈ 23 GB。q4 一栏为 unsloth UD-IQ4_XS(1.31 TB),无 Q4_K_M。92 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小说明
BF164.89 TB官方 safetensors,213 分片
FP8≈ 2.5 TB官方 Qwen3.8-2.4T-A95B-FP8 仓库
Q82.6 TBunsloth GGUF Q8_0
IQ4_XS1.31 TBunsloth UD-IQ4_XS
IQ2_XXS657 GBunsloth UD-IQ2_XXS
IQ1_S508 GBunsloth UD-IQ1_S(质量损失大)

KV Cache:92 KiB/token(BF16,仅 23 层全注意力层);DeltaNet 状态约 0.6 GB / 序列。256K ≈ 23 GB。

参考配置

  • 24GB / 80GB 单卡:不可行
  • 单机 8×80GB:不可行(640 GB < 最小可用量化)
  • 多节点:FP8 需 ≥ 3–4 台 8×H200(141GB)级别;IQ4_XS 可在 2 台 8×H200 装下但精度有损

警示:模型卡未给官方硬件建议;上述节点数为按文件大小换算,未含 KV 与并发余量。

硬件配置与预估吞吐
最低可跑(8K 上下文)
8 × AMD MI300X 192GB
云 ≈$3/h × 8 · 合计 ≈¥2,000,000 · 数据中心
量化
Q4_K_M
解码
417 tok/s
最大上下文
2.4M
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
在本站硬件表内无可行配置(需多节点或权重未知)
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
8× AMD MI300X 192GB数据中心Q4_K_M1320 GB / 1536 GB417247642.4M
8× B200 192GB数据中心Q4_K_M1320 GB / 1536 GB630426322.4M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程Terminal Bench 2.1 86.6、SWE-bench Pro 67.7、DeepSWE 1.1 56.6、NL2Repo 55.9(官方模型卡,Qwen3.8-Max)。

推理GPQA Diamond 92.6、HLE 43.6 / 56.2(有工具)(官方模型卡)。

数学AIME 官方未披露。

指令遵循IFBench 82.8(官方模型卡)。

AgentToolathlon Verified 72.5、WideSearch 81.9、Agents' Last Exam 27.0 Pass@1、CoWorkBench 74.8(官方模型卡)。

中文中文旗舰级;PLawBench 73.2。

逻辑能力

闭源旗舰级:GPQA Diamond 92.6、HLE 43.6(无工具)/ 56.2(有工具),Artificial Analysis 智能指数 58 仅次于 Anthropic 与 OpenAI 旗舰。强项在长程 Agent:Terminal Bench 2.1 86.6、PaperBench 93.0、DeepSWE 1.1 56.6,均远超上代 Qwen3.7-Max。思考强制开启,reasoning_effort xhigh 默认;AA 实测约 21 tok/s、输出极其冗长,不适合低延迟场景。常见问题:Agents' Last Exam Pass@1 仅 27.0,超长多步任务仍会失误。

亮点
  1. 1.Qwen 首次开放 Max 级权重:2.4T / 95B 激活,官方榜 Terminal Bench 2.1 86.6、GPQA Diamond 92.6
  2. 2.Artificial Analysis 智能指数 58,Agentic 指数一度全球第一;Text Arena 1479 分(qwen3.8-max)
  3. 3.3:1 DeltaNet 混合注意力,KV 仅 92 KiB/token,长上下文显存远小于同规模 GQA
  1. 1.非 Apache-2.0:Qwen3.8-Max License 对 >1 亿 MAU / 月收入 >$2000 万要求展示模型名,MaaS 年收入 >$5000 万需另签许可
  2. 2.开源权重为纯文本且思考不可关闭;视觉、非思考、1M 默认上下文与内置工具仅 API 版 Qwen3.8-Max 有
  3. 3.BF16 4.89 TB / FP8 2.5 TB,自建门槛为多节点集群;官方榜单数字来自 API 版 Qwen3.8-Max,开源权重复现可能有差
适合:超大规模自建旗舰推理(有集群) · 长程 Coding / Office Agent · 通过 Qwen3.8-Max API 低价替代闭源旗舰
不适合:单机部署 · 需要视觉输入的开源自建(用 27B) · MaaS 大厂(许可限制)
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1479LMArena Text (style control)2026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数58Artificial Analysis Intelligence Index v32026-08-28独立复测
GPQA Diamond研究生级科学问答92.6%Qwen3.8-2.4T-A95B 模型卡(Qwen3.8-Max 列)2026-08-28厂商公布
Humanity's Last Exam人类最后考试43.6%Qwen3.8-2.4T-A95B 模型卡(Qwen3.8-Max 列)2026-08-28厂商公布
Terminal-Bench终端 agent86.6%Qwen3.8-2.4T-A95B 模型卡(Qwen3.8-Max 列)2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数58Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答93.5%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试42.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程51.6%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent82%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)49.1%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1538LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。