Qwen3-235B-A22B-Thinking-2507
通义千问 3 · 235B 推理版 · Alibaba 阿里巴巴 · 发布 2025-07-25 · 已被替代 → Qwen3.8-2.4T-A95B
Apache-2.0 的 MoE 推理旗舰,中文与数学突出。
- 类型
- MoE
- 注意力
- GQA(64 Q 头 / 4 KV 头)
- 层数
- 94
- 专家
- 128 · 激活 8
- 隐藏维
- 4096
- 词表
- 151,936
无共享专家;QK-Norm;原生 262K 上下文,YaRN 可扩至 1M(需引擎支持)。
类型:MoE,235B 总 / 22B 激活。
- 94 层,隐藏维 4096,词表 151,936
- 专家:128 个,每 token 激活 8 个,无共享专家
- 注意力:GQA,64 Query 头 / 4 KV 头,head_dim 128,QK-Norm
- 上下文:原生 262,144;YaRN factor 4 可到 1M(vLLM/SGLang 需显式配置)
- 与 Instruct-2507 共享结构,仅后训练不同
参考:Qwen3 技术报告(arXiv 2505.09388)。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 470 GB估 | 官方精度 |
| FP8 | 235 GB估 | |
| Q8 | 250 GB估 | |
| Q4 | 142 GB估 | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 不可行
- 单卡 80GB
- 不可行(Q4 142 GB);2×80GB Q4 可跑但上下文受限
- 8×80GB 节点
- BF16 / FP8 舒适,官方 FP8 版本推荐
KV Cache:GQA 4 KV 头 × 128 × 2 × 94 层 × 2 B ≈ 188 KiB/token。128K 上下文单请求 ≈ 23 GB。 ≈ 188 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 参考显存 | 说明 |
|---|---|---|---|
| BF16 | ≈ 470 GB | 8×80GB | 官方 safetensors |
| FP8 | ≈ 235 GB | 4×80GB | 官方 FP8 版本 |
| Q8 | ≈ 250 GB(估) | 4×80GB | GGUF Q8_0 |
| Q4 | ≈ 142 GB(估) | 2×80GB | GGUF Q4_K_M(unsloth) |
KV Cache:≈ 188 KiB/token(BF16)。128K 上下文 ≈ 23 GB;Thinking 模式输出常达 30K+,请留足。
参考配置:
- 24GB:不可行
- 单卡 80GB:不可行
- 8×H100:BF16 舒适,FP8 可服务较高并发
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 8× L4 24GB工作站 | Q5_K_M估 | 173 GB / 192 GB | 79 | 4909 | 110K |
| 4× RTX A6000 48GB工作站 | Q5_K_M估 | 168 GB / 192 GB | 101 | 3150 | 136K |
| 4× RTX 6000 Ada 48GB工作站 | Q5_K_M估 | 168 GB / 192 GB | 126 | 3723 | 136K |
| 4× L40S 48GB工作站 | Q5_K_M估 | 168 GB / 192 GB | 113 | 3723 | 136K |
| 2× RTX PRO 6000 Blackwell 96GB工作站 | Q6_K估 | 192 GB / 192 GB | 103 | 5114 | 9K |
| 8× A10 24GB数据中心 | Q5_K_M估 | 173 GB / 192 GB | 158 | 5073 | 110K |
| 4× A100 40GB数据中心 | Q4_K_M | 148 GB / 160 GB | 239 | 12764 | 72K |
| 2× A100 80GB数据中心 | Q4_K_M | 146 GB / 160 GB | 156 | 6382 | 85K |
| 2× H20 96GB数据中心 | Q6_K估 | 192 GB / 192 GB | 229 | 1514 | 9K |
| 4× 昇腾 Ascend 910B 64GB数据中心 | FP8 | 241 GB / 256 GB | 154 | 11455 | 176K |
| 2× H100 80GB PCIe数据中心 | Q4_K_M | 146 GB / 160 GB | 153 | 15464 | 85K |
| 2× H100 80GB SXM数据中心 | Q4_K_M | 146 GB / 160 GB | 257 | 20230 | 85K |
| AMD MI300X 192GB数据中心 | Q6_K估 | 191 GB / 192 GB | 180 | 13367 | 15K |
| 2× H200 141GB数据中心 | FP8 | 238 GB / 282 GB | 232 | 20230 | 486K |
| B200 192GB数据中心 | Q6_K估 | 191 GB / 192 GB | 271 | 23011 | 15K |
| 2× DGX Spark 128GB统一内存 | FP8 | 238 GB / 240 GB | 12 | 1268 | 28K |
| Mac Studio M3 Ultra 256GB统一内存 | FP8 | 237 GB / 240 GB | 18 | 583 | 41K |
| Mac Studio M3 Ultra 512GB统一内存 | BF16 | 473 GB / 490 GB | 9.0 | 583 | 102K |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程LiveCodeBench v6 74.1%(官方);工程任务用 Qwen3-Coder。
推理GPQA Diamond 81.1%、HLE 18.2%(官方)。
数学AIME 2025 92.3%、HMMT 83.9%(官方)。
AgentBFCL-v3 71.9%、TAU2 ~ 70(官方)。
中文C-Eval / 中文 SimpleQA 开源顶级。
考试型推理非常强(AIME、HMMT、GPQA),且喜欢写很长的思考链——对简单问题也会「想很久」,这是它的主要坑。工程型推理(SWE-bench)弱于同期闭源模型,也弱于专门的 Qwen3-Coder。中文逻辑题与阅读理解在开源里顶级。
- 1.Apache-2.0,权重可下、商用无附加条件
- 2.AIME 2025 92.3%,开源模型里少数能跟上闭源旗舰的数学能力
- 3.22B 激活参数,吞吐远优于同能力的 Dense 模型
- 1.Thinking 版默认输出大量思考 token,短任务成本高(用 Instruct-2507 版)
- 2.235B 权重,单卡 80GB 装不下 Q4,实际门槛 2×80GB 起
- 3.无共享专家 + 128 专家,对推理引擎的专家并行要求高
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1420 | LMArena Text (style control) | 2025-12-20 | 独立复测 |
| LiveCodeBench竞赛编程 | 74.1% | Qwen3-235B-A22B-Thinking-2507 模型卡 | 2025-12-20 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 81.1% | Qwen3-235B-A22B-Thinking-2507 模型卡 | 2025-12-20 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 18.2% | Qwen3-235B-A22B-Thinking-2507 模型卡 | 2025-12-20 | 厂商公布 |
| AIME 2025美国数学邀请赛 | 92.3% | Qwen3-235B-A22B-Thinking-2507 模型卡 | 2025-12-20 | 厂商公布 |
| τ²-bench工具调用 agent | 70% | Qwen3-235B-A22B-Thinking-2507 模型卡 | 2025-12-20 | 厂商公布 |
| LMArena Chinese Elo中文人类偏好 Elo | 1425 | LMArena Text · Chinese | 2025-12-20 | 独立复测 |
更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。