开源权重可下推理模型单卡可跑已被替代可商用 · Apache-2.0
Alibaba logo

Qwen3-30B-A3B-Thinking-2507

通义千问 3 · 30B 小 MoE 推理版 · Alibaba 阿里巴巴 · 发布 2025-07-30 · 已被替代Qwen3.8-27B

3B 激活的小 MoE,单卡跑出 32B 级推理,速度快 3 倍。

参数
30.5B 总 / 3.3B 激活
MOE
上下文
256K
输出 80K
价格 / 1M tok
$0.08 / $0.30
第三方托管常见价 · 2025-12-20
最低可跑
2× RTX 3060
Q4_K_M · 22 GB · ≈146 tok/s
Arena Elo1370
2025-12-20
AA 综合指数
竞赛编程66
2025-12-20
GPQA 推理73.4
2025-12-20
类型
MoE
注意力
GQA(32 Q 头 / 4 KV 头)
层数
48
专家
128 · 激活 8
隐藏维
2048
词表
151,936

每 token 只算 3.3B,CPU / Apple Silicon 也能有可用速度。原生 262K 上下文。

类型:MoE,30.5B 总 / 3.3B 激活。

  • 48 层,隐藏维 2048,词表 151,936
  • 专家:128 个,每 token 激活 8 个,无共享专家
  • GQA:32 Q 头 / 4 KV 头,head_dim 128
  • 上下文:原生 262,144

参考:Qwen3 技术报告。

Token Embedding词表 151,936× 48 层注意力:GQAKV 头 4 · head_dim 128路由top-8E1E2E3128 专家 · 激活 8 · d=2048LM Head30.5B / 3.3B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF1661 GB官方精度
FP831 GB
Q833 GB
Q419 GBGGUF Q4_K_M 或等效
消费级 24GB
Q4_K_M 18.6 GB,剩 ~5 GB 给 KV ≈ 40K 上下文;生成速度 100+ tok/s
单卡 80GB
BF16 61 GB 可跑,KV 余量 ~15 GB
8×80GB 节点
过剩

KV Cache:4 KV 头 × 128 × 2 × 48 层 × 2 B = 96 KiB/token。96 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考显存说明
BF1661 GB80GB官方
FP8≈ 31 GB48GB官方 FP8 版
Q832.5 GB48GBGGUF
Q418.6 GB24GBGGUF Q4_K_M

KV Cache:96 KiB/token,128K 上下文 ≈ 12 GB。

参考配置

  • 24GB:Q4,~40K 上下文
  • 80GB:BF16,128K 上下文可行
  • Mac 64GB 统一内存:Q8 舒适
硬件配置与预估吞吐
最低可跑(8K 上下文)
2 × RTX 3060 12GB
≈¥2,000 × 2 · 合计 ≈¥4,000 · 消费级
量化
Q4_K_M
解码
146 tok/s
最大上下文
32K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
Mac M4 Pro 64GB
≈¥25,000 · 合计 ≈¥25,000 · 统一内存
量化
FP8
解码
28 tok/s
最大上下文
508K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
2× RTX 3060 12GB消费级Q4_K_M22 GB / 24 GB146340932K
2× RTX 4060 Ti 16GB消费级Q6_K28 GB / 32 GB92300055K
RTX 3090 24GB消费级Q5_K_M23 GB / 24 GB197484119K
2× RTX 4070 Ti Super 16GB消费级Q6_K28 GB / 32 GB215600055K
2× RTX 5070 Ti 16GB消费级Q6_K28 GB / 32 GB2861200055K
2× RTX 4080 Super 16GB消费级Q6_K28 GB / 32 GB235709155K
2× RTX 5080 16GB消费级Q6_K28 GB / 32 GB3071527355K
RTX 4090 24GB消费级Q5_K_M23 GB / 24 GB2131125019K
RTX 5090 32GB消费级Q6_K26 GB / 32 GB3381431868K
L4 24GB工作站Q5_K_M23 GB / 24 GB63409119K
RTX A6000 48GB工作站FP833 GB / 48 GB1355250337K
RTX 6000 Ada 48GB工作站FP833 GB / 48 GB1696205337K
L40S 48GB工作站FP833 GB / 48 GB1526205337K
RTX PRO 6000 Blackwell 96GB工作站BF1663 GB / 96 GB15717045361K
A10 24GB数据中心Q5_K_M23 GB / 24 GB127422719K
A100 40GB数据中心FP833 GB / 40 GB27321273166K
A100 80GB数据中心BF1663 GB / 80 GB17921273190K
H20 96GB数据中心BF1663 GB / 96 GB3515045361K
昇腾 Ascend 910B 64GB数据中心BF1663 GB / 64 GB1401909119K
H100 80GB PCIe数据中心BF1663 GB / 80 GB17651545190K
H100 80GB SXM数据中心BF1663 GB / 80 GB29467432190K
AMD MI300X 192GB数据中心BF1663 GB / 192 GB465891141.4M
H200 141GB数据中心BF1663 GB / 141 GB42167432841K
B200 192GB数据中心BF1663 GB / 192 GB7021534091.4M
Mac M4 Pro 64GB统一内存FP833 GB / 56 GB371159508K
DGX Spark 128GB统一内存BF1663 GB / 120 GB184227617K
Mac M4 Max 128GB统一内存BF1663 GB / 120 GB372318617K
Mac Studio M3 Ultra 256GB统一内存BF1663 GB / 240 GB5538861.9M
Mac Studio M3 Ultra 512GB统一内存BF1663 GB / 490 GB5538864.5M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程LiveCodeBench v6 66.0%(官方)。

推理GPQA Diamond 73.4%(官方)。

数学AIME 2025 85.0%(官方)。

AgentBFCL-v3 72.4%(官方)。

中文中文良好。

逻辑能力

考试型推理相对其体量非常强,思考链长度控制好于 235B 版。工程型推理(多文件代码修改)明显弱,容易丢失约束。事实知识覆盖不足,幻觉高于 Dense 32B。适合「快、便宜、要有推理能力」的场景,不适合做知识库问答主力。

亮点
  1. 1.激活仅 3.3B,4090 上 100+ tok/s,Mac M 系列也可用
  2. 2.AIME 2025 85%,推理分超过 Dense 的 Qwen3-32B
  3. 3.原生 256K 上下文,KV 仅 96 KiB/token
  1. 1.30B 总参数仍要 18.6 GB(Q4)显存,不是「3B 模型」
  2. 2.小激活量导致知识广度与指令细节遵循弱于 Dense 32B
  3. 3.Thinking 版不可关闭思考,短问答成本高,用 Instruct-2507
适合:本地推理助手 · 高吞吐批量推理 · 边缘 / 笔记本部署
不适合:知识密集型问答 · 复杂 agent 编排
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1370LMArena Text (style control)2025-12-20独立复测
LiveCodeBench竞赛编程66%Qwen3-30B-A3B-Thinking-2507 模型卡2025-12-20厂商公布
GPQA Diamond研究生级科学问答73.4%Qwen3-30B-A3B-Thinking-2507 模型卡2025-12-20厂商公布
AIME 2025美国数学邀请赛85%Qwen3-30B-A3B-Thinking-2507 模型卡2025-12-20厂商公布

更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。