Qwen3.8-27B
通义千问 3.8 · 27B · Alibaba 阿里巴巴 · 发布 2026-08-14 · 当前代
24GB 单卡能跑的原生多模态 27B,Apache-2.0。
- 类型
- Hybrid(线性 + 全注意力)
- 注意力
- Gated DeltaNet(线性注意力)× 3 + Gated Attention(GQA,24 Q / 4 KV)× 1 交错
- 层数
- 64
- 专家
- 未披露
- 隐藏维
- 5120
- 词表
- 248,320
Dense 主干但注意力为混合结构:64 层 = 16 × (3 × Gated DeltaNet → FFN + 1 × Gated Attention → FFN)。DeltaNet 48 V 头 / 16 QK 头、head_dim 128;Gated Attention 24 Q 头 / 4 KV 头、head_dim 256,RoPE 仅占 1/4(64 维)。FFN 中间维 17,408。自带 1 层 MTP 头。视觉编码器 27 层、hidden 1152、patch 16。表内 kv_heads / head_dim 指 16 层全注意力层。 上下文:256K(YaRN 可扩至 1M)。
类型:Dense 主干 + 混合注意力(Gated DeltaNet / Gated Attention),27B 参数,原生多模态。
| 项目 | 数值 |
|---|---|
| 层数 | 64 = 16 × (3 × DeltaNet → FFN + 1 × Gated Attention → FFN) |
| 隐藏维 | 5,120 |
| FFN 中间维 | 17,408 |
| 全注意力层 | 16 层,24 Q 头 / 4 KV 头,head_dim 256 |
| 线性注意力层 | 48 层,48 V 头 / 16 QK 头,head_dim 128,conv kernel 4 |
| RoPE | partial_rotary_factor 0.25(64 维),theta 1e7,M-RoPE 交错 |
| 词表 | 248,320(padded) |
| 原生上下文 | 262,144,YaRN 可扩至 1,000,000 |
| MTP | 1 层多 token 预测头 |
| 视觉编码器 | 27 层,hidden 1152,patch 16,spatial merge 2,temporal patch 2 |
config.json 中 model_type: qwen3_5,architectures: Qwen3_5ForConditionalGeneration。
参考:Qwen/Qwen3.8-27B 模型卡与 config.json。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 56 GB | 官方精度 |
| FP8 | 31 GB | |
| Q8 | 29 GB | |
| Q4 | 17 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- UD-Q4_K_M 16.5 GB 可加载,剩约 6 GB 给 KV,约 64K 上下文单并发;视觉编码器另占少量显存
- 单卡 80GB
- BF16 55.6 GB 单卡可跑,KV 余量约 20 GB ≈ 256K 上下文;或 FP8 30.9 GB 留更多并发
- 8×80GB 节点
- 过剩;用于高并发 / 长上下文服务
KV Cache:仅 16 层全注意力层有 KV:4 KV 头 × 256 × 2(K/V)× 2 B = 4 KiB/层 → 64 KiB/token(BF16)。另有 48 层 DeltaNet 的固定递归状态(48 头 × 128 × 128 × FP32),每序列约 150 MB,与长度无关。256K 上下文 KV ≈ 16 GB。 ≈ 64 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 参考显存 | 说明 |
|---|---|---|---|
| BF16 | 55.6 GB | 80GB 单卡 | 官方 safetensors,18 分片 |
| FP8 | 30.9 GB | 48GB | 官方 Qwen3.8-27B-FP8 仓库总大小 |
| Q8 | 29 GB | 48GB | unsloth GGUF Q8_0 |
| Q4 | 16.5 GB | 24GB | unsloth GGUF UD-Q4_K_M |
KV Cache:只有 16 层全注意力层产生 KV,64 KiB/token(BF16);DeltaNet 层为固定大小递归状态(约 150 MB / 序列)。256K 上下文 KV ≈ 16 GB。
参考配置:
- RTX 4090 / 5090 24GB:UD-Q4_K_M,约 64K 上下文单并发
- A100 / H100 80GB:BF16 可跑满 256K;FP8 可做中等并发
- 8×80GB:高并发服务
警示:视觉编码器与视频帧 token 会额外吃显存;思考模式输出很长,预留输出 KV。
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 2× RTX 3060 12GB消费级 | Q5_K_M估 | 22 GB / 24 GB | 21 | 417 | 48K |
| 2× RTX 4060 Ti 16GB消费级 | Q8_0 | 32 GB / 32 GB | 11 | 367 | 10K |
| RTX 3090 24GB消费级 | Q6_K估 | 23 GB / 24 GB | 27 | 592 | 19K |
| 2× RTX 4070 Ti Super 16GB消费级 | Q8_0 | 32 GB / 32 GB | 25 | 733 | 10K |
| 2× RTX 5070 Ti 16GB消费级 | Q8_0 | 32 GB / 32 GB | 34 | 1467 | 10K |
| 2× RTX 4080 Super 16GB消费级 | Q8_0 | 32 GB / 32 GB | 28 | 867 | 10K |
| 2× RTX 5080 16GB消费级 | Q8_0 | 32 GB / 32 GB | 36 | 1867 | 10K |
| RTX 4090 24GB消费级 | Q6_K估 | 23 GB / 24 GB | 30 | 1375 | 19K |
| RTX 5090 32GB消费级 | Q8_0 | 31 GB / 32 GB | 40 | 1750 | 29K |
| L4 24GB工作站 | Q6_K估 | 23 GB / 24 GB | 8.8 | 500 | 19K |
| RTX A6000 48GB工作站 | FP8 | 32 GB / 48 GB | 18 | 642 | 509K |
| RTX 6000 Ada 48GB工作站 | FP8 | 32 GB / 48 GB | 23 | 758 | 509K |
| L40S 48GB工作站 | FP8 | 32 GB / 48 GB | 21 | 758 | 509K |
| RTX PRO 6000 Blackwell 96GB工作站 | BF16 | 57 GB / 96 GB | 21 | 2083 | 627K |
| A10 24GB数据中心 | Q6_K估 | 23 GB / 24 GB | 18 | 517 | 19K |
| A100 40GB数据中心 | FP8 | 32 GB / 40 GB | 37 | 2600 | 253K |
| A100 80GB数据中心 | BF16 | 57 GB / 80 GB | 24 | 2600 | 371K |
| H20 96GB数据中心 | BF16 | 57 GB / 96 GB | 48 | 617 | 627K |
| 昇腾 Ascend 910B 64GB数据中心 | BF16 | 57 GB / 64 GB | 19 | 2333 | 115K |
| H100 80GB PCIe数据中心 | BF16 | 57 GB / 80 GB | 24 | 6300 | 371K |
| H100 80GB SXM数据中心 | BF16 | 57 GB / 80 GB | 40 | 8242 | 371K |
| AMD MI300X 192GB数据中心 | BF16 | 57 GB / 192 GB | 63 | 10892 | 2.1M |
| H200 141GB数据中心 | BF16 | 57 GB / 141 GB | 57 | 8242 | 1.3M |
| B200 192GB数据中心 | BF16 | 57 GB / 192 GB | 95 | 18750 | 2.1M |
| Mac M4 Pro 64GB统一内存 | FP8 | 32 GB / 56 GB | 5.0 | 142 | 765K |
| DGX Spark 128GB统一内存 | BF16 | 57 GB / 120 GB | 2.5 | 517 | 1011K |
| Mac M4 Max 128GB统一内存 | BF16 | 57 GB / 120 GB | 5.0 | 283 | 1011K |
| Mac Studio M3 Ultra 256GB统一内存 | BF16 | 57 GB / 240 GB | 7.5 | 475 | 2.9M |
| Mac Studio M3 Ultra 512GB统一内存 | BF16 | 57 GB / 490 GB | 7.5 | 475 | 6.8M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程SWE-bench Pro 61.7、LiveCodeBench v6 90.3、Terminal Bench 2.1 73.0(官方模型卡)。
推理GPQA Diamond 89.2、HLE 30.8(官方模型卡)。
数学MathVision 90.0(无代码解释器)/ 94.6(有);AIME 官方未披露。
指令遵循IFBench 79.5(官方模型卡)。
AgentOSWorld-Verified 84.3、AndroidWorld 81.9、Agents' Last Exam 20.4 Pass@1(官方模型卡)。
多模态原生图像 + 视频;OmniDocBench 1.5 91.1、RealWorldQA 85.9、CharXiv RQ 83.7(官方模型卡)。
中文中文顶级的 27B 档,Qwen 系列一贯优势。
27B 档目前最强的开源逻辑推理之一:GPQA Diamond 89.2、HLE 30.8(无工具)、LiveCodeBench v6 90.3,均已接近或超过上一代 Qwen3.7-Plus 闭源 API。Artificial Analysis 智能指数 52,在同体量开源模型中排第一。reasoning_effort 提供 xhigh / medium / low 三档,xhigh 下推理链很长;medium 档可明显缩短但考试型分数会下降。Agent 场景(Terminal Bench 2.1 73.0、DeepSWE 1.1 42.2)在 30B 档大幅领先。常见问题:思考输出冗长、简单问题也会展开长链。
- 1.Apache-2.0,Q4 仅 16.5 GB,RTX 4090 / 5090 单卡可跑,原生图像与视频输入
- 2.3:1 DeltaNet 混合注意力,KV 仅 64 KiB/token,256K 原生上下文可在 80GB 单卡跑满
- 3.官方榜上整体超过闭源 Qwen3.7-Plus:SWE-bench Pro 61.7、OSWorld-Verified 84.3、LiveCodeBench v6 90.3
- 1.思考默认开启且非常「话痨」(AA 评为 very verbose),推理 token 成本与延迟高
- 2.混合 DeltaNet 结构较新,llama.cpp / MLX 需最新版本,旧版引擎与部分微调框架不支持
- 3.官方未披露预训练 token 数与后训练细节;SWE-bench Verified、AIME 等常用榜未给官方数
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1436 | LMArena Text (style control) | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 52 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| LiveCodeBench竞赛编程 | 90.3% | Qwen3.8-27B 模型卡 | 2026-08-28 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 89.2% | Qwen3.8-27B 模型卡 | 2026-08-28 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 30.8% | Qwen3.8-27B 模型卡 | 2026-08-28 | 厂商公布 |
| Terminal-Bench终端 agent | 73% | Qwen3.8-27B 模型卡 | 2026-08-28 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 52 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 90.5% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 33.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 44.7% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| MMMU-Pro多模态理解(Pro) | 76.3% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 79.8% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 48% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1508 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。