开源权重可下推理模型多模态单卡可跑可商用 · Apache-2.0
Alibaba logo

Qwen3.8-27B

通义千问 3.8 · 27B · Alibaba 阿里巴巴 · 发布 2026-08-14 · 当前代

24GB 单卡能跑的原生多模态 27B,Apache-2.0。

参数
27B
HYBRID
上下文
256K
输出 128K
价格 / 1M tok
$0.29 / $2.40
第三方托管参考价(OpenR · 2026-08-28
最低可跑
2× RTX 3060
Q5_K_M · 22 GB · ≈21 tok/s
Arena Elo1436
2026-08-28
AA 综合指数52
2026-08-28
竞赛编程90.3
2026-08-28
GPQA 推理90.5
2026-08-28
类型
Hybrid(线性 + 全注意力)
注意力
Gated DeltaNet(线性注意力)× 3 + Gated Attention(GQA,24 Q / 4 KV)× 1 交错
层数
64
专家
未披露
隐藏维
5120
词表
248,320

Dense 主干但注意力为混合结构:64 层 = 16 × (3 × Gated DeltaNet → FFN + 1 × Gated Attention → FFN)。DeltaNet 48 V 头 / 16 QK 头、head_dim 128;Gated Attention 24 Q 头 / 4 KV 头、head_dim 256,RoPE 仅占 1/4(64 维)。FFN 中间维 17,408。自带 1 层 MTP 头。视觉编码器 27 层、hidden 1152、patch 16。表内 kv_heads / head_dim 指 16 层全注意力层。 上下文:256K(YaRN 可扩至 1M)。

类型:Dense 主干 + 混合注意力(Gated DeltaNet / Gated Attention),27B 参数,原生多模态。

项目数值
层数64 = 16 × (3 × DeltaNet → FFN + 1 × Gated Attention → FFN)
隐藏维5,120
FFN 中间维17,408
全注意力层16 层,24 Q 头 / 4 KV 头,head_dim 256
线性注意力层48 层,48 V 头 / 16 QK 头,head_dim 128,conv kernel 4
RoPEpartial_rotary_factor 0.25(64 维),theta 1e7,M-RoPE 交错
词表248,320(padded)
原生上下文262,144,YaRN 可扩至 1,000,000
MTP1 层多 token 预测头
视觉编码器27 层,hidden 1152,patch 16,spatial merge 2,temporal patch 2

config.jsonmodel_type: qwen3_5architectures: Qwen3_5ForConditionalGeneration

参考:Qwen/Qwen3.8-27B 模型卡与 config.json。

Token Embedding词表 248,320× 64 层(16 层全注意力)注意力:Gated DeltaNetKV 头 4 · head_dim 256路由E1E2E3专家数未披露 · d=5120LM Head27B实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF1656 GB官方精度
FP831 GB
Q829 GB
Q417 GBGGUF Q4_K_M 或等效
消费级 24GB
UD-Q4_K_M 16.5 GB 可加载,剩约 6 GB 给 KV,约 64K 上下文单并发;视觉编码器另占少量显存
单卡 80GB
BF16 55.6 GB 单卡可跑,KV 余量约 20 GB ≈ 256K 上下文;或 FP8 30.9 GB 留更多并发
8×80GB 节点
过剩;用于高并发 / 长上下文服务

KV Cache:仅 16 层全注意力层有 KV:4 KV 头 × 256 × 2(K/V)× 2 B = 4 KiB/层 → 64 KiB/token(BF16)。另有 48 层 DeltaNet 的固定递归状态(48 头 × 128 × 128 × FP32),每序列约 150 MB,与长度无关。256K 上下文 KV ≈ 16 GB。64 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考显存说明
BF1655.6 GB80GB 单卡官方 safetensors,18 分片
FP830.9 GB48GB官方 Qwen3.8-27B-FP8 仓库总大小
Q829 GB48GBunsloth GGUF Q8_0
Q416.5 GB24GBunsloth GGUF UD-Q4_K_M

KV Cache:只有 16 层全注意力层产生 KV,64 KiB/token(BF16);DeltaNet 层为固定大小递归状态(约 150 MB / 序列)。256K 上下文 KV ≈ 16 GB。

参考配置

  • RTX 4090 / 5090 24GB:UD-Q4_K_M,约 64K 上下文单并发
  • A100 / H100 80GB:BF16 可跑满 256K;FP8 可做中等并发
  • 8×80GB:高并发服务

警示:视觉编码器与视频帧 token 会额外吃显存;思考模式输出很长,预留输出 KV。

硬件配置与预估吞吐
最低可跑(8K 上下文)
2 × RTX 3060 12GB
≈¥2,000 × 2 · 合计 ≈¥4,000 · 消费级
量化
Q5_K_M
解码
21 tok/s
最大上下文
48K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
RTX A6000 48GB
≈¥35,000 · 合计 ≈¥35,000 · 工作站
量化
FP8
解码
18 tok/s
最大上下文
509K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
2× RTX 3060 12GB消费级Q5_K_M22 GB / 24 GB2141748K
2× RTX 4060 Ti 16GB消费级Q8_032 GB / 32 GB1136710K
RTX 3090 24GB消费级Q6_K23 GB / 24 GB2759219K
2× RTX 4070 Ti Super 16GB消费级Q8_032 GB / 32 GB2573310K
2× RTX 5070 Ti 16GB消费级Q8_032 GB / 32 GB34146710K
2× RTX 4080 Super 16GB消费级Q8_032 GB / 32 GB2886710K
2× RTX 5080 16GB消费级Q8_032 GB / 32 GB36186710K
RTX 4090 24GB消费级Q6_K23 GB / 24 GB30137519K
RTX 5090 32GB消费级Q8_031 GB / 32 GB40175029K
L4 24GB工作站Q6_K23 GB / 24 GB8.850019K
RTX A6000 48GB工作站FP832 GB / 48 GB18642509K
RTX 6000 Ada 48GB工作站FP832 GB / 48 GB23758509K
L40S 48GB工作站FP832 GB / 48 GB21758509K
RTX PRO 6000 Blackwell 96GB工作站BF1657 GB / 96 GB212083627K
A10 24GB数据中心Q6_K23 GB / 24 GB1851719K
A100 40GB数据中心FP832 GB / 40 GB372600253K
A100 80GB数据中心BF1657 GB / 80 GB242600371K
H20 96GB数据中心BF1657 GB / 96 GB48617627K
昇腾 Ascend 910B 64GB数据中心BF1657 GB / 64 GB192333115K
H100 80GB PCIe数据中心BF1657 GB / 80 GB246300371K
H100 80GB SXM数据中心BF1657 GB / 80 GB408242371K
AMD MI300X 192GB数据中心BF1657 GB / 192 GB63108922.1M
H200 141GB数据中心BF1657 GB / 141 GB5782421.3M
B200 192GB数据中心BF1657 GB / 192 GB95187502.1M
Mac M4 Pro 64GB统一内存FP832 GB / 56 GB5.0142765K
DGX Spark 128GB统一内存BF1657 GB / 120 GB2.55171011K
Mac M4 Max 128GB统一内存BF1657 GB / 120 GB5.02831011K
Mac Studio M3 Ultra 256GB统一内存BF1657 GB / 240 GB7.54752.9M
Mac Studio M3 Ultra 512GB统一内存BF1657 GB / 490 GB7.54756.8M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程SWE-bench Pro 61.7、LiveCodeBench v6 90.3、Terminal Bench 2.1 73.0(官方模型卡)。

推理GPQA Diamond 89.2、HLE 30.8(官方模型卡)。

数学MathVision 90.0(无代码解释器)/ 94.6(有);AIME 官方未披露。

指令遵循IFBench 79.5(官方模型卡)。

AgentOSWorld-Verified 84.3、AndroidWorld 81.9、Agents' Last Exam 20.4 Pass@1(官方模型卡)。

多模态原生图像 + 视频;OmniDocBench 1.5 91.1、RealWorldQA 85.9、CharXiv RQ 83.7(官方模型卡)。

中文中文顶级的 27B 档,Qwen 系列一贯优势。

逻辑能力

27B 档目前最强的开源逻辑推理之一:GPQA Diamond 89.2、HLE 30.8(无工具)、LiveCodeBench v6 90.3,均已接近或超过上一代 Qwen3.7-Plus 闭源 API。Artificial Analysis 智能指数 52,在同体量开源模型中排第一。reasoning_effort 提供 xhigh / medium / low 三档,xhigh 下推理链很长;medium 档可明显缩短但考试型分数会下降。Agent 场景(Terminal Bench 2.1 73.0、DeepSWE 1.1 42.2)在 30B 档大幅领先。常见问题:思考输出冗长、简单问题也会展开长链。

亮点
  1. 1.Apache-2.0,Q4 仅 16.5 GB,RTX 4090 / 5090 单卡可跑,原生图像与视频输入
  2. 2.3:1 DeltaNet 混合注意力,KV 仅 64 KiB/token,256K 原生上下文可在 80GB 单卡跑满
  3. 3.官方榜上整体超过闭源 Qwen3.7-Plus:SWE-bench Pro 61.7、OSWorld-Verified 84.3、LiveCodeBench v6 90.3
  1. 1.思考默认开启且非常「话痨」(AA 评为 very verbose),推理 token 成本与延迟高
  2. 2.混合 DeltaNet 结构较新,llama.cpp / MLX 需最新版本,旧版引擎与部分微调框架不支持
  3. 3.官方未披露预训练 token 数与后训练细节;SWE-bench Verified、AIME 等常用榜未给官方数
适合:单卡本地多模态助手 / 桌面 Agent · 私有化 Coding Agent 底座 · 视觉文档、图表理解(OmniDocBench 91.1)
不适合:对首 token 延迟敏感的实时对话 · 无法升级推理引擎的老旧部署环境
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1436LMArena Text (style control)2026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数52Artificial Analysis Intelligence Index v32026-08-28独立复测
LiveCodeBench竞赛编程90.3%Qwen3.8-27B 模型卡2026-08-28厂商公布
GPQA Diamond研究生级科学问答89.2%Qwen3.8-27B 模型卡2026-08-28厂商公布
Humanity's Last Exam人类最后考试30.8%Qwen3.8-27B 模型卡2026-08-28厂商公布
Terminal-Bench终端 agent73%Qwen3.8-27B 模型卡2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数52Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答90.5%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试33.9%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程44.7%Artificial Analysis (v4.1.1)2026-08-28独立复测
MMMU-Pro多模态理解(Pro)76.3%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent79.8%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)48%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1508LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。