开源权重可下已被替代不可商用 · CC-BY-NC-4.0(附 Cohere 可接受使用政策)
Cohere logo

Command R+

Command R+ · 104B · Cohere · 发布 2024-04-04 · 已被替代Command A+

企业 RAG 专用的 104B,带引用溯源的工具调用先驱。

参数
104B
DENSE
上下文
128K
价格 / 1M tok
$2.50 / $10
Cohere 官方 API( · 2026-08-28
最低可跑
4× RTX 3090
Q6_K · 90 GB · ≈24 tok/s
Arena Elo
AA 综合指数
代码
GPQA 推理
类型
Dense
注意力
GQA(96 Q 头 / 8 KV 头)
层数
64
隐藏维
12288
词表
256,000

RAG 与工具调用原生模板(引用溯源);10 语言;128K。

完善中

Token Embedding词表 256,000× 64 层注意力:GQAKV 头 8 · head_dim 128Dense FFN隐藏维 12288Dense:每个 token 经过全部参数LM Head104B实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF16208 GB官方精度
FP8暂无
Q8110 GB
Q463 GBGGUF Q4_K_M 或等效
消费级 24GB
不可行
单卡 80GB
Q4 62.8 GB 单卡可跑;BF16 3×80GB
8×80GB 节点
BF16 高并发

KV Cache:256 KiB/token。256 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

完善中

硬件配置与预估吞吐
最低可跑(8K 上下文)
4 × RTX 3090 24GB
二手 ≈¥5,000 × 4 · 合计 ≈¥20,000 · 消费级
量化
Q6_K
解码
24 tok/s
最大上下文
32K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
4 × RTX 5090 32GB
≈¥16,000 × 4 · 合计 ≈¥64,000 · 消费级
量化
FP8
解码
36 tok/s
最大上下文
154K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
4× RTX 3090 24GB消费级Q6_K90 GB / 96 GB2461432K
4× RTX 4090 24GB消费级Q6_K90 GB / 96 GB26142832K
4× RTX 5090 32GB消费级FP8110 GB / 128 GB381817154K
4× L4 24GB工作站Q6_K90 GB / 96 GB7.751932K
2× RTX A6000 48GB工作站Q6_K88 GB / 96 GB9.933342K
2× RTX 6000 Ada 48GB工作站Q6_K88 GB / 96 GB1239442K
2× L40S 48GB工作站Q6_K88 GB / 96 GB1139442K
RTX PRO 6000 Blackwell 96GB工作站Q6_K86 GB / 96 GB1454146K
4× A10 24GB数据中心Q6_K90 GB / 96 GB1553732K
2× A100 40GB数据中心Q5_K_M76 GB / 80 GB23135023K
A100 80GB数据中心Q5_K_M75 GB / 80 GB1867528K
H20 96GB数据中心Q6_K86 GB / 96 GB3016046K
2× 昇腾 Ascend 910B 64GB数据中心FP8107 GB / 128 GB171212173K
H100 80GB PCIe数据中心Q5_K_M75 GB / 80 GB18163628K
H100 80GB SXM数据中心Q5_K_M75 GB / 80 GB29214028K
AMD MI300X 192GB数据中心FP8106 GB / 192 GB332828694K
H200 141GB数据中心FP8106 GB / 141 GB302140286K
B200 192GB数据中心FP8106 GB / 192 GB494868694K
DGX Spark 128GB统一内存FP8106 GB / 120 GB1.3134118K
Mac M4 Max 128GB统一内存FP8106 GB / 120 GB2.674118K
Mac Studio M3 Ultra 256GB统一内存BF16211 GB / 240 GB1.9123123K
Mac Studio M3 Ultra 512GB统一内存BF16211 GB / 490 GB1.91231.1M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →
可用维度不足 3 个,不绘制雷达图

Agent多步工具调用、引用溯源原生。

中文中文为 10 语言之一,可用。

逻辑能力

非推理模型 2024 年中游:MMLU 75.7%(社区测),RAG 场景表现优于同期开源,纯推理一般。

亮点
  1. 1.RAG 引用(grounded generation)与多步工具调用原生模板
  2. 2.128K 上下文,10 种商业语言
  3. 3.发布时 Arena 开源第一,击败 GPT-4 早期版
  1. 1.CC-BY-NC,权重禁止商用(只能走 API)
  2. 2.104B Dense 显存大
  3. 3.被 Command A(111B,2025-03)取代
适合:企业 RAG 原型(非商用) · 多语言检索问答
不适合:商用自部署 · 数学 / 代码

暂无带来源的分数。

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。