我的显卡能跑谁
配置集群规格、精度、上下文与成本参数,估算能运行的开源模型、吞吐与自建每百万 token 成本。所有数字为估算,假设见底部。
集群规格
互联:单卡 · 带宽效率 0.65
推理配置
成本参数
整机价 = 卡价 × 卡数 + 每机底价 ¥8,000(机箱 / CPU / 内存 / 网卡);功耗 = TDP × 卡数 + 每机底耗 150W
总卡数
1
1 × 1
总显存
24 GB
总带宽
1.0 TB/s
FP16 算力
165 T
整机价格
¥2.1万
云租用 ≈$0.4/h
满载功耗
0.6 kW
14 kWh/天
月电费
¥346
月总成本
¥929
含折旧 36 个月
7 个模型
| 模型 | 参数 | 精度 | 占用 / 显存 | 单流 tok/s | 聚合 tok/s | 最大上下文 | 自建 ¥/1M tok | API ¥/1M |
|---|---|---|---|---|---|---|---|---|
| 31.6B 总 / 3.2B 激活 | Q5_K_M估 | 23 GB / 24 GB KV 未建模 | 297 | 297 | — | ¥1.21(¥0.449) | ¥1.44 | |
| 25.2B 总 / 3.8B 激活 | Q6_K估 | 21 GB / 24 GB | 209 | 209 | 225K | ¥1.72(¥0.639) | 免费层 | |
| 20.9B 总 / 3.6B 激活 | BF16 | 15 GB / 24 GB | 89 | 89 | 384K | ¥4.05(¥1.51) | ¥1.44 | |
| 29.6B | Q5_K_M估 | 22 GB / 24 GB | 31 | 31 | 47K | ¥11.41(¥4.25) | ¥7.92 | |
| 27B | Q6_K估 | 23 GB / 24 GB | 30 | 30 | 19K | ¥12.11(¥4.50) | ¥17.28 | |
| 30.7B | Q5_K_M估 | 24 GB / 24 GB | 29 | 29 | 9K | ¥12.47(¥4.64) | 免费层 | |
| 30B | Q5_K_M估 | 24 GB / 24 GB | 29 | 29 | 8K | ¥12.50(¥4.65) | — |
估算假设
与模型详情页「硬件与吞吐」同源;误差 ±30%,多机再打折。
占用 = 权重(精度) + KV(上下文 × 并发) + 1.2 GB × 卡数 单流 tok/s = 总带宽 × eff ÷ (激活参数 × 每参数字节 + KV/token × 上下文) 聚合 tok/s = min( batch × 总带宽 × eff ÷ (权重字节 + batch × KV字节), 算力上限 ) 算力上限 = FP16 TFLOPS × 卡数 × 0.45 ÷ (2 × 激活参数) eff = 单卡 0.65 · NVLink 0.55 · PCIe 0.45 · 统一内存 0.5;跨机 × 0.8 ¥/1M token = (功耗 kW × 电价 + 整机价 ÷ 折旧月 ÷ 30 ÷ 每日小时) ÷ (聚合 tok/s × 3600 ÷ 1e6) API ¥/1M = 官方或常见托管输出价 × 汇率(仅输出价,不含输入与缓存折扣) 精度「自动」 = 能装下的最高精度(BF16 > FP8 > Q8 > Q6 > Q5 > Q4);MoE 权重全部驻留显存 KV 未建模 = 缺层数 / KV 头数的模型只按权重判断,最大上下文不给出
显卡表在 data/hardware.json,规格为公开数据,价格 / TDP / 底价为参考值。按精确上下文与并发算显存 →