我的显卡能跑谁

配置集群规格、精度、上下文与成本参数,估算能运行的开源模型、吞吐与自建每百万 token 成本。所有数字为估算,假设见底部。

集群规格
互联:单卡 · 带宽效率 0.65
推理配置
成本参数
整机价 = 卡价 × 卡数 + 每机底价 ¥8,000(机箱 / CPU / 内存 / 网卡);功耗 = TDP × 卡数 + 每机底耗 150W
总卡数
1
1 × 1
总显存
24 GB
总带宽
1.0 TB/s
FP16 算力
165 T
整机价格
¥2.1万
云租用 ≈$0.4/h
满载功耗
0.6 kW
14 kWh/天
月电费
¥346
月总成本
¥929
含折旧 36 个月
7 个模型
模型参数精度占用 / 显存单流 tok/s聚合 tok/s最大上下文自建 ¥/1M tokAPI ¥/1M
31.6B 总 / 3.2B 激活Q5_K_M23 GB / 24 GB
KV 未建模
297297¥1.21(¥0.449)¥1.44
25.2B 总 / 3.8B 激活Q6_K21 GB / 24 GB209209225K¥1.72(¥0.639)免费层
20.9B 总 / 3.6B 激活BF1615 GB / 24 GB8989384K¥4.05(¥1.51)¥1.44
29.6BQ5_K_M22 GB / 24 GB313147K¥11.41(¥4.25)¥7.92
27BQ6_K23 GB / 24 GB303019K¥12.11(¥4.50)¥17.28
30.7BQ5_K_M24 GB / 24 GB29299K¥12.47(¥4.64)免费层
30BQ5_K_M24 GB / 24 GB29298K¥12.50(¥4.65)

估算假设

与模型详情页「硬件与吞吐」同源;误差 ±30%,多机再打折。

占用        = 权重(精度) + KV(上下文 × 并发) + 1.2 GB × 卡数
单流 tok/s  = 总带宽 × eff ÷ (激活参数 × 每参数字节 + KV/token × 上下文)
聚合 tok/s  = min( batch × 总带宽 × eff ÷ (权重字节 + batch × KV字节),  算力上限 )
算力上限    = FP16 TFLOPS × 卡数 × 0.45 ÷ (2 × 激活参数)
eff         = 单卡 0.65 · NVLink 0.55 · PCIe 0.45 · 统一内存 0.5;跨机 × 0.8
¥/1M token  = (功耗 kW × 电价 + 整机价 ÷ 折旧月 ÷ 30 ÷ 每日小时) ÷ (聚合 tok/s × 3600 ÷ 1e6)
API ¥/1M    = 官方或常见托管输出价 × 汇率(仅输出价,不含输入与缓存折扣)
精度「自动」 = 能装下的最高精度(BF16 > FP8 > Q8 > Q6 > Q5 > Q4);MoE 权重全部驻留显存
KV 未建模   = 缺层数 / KV 头数的模型只按权重判断,最大上下文不给出

显卡表在 data/hardware.json,规格为公开数据,价格 / TDP / 底价为参考值。按精确上下文与并发算显存 →