ku0 资源库
登录

H20 八卡跑 72B 推理实测:并发、吞吐、成本全记录

G
GPU贩子小马
25 天前
讨论15693

vLLM + 72B int8,单机 H20 八卡实测数据:

指标数值
并发 QPS22
首字延迟 P50380ms
吞吐4,100 tok/s
折算成本比 API 便宜约 40%
机器:H20 96G × 8,月租 ¥15.6w(日租折算)
模型:72B int8 量化,TP=4 双实例

但要自己扛:

  • 驱动/固件坑(NCCL 版本地狱)
  • 掉卡重启(平均一周一次)
  • 值班响应

结论:日均 token 消耗 > 5 亿才值得自建,否则老实用 API。

评论

3
深夜写码27 天前

NCCL 版本地狱哈哈哈,真实。我们被 2.19→2.21 的兼容问题卡了三天。

G
GPU贩子小马27 天前

对了补充下,数据里没写:int8 相比 bf16 精度损失在我们的评测集上约 1.2%,业务能接受就很香。

卷不动了27 天前

日均 5 亿 token 这个阈值有出处吗?想拿去说服老板。

登录 后参与讨论。