H20 八卡跑 72B 推理实测:并发、吞吐、成本全记录
G
GPU贩子小马
25 天前
讨论15693
vLLM + 72B int8,单机 H20 八卡实测数据:
| 指标 | 数值 |
|---|---|
| 并发 QPS | 22 |
| 首字延迟 P50 | 380ms |
| 吞吐 | 4,100 tok/s |
| 折算成本 | 比 API 便宜约 40% |
机器:H20 96G × 8,月租 ¥15.6w(日租折算)
模型:72B int8 量化,TP=4 双实例
但要自己扛:
- 驱动/固件坑(NCCL 版本地狱)
- 掉卡重启(平均一周一次)
- 值班响应
结论:日均 token 消耗 > 5 亿才值得自建,否则老实用 API。
评论
3深
深夜写码27 天前
NCCL 版本地狱哈哈哈,真实。我们被 2.19→2.21 的兼容问题卡了三天。
G
GPU贩子小马27 天前
对了补充下,数据里没写:int8 相比 bf16 精度损失在我们的评测集上约 1.2%,业务能接受就很香。
卷
卷不动了27 天前
日均 5 亿 token 这个阈值有出处吗?想拿去说服老板。
登录 后参与讨论。