场景
一次只处理一个请求,GPU 可能用不满。把请求合成 batch,常能增加吞吐,但等待凑批也会增加延迟。客户若要求 P95 不超过 100 ms,就要把排队也放进预算。
起步实验
| 实验轴 | 先固定什么 | 观察什么 |
|---|---|---|
| batch | 模型、输入、硬件、精度 | 吞吐、P95、峰值显存 |
| 并发 | batch、输入分布 | 排队、失败率、吞吐拐点 |
| 凑批等待 | 相同到达负载 | 延迟预算是否被耗尽 |
动态 batching 的能力依赖模型和引擎配置;Triton 配置里 max_batch_size 与模型是否支持 batch 有关。生成任务的连续批处理也不能直接等同于普通张量凑批。
离线任务可以偏向吞吐,在线任务要设置排队、超时和限流。先选满足延迟与显存约束的候选,再比较成本。