场景

一次只处理一个请求,GPU 可能用不满。把请求合成 batch,常能增加吞吐,但等待凑批也会增加延迟。客户若要求 P95 不超过 100 ms,就要把排队也放进预算。

起步实验

实验轴先固定什么观察什么
batch模型、输入、硬件、精度吞吐、P95、峰值显存
并发batch、输入分布排队、失败率、吞吐拐点
凑批等待相同到达负载延迟预算是否被耗尽

动态 batching 的能力依赖模型和引擎配置;Triton 配置里 max_batch_size 与模型是否支持 batch 有关。生成任务的连续批处理也不能直接等同于普通张量凑批。

离线任务可以偏向吞吐,在线任务要设置排队、超时和限流。先选满足延迟与显存约束的候选,再比较成本。

相关:inference-service、gpu-memory、delivery。

参考:Triton Dynamic Batcher。