一次可复现的测试
记录 GPU 型号与数量、驱动、CUDA、引擎版本、模型版本、精度、输入形状、并发、预热和测量时长。结果应带运行 ID,方便回到原始日志。
- kernel 时间:CUDA events 测 GPU 执行,先预热;CPU 调用耗时不代表 GPU 已完成。
- 端到端延迟:从请求发出到响应完成,包括排队、预处理和传输。
- 吞吐:成功完成的请求 / 测量时长;不要混用请求/秒与 token/秒。
- P95:95% 样本不超过这个时间;平均值不能替代它。
- 显存:说明读的是分配量、保留量还是设备监控值。
对照方法
同一负载一次只改一个关键因素,重复测量;保留原始样本、失败率和测试脚本。比较 batch 时固定模型、硬件、精度和输入,不能拿不同实验直接排榜。