场景

客户要把一批文档变成向量,白天也有在线查询。离线导入追求吞吐,在线查询有延迟上限。这两种负载需要分别测试。

要记录例子为什么
模型和版本固定权重版本避免把模型变化当成优化效果
输入分布长短文本的比例平均长度会掩盖长尾
并发和到达方式固定并发 / 固定到达率测出的瓶颈可能不同
精度与质量FP16 / 量化更快需要同时验证输出质量
服务指标P95、成功请求/秒客户体验包含排队与传输

起步方案

先用成熟推理引擎做基线,固定输入,再测不同 batch 与并发。让在线和离线任务拥有独立的资源预算,避免离线作业吃满资源。

下一步看 测量 和 批处理。若 GPU 未吃满,也要检查 CPU、数据读取、排队和网络。

参考:NVIDIA Triton 模型配置。