场景
客户要把一批文档变成向量,白天也有在线查询。离线导入追求吞吐,在线查询有延迟上限。这两种负载需要分别测试。
| 要记录 | 例子 | 为什么 |
|---|---|---|
| 模型和版本 | 固定权重版本 | 避免把模型变化当成优化效果 |
| 输入分布 | 长短文本的比例 | 平均长度会掩盖长尾 |
| 并发和到达方式 | 固定并发 / 固定到达率 | 测出的瓶颈可能不同 |
| 精度与质量 | FP16 / 量化 | 更快需要同时验证输出质量 |
| 服务指标 | P95、成功请求/秒 | 客户体验包含排队与传输 |
起步方案
先用成熟推理引擎做基线,固定输入,再测不同 batch 与并发。让在线和离线任务拥有独立的资源预算,避免离线作业吃满资源。