一次可复现的测试

记录 GPU 型号与数量、驱动、CUDA、引擎版本、模型版本、精度、输入形状、并发、预热和测量时长。结果应带运行 ID,方便回到原始日志。

  • kernel 时间:CUDA events 测 GPU 执行,先预热;CPU 调用耗时不代表 GPU 已完成。
  • 端到端延迟:从请求发出到响应完成,包括排队、预处理和传输。
  • 吞吐:成功完成的请求 / 测量时长;不要混用请求/秒与 token/秒。
  • P95:95% 样本不超过这个时间;平均值不能替代它。
  • 显存:说明读的是分配量、保留量还是设备监控值。

对照方法

同一负载一次只改一个关键因素,重复测量;保留原始样本、失败率和测试脚本。比较 batch 时固定模型、硬件、精度和输入,不能拿不同实验直接排榜。

复制 实验模板,到 GPU 实验室 查看结果。成本估算见 delivery。

参考:NVIDIA CUDA Best Practices:评估性能。