这是一份可以边实验、边补充的基础知识库。先从客户的问题出发,再选择模型、硬件和部署方式。
推荐路径
先回答三个问题
- 交付什么? 文本生成、向量检索、图像处理,还是离线批量任务?
- 怎样算好? 延迟、吞吐、成本、质量,哪个是硬约束?
- 用什么验证? 固定数据集、可复现配置和真实负载,而不只是一张跑分表。
实验入口
- 实验记录模板:复制后记录一次实验。
- CUDA 优化:减少搬运与隐藏等待。
- 方案交付:把测试结果变成可验收的建议。
- 资料索引:只收官方文档和原始论文。
- GPU 性能实验室:导入 CSV,比较延迟、吞吐、显存与成本。
怎么写笔记
在 content/ 新建 Markdown 文件,用 [[measurement]] 关联其他笔记。搜索找内容,右侧关系图和反向链接找上下文。draft: true 的文件不发布;私密笔记放 private/,不进入网站。