向量库部署调优Skill
适用场景
向量库选型与部署:数据规模评估、索引类型与参数调优、召回率优化、运行监控与数据一致性维护。
执行步骤
- 选型评估:规模千万级以下且已有 PostgreSQL→pgvector;大规模/高吞吐→Milvus、Qdrant 等专用库;需混合检索/倒排→Elasticsearch 向量能力。按团队运维能力与规模决定。
- 资源与部署:按向量维度×数量估算内存/磁盘(具体公式需验证),独立实例部署,开启鉴权与网络隔离,禁止默认端口裸奔。
- 索引选型与参数:HNSW(内存充足、追求召回)或 IVF 系(内存受限、追求吞吐);关键参数(M、efConstruction、efSearch、nlist、nprobe)与召回率/性能的取舍需实测(需验证)。
- 召回率调优:固定评测集跑检索,Top-K、相似度阈值、混合检索权重(向量+关键词)逐步调;对比不同索引参数下的召回率与延迟。
- 监控:延迟、QPS、线上抽样召回率、内存/磁盘、索引构建状态;设置告警阈值。
- 数据一致性:文档更新/删除触发向量重建与清理,防止旧向量残留;向量版本与原始文档版本绑定,支持全量重建预案。
规范要点
- 索引参数调整必须基于评测集实测,禁止照搬他人参数直接上线。
- 相似度阈值必须与业务验收口径对齐,低分结果按拒答处理。
- 元数据过滤字段提前规划(来源/时间/权限),写入时过滤比检索时过滤更高效。
- 生产库必须有鉴权、TLS/内网隔离、定期备份;备份与恢复至少演练一次。
- 向量维度必须与 Embedding 模型输出一致,模型更换需全量重嵌入并评估。
输出模板
## 向量库调优方案
选型结论:库/版本/规模预估/部署拓扑
索引参数表:索引类型/M/efSearch 等参数/召回率/延迟实测对比
检索链路参数:Top-K/阈值/混合检索权重
监控与告警:指标/阈值/处置人
自检清单
- 选型与数据规模、团队运维能力匹配
- 索引参数有实测对比数据支撑
- 阈值与拒答口径已对齐
- 鉴权/隔离/备份到位
- 数据更新有重建与残留清理机制