引言
- 高维向量检索的背景与重要性
- 近似索引技术在高维空间中的挑战(如“维度灾难”)
- 本文目标与结构概述
高维向量检索的核心问题
- 高维数据的特点与检索难点
- 精确检索与近似检索的权衡
- 评估指标(召回率、查询延迟、内存占用等)
近似索引设计方法
- 基于哈希的方法
- 局部敏感哈希(LSH)及其变体
- 分层可导航小世界图(HNSW)
- 基于量化与压缩的方法
- 乘积量化(PQ)与残差量化(RQ)
- 倒排文件索引(IVF)与量化结合
- 基于图结构的方法
- 近邻图(如NSG、NGT)
- 动态图索引的优化策略
索引优化技术
- 距离计算的近似加速(如SIMD指令优化)
- 多级索引与分层剪枝策略
- 在线学习与动态更新机制
评估框架与实验设计
- 数据集选择(如SIFT、GIST、Deep1B)
- 基准方法对比(Faiss、Annoy、SCANN等)
- 实验指标(查询时间、召回率、索引构建时间)
- 硬件环境对性能的影响
应用场景与挑战
- 大规模推荐系统与搜索引擎中的实践
- 分布式环境下的索引分片与并行查询
- 未来方向(如硬件感知索引、学习型索引)