[论文解读] Link and code: Fast indexing with graphs and compact regression codes
本文提出 Link and Code (L&C),一种基于图的近似最近邻搜索方法,结合了优化产品量化(OPQ)以实现紧凑向量编码,并通过图邻居的量化回归提升在严格内存约束下的精度。通过利用分层可导航小世界(HNSW)图并从局部邻域学习回归编码,L&C 在 Deep1B 和 BIGANN 等十亿规模数据集上实现了最先进精度,且在每向量 64–128 字节的条件下搜索速度更快。
Similarity search approaches based on graph walks have recently attained outstanding speed-accuracy trade-offs, taking aside the memory requirements. In this paper, we revisit these approaches by considering, additionally, the memory constraint required to index billions of images on a single server. This leads us to propose a method based both on graph traversal and compact representations. We encode the indexed vectors using quantization and exploit the graph structure to refine the similarity estimation. In essence, our method takes the best of these two worlds: the search strategy is based on nested graphs, thereby providing high precision with a relatively small set of comparisons. At the same time it offers a significant memory compression. As a result, our approach outperforms the state of the art on operating points considering 64-128 bytes per vector, as demonstrated by our results on two billion-scale public benchmarks.
研究动机与目标
- 通过结合内存高效的紧凑编码与高精度图遍历,解决大规模相似性搜索中的可扩展性-精度权衡问题。
- 实现在单台服务器上索引十亿向量的同时保持高搜索精度。
- 通过利用图连通性进行量化回归,从邻居中提升紧凑表示的距离估计精度。
- 证明在大码尺寸下,基于图的候选生成方法在高精度场景中优于基于倒排列表的方法。
提出的方法
- 该方法使用优化产品量化(OPQ)将数据库向量压缩为每向量 8–32 字节,降低内存占用。
- 构建分层可导航小世界(HNSW)图,以在搜索过程中实现快速、高选择性的图遍历。
- 每个向量通过量化回归模型进行优化,该模型从图中其 k 个最近邻预测原始向量,使用学习得到的回归系数码书。
- 通过交替优化学习回归系数,以最小化原始向量与重构向量之间的重建误差。
- 该方法仅为每个向量存储少量字节的回归权重,实现极低的内存开销。
- 该方法已集成至 Faiss 库,并在包含十亿向量的 Deep1B 和 BIGANN 基准上进行了评估。
实验结果
研究问题
- RQ1能否将基于图的搜索策略与紧凑向量表示有效结合,实现在单台服务器上扩展至十亿向量?
- RQ2使用粗粒度聚类中心作为初始近似是否优于使用紧凑码书中的最近邻?
- RQ3从图邻居进行量化回归能否在极低内存成本下显著提升相似性估计精度?
- RQ4在大码尺寸下,HNSW 的选择性与基于倒排列表的方法(如 IMI)相比如何,尤其在高精度场景中?
- RQ5紧凑编码与图优化的结合能否在十亿规模基准上实现最先进性能?
主要发现
- 在 Deep1B 基准上,L&C 在每向量 108 字节、每查询 3.50ms 的条件下实现了 66.7% 的召回率@1,精度和速度均优于 Polysemous 编码(45.6% 召回率@1)及其他方法。
- 在 Deep1B 上,L&C 达到 50% 召回率@1 的速度是 IMI 的 2.5 倍快,证明其在精度-效率权衡上的优越性。
- 通过量化回归的优化步骤显著提升了精度,即使每向量仅增加少量额外字节。
- HNSW 的候选生成方式选择性远高于 IMI,尤其在大码尺寸(如 128 字节)下表现更优,表明在高精度场景中图方法更具优势。
- 该方法可扩展至单台服务器上的十亿向量,这是先前基于图的方法(如 HNSW)所无法实现的,因其需要完整向量存储。
- L&C 在 Deep1B 和 BIGANN 上均实现了最先进性能,在实际内存使用下设定了高精度场景的新基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。