Skip to main content
QUICK REVIEW

[论文解读] Zoom: SSD-based Vector Search for Optimizing Accuracy, Latency and Memory

Minjia Zhang, Yuxiong He|arXiv (Cornell University)|Sep 11, 2018
Advanced Image and Video Retrieval Techniques参考文献 25被引用 3
一句话总结

Zoom 提出了一种基于两阶段 SSD 的向量搜索系统,结合了内存中的量化向量以实现快速候选预览,以及 SSD 中存储的完整向量以实现高精度重排序。通过采用多视角方法,Zoom 实现了比最先进方法高 14.9 倍的 VQ(每台机器每秒向量数),同时保持或提升召回率,显著降低了基础设施成本和延迟。

ABSTRACT

With the advancement of machine learning and deep learning, vector search becomes instrumental to many information retrieval systems, to search and find best matches to user queries based on their semantic similarities.These online services require the search architecture to be both effective with high accuracy and efficient with low latency and memory footprint, which existing work fails to offer. We develop, Zoom, a new vector search solution that collaboratively optimizes accuracy, latency and memory based on a multiview approach. (1) A "preview" step generates a small set of good candidates, leveraging compressed vectors in memory for reduced footprint and fast lookup. (2) A "fullview" step on SSDs reranks those candidates with their full-length vector, striking high accuracy. Our evaluation shows that, Zoom achieves an order of magnitude improvements on efficiency while attaining equal or higher accuracy, comparing with the state-of-the-art.

研究动机与目标

  • 解决在线服务中大规模向量搜索面临的高精度、低延迟与低内存占用之间的平衡挑战。
  • 克服现有基于图和量化近似最近邻(ANN)方法的局限性,这些方法要么内存开销过高,要么存在精度下降问题。
  • 设计一种系统,利用 SSD 实现高效的全向量重排序,同时通过两阶段预览-重排序架构最小化延迟与内存使用。
  • 提出一种新型效率指标 VQ(每台机器每秒查询的向量数),以更准确反映实际基础设施成本与可扩展性。

提出的方法

  • 使用存储在主内存中的压缩量化向量进行预览阶段,快速检索出包含真实 top-K 最近邻的较小候选集,且概率较高。
  • 在 SSD 上执行全视角阶段,使用完整长度向量对候选集进行重排序,通过纠正量化带来的潜在误差,确保高精度。
  • 通过批量非阻塞 I/O 和异步提交候选重排序操作,优化延迟性能。
  • 实施高效的距离计算与路由策略,以最小化重排序阶段的计算开销。
  • 利用分层存储架构——快速内存用于预览,持久化 SSD 用于全向量——在速度、精度与成本之间实现平衡。

实验结果

研究问题

  • RQ1结合内存预览与基于 SSD 的全向量重排序的两阶段向量搜索系统,是否能在降低内存与延迟的同时,实现比现有方法更高的精度?
  • RQ2与最先进 ANN 方法(如 IVFPQ 和 HNSW)相比,所提出的 Zoom 系统在 VQ(效率)、召回率(精度)和延迟方面表现如何?
  • RQ3SSD 在不降低整体系统性能的前提下,能在多大程度上被有效用于高吞吐、低延迟的候选向量重排序?
  • RQ4候选集大小(R)与重排序延迟之间的最优权衡是什么?该权衡如何影响召回率与系统吞吐量?

主要发现

  • 与 IVFPQ 相比,Zoom 的 VQ 提升了 1.7–8.0 倍;与 HNSW 相比,提升了 2.7–9.0 倍,表明系统效率与成本节约方面有显著提升。
  • 在相同精度目标下(例如召回率 ≥0.90),Zoom 的 VQ 比 IVFPQ 高出 12.2–14.9 倍,相当于基础设施成本节省 12.2–14.9 倍。
  • 当 R=100 时,Zoom 在 Deep10M 数据集上(K=1)实现了 0.998 的召回率,显著优于 IVFPQ(0.697)和 HNSW(0.983),且延迟相当或更优。
  • 在三星 Pro 960 SSD 上对 100 个完整长度向量(每条 512 字节)进行重排序耗时不足 0.6ms,证明了其低延迟性能,适合在线工作负载。
  • 即使在消费级 SSD(如三星 860 EVO)上,系统也能保持低延迟,重排序 100 个向量耗时低于 1.2ms,证实了其在不同存储层级上的鲁棒性。
  • 多视角方法使 Zoom 能够在仅使用小规模候选集的情况下实现近乎完美的召回率(最高达 0.998),证明了高精度可在不牺牲效率的前提下实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。