Skip to main content
QUICK REVIEW

[论文解读] Optimal Las Vegas Locality Sensitive Data Structures

Thomas D. Ahle|arXiv (Cornell University)|Apr 6, 2017
Advanced Image and Video Retrieval Techniques被引用 4
一句话总结

本论文首次提出了用于高维空间中近似近邻搜索的拉斯维加斯局部敏感数据结构,实现了与最先进的数据无关局部敏感哈希(LSH)相当的查询和空间复杂度,同时保证无假阴性。该方法结合暴力搜索、张量化、完美哈希和分裂函数,构建确定性的空间划分,从而在汉明距离、ℓ₁、ℓ₂和杰卡德相似度搜索中实现最优性能,支持亚线性查询时间与正确性保证。

ABSTRACT

We show that approximate similarity (near neighbour) search can be solved in high dimensions with performance matching state of the art (data independent) Locality Sensitive Hashing, but with a guarantee of no false negatives. Specifically, we give two data structures for common problems. For $c$-approximate near neighbour in Hamming space we get query time $dn^{1/c+o(1)}$ and space $dn^{1+1/c+o(1)}$ matching that of \cite{indyk1998approximate} and answering a long standing open question from~\cite{indyk2000dimensionality} and~\cite{pagh2016locality} in the affirmative. By means of a new deterministic reduction from $\ell_1$ to Hamming we also solve $\ell_1$ and $\ell_2$ with query time $d^2n^{1/c+o(1)}$ and space $d^2 n^{1+1/c+o(1)}$. For $(s_1,s_2)$-approximate Jaccard similarity we get query time $dn^{ρ+o(1)}$ and space $dn^{1+ρ+o(1)}$, $ρ=\log\frac{1+s_1}{2s_1}\big/\log\frac{1+s_2}{2s_2}$, when sets have equal size, matching the performance of~\cite{tobias2016}. The algorithms are based on space partitions, as with classic LSH, but we construct these using a combination of brute force, tensoring, perfect hashing and splitter functions à la~\cite{naor1995splitters}. We also show a new dimensionality reduction lemma with 1-sided error.

研究动机与目标

  • 解决高维相似度搜索领域长期存在的开放问题:拉斯维加斯数据结构是否能与蒙特卡罗LSH性能相当,同时保证无假阴性。
  • 为汉明空间、ℓ₁、ℓ₂和杰卡德相似度构建确定性的、拉斯维加斯版本的近似近邻数据结构,其查询和空间复杂度与目前已知最优LSH方法一致。
  • 开发一种具有单边误差的新维数约简技术,实现从ℓ₁和ℓ₂到汉明空间的高效转换,且无假阴性。
  • 提供显式、可构造的方法,用于构建大型图兰系统和覆盖码,作为主构造的副产品。

提出的方法

  • 结合暴力搜索、张量化、完美哈希和分裂函数(受Naor等人,1995年启发),构建空间划分,确保确定性和正确划分。
  • 提出一种新颖的确定性归约方法,将ℓ₁映射到汉明空间,从而将基于汉明空间的拉斯维加斯数据结构扩展至ℓ₁和ℓ₂度量。
  • 应用一种具有单边误差的新维数约简引理,将ℓ₁和ℓ₂向量映射到汉明空间,同时保持相似性保证。
  • 利用局部敏感过滤(LSF)框架,设计查询时间亚线性、空间使用量匹配LSH界的数据结构。
  • 引入二项式系数和范德蒙德卷积的改进分析,以界定构造中假阳性的数量,确保正确性与效率。
  • 通过整数调整(例如,将r四舍五入到最近的平方数,调整k以确保可除性),使组合参数为整数,同时对渐近性能影响可忽略。

实验结果

研究问题

  • RQ1是否可以为高维空间中的近似近邻搜索构造拉斯维加斯数据结构,使其查询和空间复杂度与最先进的LSH相当?
  • RQ2是否可能在不依赖蒙特卡罗随机性的情况下,实现ℓ₁和ℓ₂相似度搜索的最优性能,且具备拉斯维加斯保证?
  • RQ3能否构建一种从ℓ₁到汉明空间的确定性归约,保持相似性并支持高效的拉斯维加斯搜索?
  • RQ4是否可以减少或消除拉斯维加斯LSH构造中指数项的开销(例如,(log n)^{-1/4})?
  • RQ5是否存在通用技术,可在保持最优渐近性能和正确性的前提下,对现有LSH算法进行去随机化?

主要发现

  • 对于汉明空间中的c-近似近邻搜索,本论文实现了查询时间dn^{1/c + o(1)}和空间复杂度dn^{1 + 1/c + o(1)},与Indyk和Motwani(1998)的性能一致,解决了Indyk(2000a)和Pagh(2016)提出的开放问题。
  • 对于ℓ₁和ℓ₂相似度,该方法实现了查询时间d²n^{1/c + o(1)}和空间复杂度d²n^{1 + 1/c + o(1)},与目前已知最优LSH界一致,并支持单边误差维数约简。
  • 对于(s₁,s₂)-近似杰卡德相似度(集合大小相等时),数据结构实现了查询时间dn^{ρ + o(1)}和空间复杂度dn^{1 + ρ + o(1)},其中ρ = log((1+s₁)/(2s₁)) / log((1+s₂)/(2s₂)),与Pagh和Christiani(2017)的性能一致。
  • 该构造引入了一种新的从ℓ₁到汉明空间的确定性归约,使得基于汉明空间的拉斯维加斯结构可应用于ℓ₁和ℓ₂度量。
  • 本论文提供了大型图兰系统和成对覆盖码的显式、可构造方法,作为主构造的副产品。
  • 该方法提出了一种具有单边误差的新维数约简引理,实现了从ℓ₁到汉明空间的高效且正确的转换,且无假阴性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。