[論文レビュー] Optimal Las Vegas Locality Sensitive Data Structures
本稿では、高次元空間における近似近傍検索のための、初めてのラスベガス型局所性に敏感なデータ構造を提示する。クエリ時間と空間計算量が、最新のデータに依存しない局所性に敏感なハッシュ(LSH)と一致する一方で、誤検出(偽陰性)を完全に保証する。本手法は、ブルートフォース、テンソリング、完全ハッシュ、スプリッタ関数を組み合わせ、決定的かつ正確な空間分割を構築する。これにより、ハミング距離、ℓ₁、ℓ₂、ジャカード類似度検索において、サブ線形クエリ時間と正しさの保証を得た最適な性能を達成する。
We show that approximate similarity (near neighbour) search can be solved in high dimensions with performance matching state of the art (data independent) Locality Sensitive Hashing, but with a guarantee of no false negatives. Specifically, we give two data structures for common problems. For $c$-approximate near neighbour in Hamming space we get query time $dn^{1/c+o(1)}$ and space $dn^{1+1/c+o(1)}$ matching that of \cite{indyk1998approximate} and answering a long standing open question from~\cite{indyk2000dimensionality} and~\cite{pagh2016locality} in the affirmative. By means of a new deterministic reduction from $\ell_1$ to Hamming we also solve $\ell_1$ and $\ell_2$ with query time $d^2n^{1/c+o(1)}$ and space $d^2 n^{1+1/c+o(1)}$. For $(s_1,s_2)$-approximate Jaccard similarity we get query time $dn^{ρ+o(1)}$ and space $dn^{1+ρ+o(1)}$, $ρ=\log\frac{1+s_1}{2s_1}\big/\log\frac{1+s_2}{2s_2}$, when sets have equal size, matching the performance of~\cite{tobias2016}. The algorithms are based on space partitions, as with classic LSH, but we construct these using a combination of brute force, tensoring, perfect hashing and splitter functions à la~\cite{naor1995splitters}. We also show a new dimensionality reduction lemma with 1-sided error.
研究の動機と目的
- 高次元類似度検索分野における長年の未解決問題に取り組むこと:モンテカルロ型LSHと同等の性能を達成しつつ、偽陰性を完全に保証するラスベガス型データ構造が構築可能かどうか。
- ハミング空間、ℓ₁、ℓ₂、ジャカード類似度のための、決定的かつラスベガス型の近似近傍検索データ構造を構築し、クエリ時間と空間計算量が、最高水準のLSH手法と一致することを目的とする。
- 1方向の誤差を持つ新しい次元削減技術を開発し、ℓ₁およびℓ₂からハミング空間への効率的かつ正確な変換を可能にし、偽陰性を発生させない。
- 主な構築手法の副産物として、大規模なトゥーラン系および被覆符号の明示的かつ構成可能な方法を提供すること。
提案手法
- ナオールら(1995年)のアイデアを踏まえ、ブルートフォース、テンソリング、完全ハッシュ、スプリッタ関数を組み合わせて空間分割を構築し、決定的かつ正確な分割を保証する。
- ℓ₁からハミング空間への新しい決定的還元手法を用い、ハミングベースのラスベガス型データ構造をℓ₁およびℓ₂距離に拡張可能にする。
- 1方向の誤差を持つ新しい次元削減補題を適用し、ℓ₁およびℓ₂ベクトルをハミング空間にマップしながら類似度の保証を維持する。
- 局所性に敏感なフィルタ(LSF)フレームワークを活用し、LSHの境界と一致するサブ線形クエリ時間と空間使用量を持つデータ構造を設計する。
- 二項係数およびヴァンデルモンドの畳み込みの修正解析を導入し、構築における誤検出数の上限を定め、正しさと効率性を保証する。
- 整数調整(例:rを最も近い平方数に丸める、kを可除性を満たすように調整する)を用い、組合せ的パラメータを整数に保ちつつ、漸近的性能に著しい影響を与えない。
実験結果
リサーチクエスチョン
- RQ1高次元空間における近似近傍検索のためのラスベガス型データ構造を、最新のLSHと同等のクエリ時間と空間計算量で構築可能か?
- RQ2モンテカルロ型のランダムネスに依存せず、ℓ₁およびℓ₂類似度検索で最適な性能を達成するラスベガス型保証が可能か?
- RQ3類似度を保ちつつ、ℓ₁からハミング空間への決定的還元を構築可能か?これにより、効率的なラスベガス検索が可能になる。
- RQ4ラスベガス型LSH構築における指数部のオーバーヘッド(例:(log n)^{-1/4})を低減または除去可能か?
- RQ5既存のLSHアルゴリズムを最適な漸近的性能と正しさを保ちつつ、一般化された手法で無作為化可能か?
主な発見
- ハミング空間におけるc-近似近傍検索では、クエリ時間 dn^{1/c + o(1)} および空間使用量 dn^{1 + 1/c + o(1)} を達成し、インディクとモトワニ(1998年)の結果と一致する。これは、インディク(2000a年)およびパーゲ(2016年)が提起した未解決問題を解決する。
- ℓ₁およびℓ₂類似度検索では、クエリ時間 d²n^{1/c + o(1)} および空間使用量 d²n^{1 + 1/c + o(1)} を達成し、最高水準のLSH境界と一致する。また、1方向の誤差を持つ次元削減を可能にする。
- 等サイズの集合に対する(s₁,s₂)-近似ジャカード類似度では、クエリ時間 dn^{ρ + o(1)} および空間使用量 dn^{1 + ρ + o(1)} を達成し、ρ = log((1+s₁)/(2s₁)) / log((1+s₂)/(2s₂)) となる。これはパーゲとクリスチャンニ(2017年)の結果と一致する。
- 本構築により、ℓ₁からハミング空間への新しい決定的還元手法が導入され、ℓ₁およびℓ₂距離に適したハミングベースのラスベガス構造の利用が可能になる。
- 主な構築の副産物として、大規模なトゥーラン系およびペア用被覆符号の明示的かつ構成可能な方法が提供される。
- 本手法は、1方向の誤差を持つ新しい次元削減補題を導入し、偽陰性を発生させず、効率的かつ正確にℓ₁からハミング空間への変換を可能にする。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。