Skip to main content
QUICK REVIEW

[論文レビュー] Reverse Nearest Neighbors Search in High Dimensions using Locality-Sensitive Hashing

David Arthur, Steve Oudot|arXiv (Cornell University)|Nov 22, 2010
Advanced Image and Video Retrieval Techniques参考文献 31被引用数 3
ひとこと要約

この論文は、局所性に敏感なハッシュ(LSH)を用いて、高次元空間における逆近傍(RNN)検索の証明可能に正しいかつ効率的なアルゴリズムを提示する。RNNクエリを1回のε-NN検索と制御可能な数の全探索的r-PLEBクエリに還元し、出力サイズとインスタンスの難易度を反映する条件数に依存する出力感受性のある複雑さを持つサブ線形クエリ時間を達成する。

ABSTRACT

We investigate the problem of finding reverse nearest neighbors efficiently. Although provably good solutions exist for this problem in low or fixed dimensions, to this date the methods proposed in high dimensions are mostly heuristic. We introduce a method that is both provably correct and efficient in all dimensions, based on a reduction of the problem to one instance of $\e$-nearest neighbor search plus a controlled number of instances of {\em exhaustive $r$-\pleb}, a variant of {\em Point Location among Equal Balls} where all the $r$-balls centered at the data points that contain the query point are sought for, not just one. The former problem has been extensively studied and elegantly solved in high dimensions using Locality-Sensitive Hashing (LSH) techniques. By contrast, the latter problem has a complexity that is still not fully understood. We revisit the analysis of the LSH scheme for exhaustive $r$-\pleb using a somewhat refined notion of locality-sensitive family of hash function, which brings out a meaningful output-sensitive term in the complexity of the problem. Our analysis, combined with a non-isometric lifting of the data, enables us to answer exhaustive $r$-\pleb queries (and down the road reverse nearest neighbors queries) efficiently. Along the way, we obtain a simple algorithm for answering exact nearest neighbor queries, whose complexity is parametrized by some {\em condition number} measuring the inherent difficulty of a given instance of the problem.

研究の動機と目的

  • 高次元空間における逆近傍(RNN)検索に対して、理論的裏付けがあり効率的な解決策が不足している現状に対処すること。現行の手法は主にヒューリスティック的である。
  • RNNクエリにおける次元の呪いを克服すること。これは、帰属する点の集合のサイズが次元に対して指数関数的に増大するという性質に起因する。
  • クエリ時間の形を Õ(n^ϱ + |RNN_P(q)|) に保ち、ϱ < 1 となるようにすることで、サブ線形なパフォーマンスを実現するとともに、実際の出力サイズに感受性を持つこと。
  • 全探索的r-PLEBに対するLSHの分析を精緻化し、出力感受性のある複雑さを持つ局所性に敏感な族の概念を導入すること。
  • 出力感受性の指数αを低減する非等長のデータリフト技術を開発し、困難なインスタンスに対して効率を向上させること。

提案手法

  • 二色RNNクエリを1回のε-NN検索と多対数的数の全探索的r-PLEBクエリに還元する。
  • データの非等長リフトを適用し、全探索的r-PLEBフェーズの効率を向上させ、出力感受性の指数αを低減する。
  • 全探索的r-PLEBに対するLSH族の精緻な分析を実施し、インスタンス固有の難易度を反映する条件数を導入する。
  • s-安定分布(ℓ_sノルム用)を用いてLSHスキームを定義し、累積分布関数Φから導出されるパラメータp₀, p₁, p₂を用いる。
  • LSHベースのε-NNとr-PLEBクエリを統合する新しいアルゴリズム(アルゴリズム6)を提案し、高確率でRNNクエリに応答する。
  • 出力感受性であり、ϱとαにパrameter化されたクエリ時間の上限を導出する。ここで、ϱ < 1 かつ α ≤ εϱ < ε である(ℓ₁およびℓ₂ノルムに対して)。

実験結果

リサーチクエスチョン

  • RQ1高次元空間におけるRNN検索は、完全にヒューリスティックな手法を避けて、証明可能に正しいかつサブ線形クエリ時間を達成できるか?
  • RQ2特に出力感受性の観点から、全探索的r-PLEBクエリの複雑さをより正確に分析できるか?
  • RQ3クエリ時間における出力感受性の指数αをε未満に低下させることは可能か?その場合のトレードオフは何か?
  • RQ4非等長のデータリフトは、高次元空間におけるRNNおよびr-PLEBクエリの効率をどの程度向上させられるか?
  • RQ5RNN検索に対して近似的に最適な複雑さの境界を達成することは可能か?現在の境界は理論的最適値にどの程度近いか?

主な発見

  • 提案手法は、期待値において Õ(1/ε · n^ϱ + n^α · |ε(2+ε)-RNN_B,Y(q)|) 時間で二色RNNクエリに応答する。ここで、ℓ₁およびℓ₂ノルムに対して ϱ < 1 かつ α ≤ εϱ < ε である。
  • ℓ₁に対しては、ϱ ≤ 1/(1 + min{ε², √ε}/4) < 1 であり、ℓ₂に対しては、ϱ ≤ 1/(1 + ε²/(1+ε)) < 1 である。これにより、サブ線形クエリ時間が保証される。
  • 空間複雑度は Õ(1/ε · n^{1+ϱ} + n²) であり、多項式的で実用的用途においても妥当である。
  • 本手法は、インスタンスの難易度を反映する条件数に依存する新しい正確な近傍点検索アルゴリズムを導入する。
  • 非等長リフトにより、αを任意の正の定数にまで低減可能であるが、その代償としてϱが1に近づくようになる。
  • 分析により、出力感受性項n^αがn^εで抑えられることを示しており、RNN集合のサイズに伴うスケーリングが良好であることが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。