Skip to main content
QUICK REVIEW

[論文レビュー] Density Sensitive Hashing

Yue Lin, Deng Cai|arXiv (Cornell University)|May 14, 2012
Advanced Image and Video Retrieval Techniques参考文献 35被引用数 6
ひとこと要約

本稿では、ランダムな投影ではなくデータの幾何構造を活用することで、高次元空間における近似最近傍探索を改善する新しいハッシュ手法である密度感受性ハッシュ(DSH)を提案する。k-meansクラスタリングを用いて投影ベクトルの選択をガイドし、ビットの識別性を最大化するためのエントロピーを最大化することで、GIST1M や Flickr1M などの高次元設定において、最先端の手法を上回る優れた検索精度を達成する。

ABSTRACT

Nearest neighbors search is a fundamental problem in various research fields like machine learning, data mining and pattern recognition. Recently, hashing-based approaches, e.g., Locality Sensitive Hashing (LSH), are proved to be effective for scalable high dimensional nearest neighbors search. Many hashing algorithms found their theoretic root in random projection. Since these algorithms generate the hash tables (projections) randomly, a large number of hash tables (i.e., long codewords) are required in order to achieve both high precision and recall. To address this limitation, we propose a novel hashing algorithm called {\em Density Sensitive Hashing} (DSH) in this paper. DSH can be regarded as an extension of LSH. By exploring the geometric structure of the data, DSH avoids the purely random projections selection and uses those projective functions which best agree with the distribution of the data. Extensive experimental results on real-world data sets have shown that the proposed method achieves better performance compared to the state-of-the-art hashing approaches.

研究の動機と目的

  • LSH などのランダム投影に基づくハッシュ手法が、高い精度と再現率を達成するためには多数のハッシュテーブルを必要とすることによる、高コストなストレージと計算コストを軽減すること。
  • LSH における完全にランダムな投影の限界を克服し、データの幾何的構造を組み込むことで、より情報量の多いハッシュ関数を生成すること。
  • 特に高次元データ環境において、精度を著しく向上させつつも、効率を維持する手法の開発。
  • k-meansクラスタリングとエントロピー最大化を用いて投影ベクトルの選択をガイドすることで、精度と効率のバランスを図ること。
  • 大規模な実世界データセットにおいて、データ駆動型の投影選択が、ランダムまたは学習ベースの代替手法よりも優れたパフォーマンスを発揮することを実証すること。

提案手法

  • データをk個のグループに分割するためのk-meansクラスタリングを適用し、クラスタ構造を投影ベクトルの選択をガイドする。
  • 隣接するクラスタのペアごとに、2つのグループを最もよく分離する投影ベクトルを生成し、局所的なデータ密度に一致するようにする。
  • 最大エントロピー原理に基づいて最終的な投影ベクトルの集合を選択することで、1ビットあたりの情報量を最大化する。
  • 線形投影関数を用いる: h_l(x) = sgn(w_l^T x + t_l),ここで w_l は学習された投影ベクトル、t_l はしきい値である。
  • パフォーマンスと効率に影響を与える3つの重要なパラメータを導入する: p(k-meansの反復回数)、α(クラスタ数を制御)、r(考慮する隣接グループの数)、これらが性能に与える影響を評価する。
  • 純粋なランダムまたは複雑な学習ベースの最適化を避けるために、幾何的構造の特徴を活用してハッシュコードの生成を最適化する。

実験結果

リサーチクエスチョン

  • RQ1高次元最近傍探索におけるハッシュ関数の品質を向上させるために、データの幾何構造を効果的に活用できるか?
  • RQ2LSHにおけるランダム投影をデータ適応型の投影に置き換えることで、より少ないビット数でより高い検索精度が達成できるか?
  • RQ3大規模かつ高次元のデータセットにおいて、DSHのパフォーマンスは、最先端のランダム投影および学習ベースのハッシュ手法と比べてどうか?
  • RQ4パラメータ p, α, r の影響は、DSHの精度と効率にどのように現れるか?
  • RQ5従来のLSHが長コードワードを必要とする高次元環境において、DSHは特に効果的であるか?

主な発見

  • GIST1M, Flickr1M, SIFT1M の3つの大規模データセットにおいて、DSHはLSH, SIKH, KLSH, SpH, AGH よりも顕著に高い平均平均精度(MAP)を達成する。
  • GIST1M(960-d)およびFlickr1M(512-d)では、SIFT1M(128-d)よりも他の手法よりも顕著に優れた性能を示しており、高次元設定における特筆すべき強みを示している。
  • 64ビットコードでは、GIST1MでMAP 0.78、Flickr1MでMAP 0.71、SIFT1MでMAP 0.65を達成し、すべてのデータセットおよびコード長でベースラインを上回る性能を示した。
  • DSHの学習時間はk-meansの反復回数(p)とαの増加に伴い増加するが、3回の反復とα=1.5が精度と効率のバランスをとる良好な選択である。
  • r(考慮する隣接グループ数)が5を超えると性能が低下し、過剰に冗長な投影が効果を低下させることを示している。
  • SpH や AGH などの学習ベースの手法よりも高速であり、LSH や PCAH と同等のテスト時間を持つため、トレーニングおよび推論の両面で効率的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。