Skip to main content
QUICK REVIEW

[論文レビュー] Improved Densification of One Permutation Hashing

Anshumali Shrivastava, Ping Li|arXiv (Cornell University)|Jun 18, 2014
Algorithms and Data Compression参考文献 20被引用数 15
ひとこと要約

本稿では、1つの順列ハッシングのための証明可能に改善された密化スキームを提案し、特に極めてスパースなデータセットにおいてハッシュ推定器の分散を低減する一方で、先行研究と同様にO(d + k)のクエリ処理コストを維持する。この手法は、空のバケットを非空のバケットに再割り当てする方法を再定義することでハッシュ生成におけるランダムネスを向上させ、より正確な類似度推定およびニアレストネイバー検索の結果をもたらす。

ABSTRACT

The existing work on densification of one permutation hashing reduces the query processing cost of the $(K,L)$-parameterized Locality Sensitive Hashing (LSH) algorithm with minwise hashing, from $O(dKL)$ to merely $O(d + KL)$, where $d$ is the number of nonzeros of the data vector, $K$ is the number of hashes in each hash table, and $L$ is the number of hash tables. While that is a substantial improvement, our analysis reveals that the existing densification scheme is sub-optimal. In particular, there is no enough randomness in that procedure, which affects its accuracy on very sparse datasets. In this paper, we provide a new densification procedure which is provably better than the existing scheme. This improvement is more significant for very sparse datasets which are common over the web. The improved technique has the same cost of $O(d + KL)$ for query processing, thereby making it strictly preferable over the existing procedure. Experimental evaluations on public datasets, in the task of hashing based near neighbor search, support our theoretical findings.

研究の動機と目的

  • 非常にスパースなデータセットにおいて、既存の1つの順列ハッシングの密化スキームにおける不十分なランダムネスと高い分散を是正すること。
  • O(d + k)のクエリ処理コストを維持しながら統計的精度を向上させる新しい密化手順を設計すること。
  • 先行手法[24]に対して理論的根拠に基づいた改善を提供し、推定器の分散を分析・低減すること。
  • 公開データセットを用いた実験により、類似度推定およびニアレストネイバー検索タスクにおける理論的改善を検証すること。

提案手法

  • 1つの順列ハッシングにおける空のバケットを最も近い非空バケットに割り当てる新しいスキームを導入し、ランダムネスを向上させるための確率的割り当てモデルを用いる。
  • 円環配置における最も近い非空バケットの分布をモデル化することで、ハッシュ値間の期待衝突確率を再定義する。
  • 新しい割り当てルール下での非空および空のバケットのインジケータ変数の期待積を計算するための組合せ的解析を用いる。
  • 改善されたスキーム下でのハッシュインジケータの積の期待値を計算し、類似度推定器の分散の新しい表現を導出する。
  • 2つの空のバケットが同じ非空バケットに割り当てられる確率pが、新しい手法では1.5/(m+1)であることを示し、[24]の2/(m+1)よりも低くなる。これにより分散が低減される。
  • 全密化プロセスがO(d + k)時間で実行可能であることを保証することで、計算効率を維持する。これは元のスキームの計算量と同一である。

実験結果

リサーチクエスチョン

  • RQ1既存の[24]における密化スキームは、極めてスパースなデータセットにおける正確な類似度推定に十分なランダムネスを提供しているか?
  • RQ2O(d + k)のクエリコストを維持しながらハッシュ推定器の分散を低減する新しい密化手順を設計できるか?
  • RQ3空のバケットの異なる割り当てルールが、類似度推定器の分散に与える理論的影響は何か?
  • RQ4実世界のスパースなデータセットにおいて、新しいスキームは[24]と比較して類似度推定およびニアレストネイバー検索の精度で優れているか?
  • RQ5理論的分析が示唆するように、新しいスキームによる分散低減は、極めてスパースなデータにおいて顕著であるか?

主な発見

  • 提案された密化スキームは、[24]の既存手法よりも証明可能な分散低減を達成しており、特に極めてスパースなデータセットにおいて顕著である。
  • 分散の低減は、2つの空のバケットが同じ非空バケットにマッピングされる確率pが[24]の2/(m+1)から新しい手法では1.5/(m+1)に低下したことに起因する。
  • 新しい手法は、元のスキームと同一のO(d + k)のクエリ処理コストを維持しており、効率性と正確性の両面で優れている。
  • 公開データセットを用いた実験結果から、改善されたスキームが[24]を上回ることを確認した。類似度推定およびニアレストネイバー検索の両タスクで優れた性能を示した。
  • 分散低減は、テキスト処理や重複検出などのウェブスケールアプリケーションで一般的な極めてスパースなデータにおいて最も顕著である。
  • 理論的分析により、新しいスキームがより均一で独立したハッシュ衝突を保証するため、LSH特性をよりよく保持していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。