Skip to main content
QUICK REVIEW

[論文レビュー] Exact Weighted Minwise Hashing in Constant Time

Anshumali Shrivastava|arXiv (Cornell University)|Feb 26, 2016
Advanced Image and Video Retrieval Techniques参考文献 20被引用数 7
ひとこと要約

本稿では、非ゼロ要素数dに対してO(dk)の時間が必要となるIoffeの手法と比較して、O(k)時間でk個の独立で不偏なハッシュを計算できる正確な重み付きミニワイズハッシュ化アルゴリズムを提案する。この手法は、一様乱数変数とビット演算に基づく新規ハッシュ関数を用い、実データセットにおいて64ビットの従来手法と比較して5〜9ビットのハッシュ値で、最大60,000倍の高速化を達成するとともに、ジャカード類似度と正確に一致する衝突確率を維持する。

ABSTRACT

Weighted minwise hashing (WMH) is one of the fundamental subroutine, required by many celebrated approximation algorithms, commonly adopted in industrial practice for large scale-search and learning. The resource bottleneck of the algorithms is the computation of multiple (typically a few hundreds to thousands) independent hashes of the data. The fastest hashing algorithm is by Ioffe \cite{Proc:Ioffe_ICDM10}, which requires one pass over the entire data vector, $O(d)$ ($d$ is the number of non-zeros), for computing one hash. However, the requirement of multiple hashes demands hundreds or thousands passes over the data. This is very costly for modern massive dataset. In this work, we break this expensive barrier and show an expected constant amortized time algorithm which computes $k$ independent and unbiased WMH in time $O(k)$ instead of $O(dk)$ required by Ioffe's method. Moreover, our proposal only needs a few bits (5 - 9 bits) of storage per hash value compared to around $64$ bits required by the state-of-art-methodologies. Experimental evaluations, on real datasets, show that for computing 500 WMH, our proposal can be 60000x faster than the Ioffe's method without losing any accuracy. Our method is also around 100x faster than approximate heuristics capitalizing on the efficient "densified" one permutation hashing schemes \cite{Proc:OneHashLSH_ICML14}. Given the simplicity of our approach and its significant advantages, we hope that it will replace existing implementations in practice.

研究の動機と目的

  • 大規模データ応用における複数の独立した重み付きミニワイズハッシュを生成する際の高い計算コストに対処すること。
  • 高次元スパースデータに対して複数回走査を要するIoffeの正確な手法のO(dk)時間計算量を解消すること。
  • 64ビットから5〜9ビットにまでハッシュ値の保存領域を削減することで、精度を損なわずメモリ使用量を低減すること。
  • 理論的に正確でありながら実用的に効率的な手法を開発し、ビッグデータシステムにおける広範な採用を可能にすること。

提案手法

  • 非ゼロ要素ごとに一様乱数変数とビット演算を用いてハッシュ値をマッピングする新規ハッシュ関数を導入する。
  • 2段階のプロセスを採用する:まず、各非ゼロ要素に一様分布からのランダム値を割り当てる。次に、すべての要素に対して最小ハッシュ値を計算する。
  • ビットレベルの切り捨てと正規化を用いて、ハッシュ値を5〜9ビットに圧縮し、正確な衝突確率を維持する。
  • 理論的境界を導出し、提案手法の衝突確率がジャカード類似度と正確に一致することを示す。これにより、バイアスのない推定が保証される。
  • 独立した一様変数の最小値が既知の確率分布に従うという事実を活用し、効率的かつ正確なサンプリングを可能にする。
  • 複数のハッシュ関数間でランダム値を事前計算し再利用することで、定数時間のアモアタイズド計算量を最適化する。

実験結果

リサーチクエスチョン

  • RQ1データのスパarsityに依存せず、1ハッシュあたり定数時間で重み付きミニワイズハッシュを計算できるか?
  • RQ264ビットから10ビット未満にまでハッシュ保存領域を削減できるか、かつ正確な衝突確率を維持できるか?
  • RQ3提案手法はIoffeのO(dk)手法よりも顕著な高速化を達成できるか、かつバイアスを導入しないか?
  • RQ4実際の応用において、提案手法の精度はIoffeの正確な手法や近似ヒューリスティクスと比較してどの程度か?

主な発見

  • オックスフォードデータセットで500個のハッシュを計算する際、提案手法はIoffeの手法と同等の精度を維持しながら最大60,000倍の高速化を達成した。
  • Caltech101データセットでは、データのスパarsityに応じて、Ioffeの手法よりも1,500〜70,000倍高速であった。
  • ハッシュ値は小さな範囲(例:Web-Imagesでは[1,107])に収束し、1ハッシュあたり7〜9ビットで十分であり、メモリ使用量が5〜6倍削減された。
  • 実験で観測された平均ハッシュ値は、定理2の理論的予測と一致しており、手法の分布的正確性が検証された。
  • ジャカード類似度推定の精度は、Ioffeの正確な手法と区別できず、k=1〜50のハッシュ数において平均誤差が同一であった。
  • バイアスを含む近似手法とは異なり、Fast-WDOPHのような近似ヒューリスティクスと比較して5〜100倍の高速化を達成しながら、正確性を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。