Skip to main content
QUICK REVIEW

[論文レビュー] Accurate Estimators for Improving Minwise Hashing and b-Bit Minwise Hashing

Ping Li, Arnd Christian König|arXiv (Cornell University)|Aug 3, 2011
Spam and Phishing Detection参考文献 17被引用数 5
ひとこと要約

本稿では、非均等な集合サイズと包含関係を考慮する3セル多項モデルを活用して、最小ハッシュ化およびbビット最小ハッシュ化の改善推定器を提案する。最小ハッシュ衝突、不一致、等価値の確率を組み込むことで、特に低類縁度・高包含度の集合ペアにおいて、バイアスと分散を顕著に低減し、多様な類縁度領域において標準推定器を上回る精度と頑健性を達成する。

ABSTRACT

Minwise hashing is the standard technique in the context of search and databases for efficiently estimating set (e.g., high-dimensional 0/1 vector) similarities. Recently, b-bit minwise hashing was proposed which significantly improves upon the original minwise hashing in practice by storing only the lowest b bits of each hashed value, as opposed to using 64 bits. b-bit hashing is particularly effective in applications which mainly concern sets of high similarities (e.g., the resemblance >0.5). However, there are other important applications in which not just pairs of high similarities matter. For example, many learning algorithms require all pairwise similarities and it is expected that only a small fraction of the pairs are similar. Furthermore, many applications care more about containment (e.g., how much one object is contained by another object) than the resemblance. In this paper, we show that the estimators for minwise hashing and b-bit minwise hashing used in the current practice can be systematically improved and the improvements are most significant for set pairs of low resemblance and high containment.

研究の動機と目的

  • 非均等な集合サイズと高包含度の状況下で、標準最小ハッシュ化推定器の性能が劣化する問題を解決すること。
  • 類縁度が低くても包含度が高い場合に、bビット最小ハッシュ化の推定精度を向上させること。
  • 最小ハッシュ出力の完全な多項分布をモデル化する原理的枠組みを構築し、衝突確率に依存するのではなく、すべての確率的状態を統合すること。
  • 等価、左最小、右最小の3つの出力タイプを組み込むことで、類縁度および包含度推定におけるバイアスと分散を低減すること。
  • 多様な類縁度領域において、既存手法を上回る一貫性のある解析的扱いやすさを持つ統一的推定器を提供すること。

提案手法

  • 最小ハッシュ出力分布を、確率 P_=(衝突)、P_<(S1 の最小値 < S2 の最小値)、P_>(S1 の最小値 > S2 の最小値)を有する3セル多項分布としてモデル化する。
  • 幾何級数と (1 - r)^{2^b} 項を含む正規化因子を用いて、bビット最小ハッシュ値の同時確率の閉形式表現を導出する。
  • 観測された b ビット最小ハッシュ値に基づき尤度関数を構築し、それを最大化することで類縁度および包含度を推定する。
  • P_= のみを用いる標準推定器に比べ、3つの出力タイプをすべて組み込んだバイアス補正推定器を導入する。
  • 3セルモデルを用いて、f1 ≠ f2 の場合に最適となる新しい推定器を導出し、特に f2/f1 が小さい場合に顕著な効果を発揮する。
  • 標準最小ハッシュ化および b ビット最小ハッシュ化の両方の設定に本手法を適用し、推定精度の一貫性ある向上を示す。

実験結果

リサーチクエスチョン

  • RQ1集合サイズが非均等な場合に、標準最小ハッシュ化推定器を体系的にどのように改善できるか?
  • RQ2類縁度が低くても包含度が高い状況で、類縁度および包含度を最適に推定する方法は何か?
  • RQ3最小ハッシュ出力の3セル多項モデルは、標準の2項モデルに比べてより精度の高い推定器をもたらすか?
  • RQ4本推定器の性能は、類縁度および包含度の異なる領域において、既存手法と比較してどうなるか?
  • RQ5改善された推定器を用いた b ビット最小ハッシュ化の理論的および実験的影響は、推定バイアスと分散にどのようなものか?

主な発見

  • 標準最小ハッシュ化推定器(衝突のみに依存)は、f1 = f2 の場合にのみ最適であり、集合サイズが非均等になると徐々にバイアスが生じる。
  • 提案された推定器は、類縁度が低く包含度が高いペアにおいて、標準推定器が著しく性能を発揮できない状況で、バイアスを顕著に低減する。
  • bビット最小ハッシュ化では、新しい推定器が分散を低減し、特に f2/f1 < 0.1 の場合に高い精度を達成する。これは、実世界のデータセットで一般的な状況である。
  • 改善効果は、類縁度が低い(R < 0.5)かつ包含度が高い(T ≈ 1)領域で最も顕著であり、標準手法が失敗する領域で顕著に現れる。
  • webspam データセットにおける実験的結果から、平均 f1/f2 の比は 5.5、標準偏差は 9.5 であり、非均等な集合サイズの頻発性が裏付けられる。
  • 理論的分析により、新しい推定器が3セル多項モデル下で最適であることが確認され、すべての出力確率の閉形式表現が得られている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。