Skip to main content
QUICK REVIEW

[論文レビュー] DartMinHash: Fast Sketching for Weighted Sets

Tobias Christiani|arXiv (Cornell University)|May 23, 2020
Video Analysis and Summarization参考文献 29被引用数 5
ひとこと要約

DartMinHashは、重み付き最小ハッシュを高速に計算するための新しいアルゴリズムを導入し、k個の独立な最小ハッシュを期待時間O(k log k + ||x||₀ log(||x||₁ + 1/||x||₁))で計算する。これは、BagMinhash や FastICWS といった従来手法を著しく上回り、一般的なワークロードで最大30倍の高速化を達成する。特にkと||x||₀が大きく、スパースなデータに対して優れた性能を発揮し、定数重み集合に対して理論的に最適な性能を維持する。

ABSTRACT

Weighted minwise hashing is a standard dimensionality reduction technique with applications to similarity search and large-scale kernel machines. We introduce a simple algorithm that takes a weighted set $x \in \mathbb{R}_{\geq 0}^{d}$ and computes $k$ independent minhashes in expected time $O(k \log k + \Vert x \Vert_{0}\log( \Vert x \Vert_1 + 1/\Vert x \Vert_1))$, improving upon the state-of-the-art BagMinHash algorithm (KDD '18) and representing the fastest weighted minhash algorithm for sparse data. Our experiments show running times that scale better with $k$ and $\Vert x \Vert_0$ compared to ICWS (ICDM '10) and BagMinhash, obtaining $10$x speedups in common use cases. Our approach also gives rise to a technique for computing fully independent locality-sensitive hash values for $(L, K)$-parameterized approximate near neighbor search under weighted Jaccard similarity in optimal expected time $O(LK + \Vert x \Vert_0)$, improving on prior work even in the case of unweighted sets.

研究の動機と目的

  • 類似性検索および大規模カーネルマシンにおける重み付き集合の独立した最小ハッシュを計算する際の性能ボトルネックを解消すること。
  • スケッチプリミティブを設計し、重み付き集合に最初に当たるt個のダーツを効率的に回復可能とし、局所性に優れたハッシュ法および最小ハッシュ計算を高速化すること。
  • BagMinhash や FastICWS といった既存のアルゴリズムを改善し、特にkが大きく、||x||₁ = 1であるスパースなデータに対して実行時間を短縮すること。
  • 重み付きジャコーディ類似度における(L,K)-パrameterized近似近傍検索において、期待時間計算量O(LK + ||x||₀)が最適となること。

提案手法

  • ダーツを[0,M]^dに一様に抽出するダーツ投げモデルを用い、最初に集合xに当たるダーツがその最小ハッシュ値を決定する。
  • スパarsityに依存せずに、O(t + ||x||₀ log(||x||₁ + 1/||x||₁))の期待時間で、xに最初に当たるt個のダーツを効率的に取得するための新しいデータ構造とサンプリング戦略を導入する。
  • 拒否サンプリングを避けるために、優先度キューと重み付きランダムサンプリングを活用し、||x||₁が小さいスパースなデータに対して遅延を回避する。
  • 決定的で効率的なサンプリング機構により、独立した乱数列をシミュレートすることで、完全に独立した最小ハッシュ計算を実現する。
  • 定数重み集合に対して最適であるように設計されており、||x||₁ = Θ(1)のとき、O(t + ||x||₀)の下界と一致する。
  • 重み付きジャコーディ類似度における高速な(L,K)-パrameterized LSHを実現し、期待時間計算量O(LK + ||x||₀)が最適となる。

実験結果

リサーチクエスチョン

  • RQ1BagMinhash や FastICWS よりも、重み付き集合のk個の独立した最小ハッシュを高速に計算することは可能か?
  • RQ2重み付き最小ハッシュにおいて、期待時間O(k log k + ||x||₀ log(||x||₁ + 1/||x||₁))が達成可能か?
  • RQ3||x||₁が非常に小さいまたは非常に大きい極端な値をとる場合、アルゴリズムの性能はどのようになるか?
  • RQ4アルゴリズムは重み付きジャコーディ類似度における(L,K)-パrameterized近似近傍検索を高速化できるか?
  • RQ5アルゴリズムは、さまざまなデータのスパarsityおよびスケッチ長さの設定においても高い性能を維持できるか?

主な発見

  • k = ||x||₀ = 4096 かつ ||x||₁ = 1 の場合、DartMinHashは2番目に速い手法(BagMinhash)に対して最大30倍の高速化を達成する。
  • ||x||₁ = 1 の一般的なワークロードにおいて、DartMinHashはFastICWSの10倍、BagMinhashの15倍速い。
  • ||x||₁が極端な値(例:2^±64)であっても、k = 256 かつ ||x||₀ = 1024 の場合、DartMinHashは10倍の高速化を維持するが、||x||₁ = 2^±512 の場合に性能が低下する。
  • ||x||₁ ∈ [2^-32, 2^32] の範囲では、DartMinHashはFastICWSおよびBagMinhashに対して顕著な高速化を維持し、通常の実世界の重み範囲で安定した性能を発揮する。
  • ||x||₁が極めて小さい(例:2^-512)または極めて大きい(例:2^512)場合、FastICWSはDartMinHashを6〜7倍速く、極端な重み値に対して感受性が高いことが示唆される。
  • 重み付きジャコーディ類似度における(L,K)-パrameterized LSHにおいて、期待時間計算量O(LK + ||x||₀)が最適であることを達成しており、未重み付き集合に対しても既存の研究を凌駆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。