Skip to main content
QUICK REVIEW

[論文レビュー] Training Logistic Regression and SVM on 200GB Data Using b-Bit Minwise Hashing and Comparisons with Vowpal Wabbit (VW)

Ping Li, Anshumali Shrivastava|arXiv (Cornell University)|Aug 15, 2011
Face and Expression Recognition参考文献 31被引用数 3
ひとこと要約

本論文では、大規模データセット上でロジスティック回帰およびSVMを効率的に学習するためのbビットミニワイズハッシュ法を提案しており、ストレージコストを著しく低減しつつ、Vowpal Wabbit (VW) ハッシュ法よりも優れた精度を達成することを示している。200GBに拡張されたrcv1データセットを用いて、各例に対して30個のハッシュ値を使用するbビットハッシュ法が、16,384個の値を必要とするVWの性能に匹敵することを実証した。前処理コストは管理可能であり、GPUアクセラレーションを用いることでさらに効率的である。

ABSTRACT

We generated a dataset of 200 GB with 10^9 features, to test our recent b-bit minwise hashing algorithms for training very large-scale logistic regression and SVM. The results confirm our prior work that, compared with the VW hashing algorithm (which has the same variance as random projections), b-bit minwise hashing is substantially more accurate at the same storage. For example, with merely 30 hashed values per data point, b-bit minwise hashing can achieve similar accuracies as VW with 2^14 hashed values per data point. We demonstrate that the preprocessing cost of b-bit minwise hashing is roughly on the same order of magnitude as the data loading time. Furthermore, by using a GPU, the preprocessing cost can be reduced to a small fraction of the data loading time. Minwise hashing has been widely used in industry, at least in the context of search. One reason for its popularity is that one can efficiently simulate permutations by (e.g.,) universal hashing. In other words, there is no need to store the permutation matrix. In this paper, we empirically verify this practice, by demonstrating that even using the simplest 2-universal hashing does not degrade the learning performance.

研究の動機と目的

  • 200GBに拡張されたrcv1データセット(大規模なデータセット)を用いてbビットミニワイズハッシュ法の性能を評価し、実世界の機械学習シナリオにおける有効性を検証すること。
  • bビットミニワイズハッシュ法とVowpal Wabbit (VW) ハッシュ法を、テスト精度およびストレージ効率の観点から直接比較すること。
  • 2-ユニバーサルハッシュ法を用いることで、ミニワイズハッシュ法における完全な置換の保存を代替する実用的で効果的な手法であることを検証すること。
  • bビットミニワイズハッシュ法の前処理コストが、実際には無視できる程度であり、特に複数回の学習実行にわたって平均化される場合に顕著であることを示すこと。
  • LIBLINEARとハッシュ化されたデータを用いた再現可能な実験設定を提供することで、他の研究者が容易に検証できるようにすること。

提案手法

  • 著者らは、rcv1データセットを、元の特徴量、すべての2次組合せ、および3次組合せの1/30を追加することで、LibSVMフォーマットの200GBのデータセットに拡張した。
  • 2-ユニバーサルハッシュ関数を用いてbビットミニワイズハッシュを実行し、置換の完全な保存を回避する。
  • ハッシュ処理は、線形合同関数を用いて各非ゼロ特徴量インデックスを新しい位置にマッピングする:$ h_j(t) = \{c_{1,j} + c_{2,j} \cdot t \ \text{mod}\ p\} \ \text{mod}\ D $、ここで $ p > D $ は素数である。
  • 各データポイントについて、$ k $ 個の置換における最小ハッシュ値を記録し、コンactな $ k $ 次元表現を形成する。
  • 得られたハッシュ化されたデータを用いて、大規模な線形モデルに特化した広く使われているソルバーであるLIBLINEARを用いて、ロジスティック回帰およびSVMモデルを学習した。
  • 性能評価はテスト精度を用い、bビットミニワイズハッシュ法とVWハッシュ法の間で、異なるハッシュ値の数($ k $)を変化させた条件での比較を実施した。

実験結果

リサーチクエスチョン

  • RQ1bビットミニワイズハッシュ法は、大幅に少ないハッシュ値数でVWハッシュ法と同等またはそれ以上のテスト精度を達成できるか?
  • RQ2完全な置換の代わりに2-ユニバーサルハッシュ法を用いることで、bビットミニワイズハッシュ法の学習性能にどのような影響を与えるか?
  • RQ3大規模な学習パイプラインにおいて、前処理時間とデータロード時間の比較はどのようになるか?また、前処理はボトルネックとなるか?
  • RQ4bビットミニワイズハッシュ法は、200GB規模のデータセットに対して、標準的なソルバー(例:LIBLINEAR)と組み合わせて効果的に使用可能か?
  • RQ5bビットミニワイズハッシュ法の1回限りの前処理コストは、複数回の学習実験やハイパーパramータチューニングタスクにおける再利用性によって正当化されるか?

主な発見

  • 各データポイントに対して30個のハッシュ値を使用するだけで、bビットミニワイズハッシュ法は、16,384個のハッシュ値を必要とするVWハッシュ法と同等のテスト精度を達成した。
  • GPUアクセラレーションを用いない場合でも、bビットミニワイズハッシュ法の前処理コストは、200GBデータセットのデータロード時間と同程度のオーダーであった。
  • GPUを用いることで、前処理時間はデータロード時間の1/7未満にまで短縮され、ボトルネックとしての影響はほとんどなくなった。
  • 2-ユニバーサルハッシュ法を用いることでモデル性能が低下しなかったことが、webspamデータセット上での置換と2-ユニバーサルハッシュ法のテスト精度曲線が重なったことで裏付けられた。
  • 同じ前処理済みデータを、クロスバリデーションや異なるC値、データ分割を伴う複数回の学習実行に再利用可能であり、全体の計算コストを顕著に削減できる。
  • bビットミニワイズハッシュ法は、VWハッシュ法よりも分散低減に優れており、理論的予想通り、ランダム射影(VWが模倣するもの)よりも分散が小さいことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。