Skip to main content
QUICK REVIEW

[論文レビュー] Fully Understanding the Hashing Trick

Casper Benjamin Freksen, Lior Kamma|arXiv (Cornell University)|May 22, 2018
Face and Expression Recognition被引用数 10
ひとこと要約

本稿は特徴ハッシュ化におけるハッシュのトリックのタイトな漸近的解析を提供し、入力ベクトルの ℓ∞/ℓ2 確率的比、目的次元 m、誤差パラメータ ε, δ の間の正確なトレードオフを確立している。特徴ハッシュ化が m ≥ 2/(ε²δ) のとき、相対誤差 ε 以内で ℓ2 ノルムを保持する確率が 1−δ 以上であることを証明し、実験的に漸近的境界における隠れた定数が 1 に近く、理論的タイトさが実際の状況でも確認されている。

ABSTRACT

Feature hashing, also known as {\em the hashing trick}, introduced by Weinberger et al. (2009), is one of the key techniques used in scaling-up machine learning algorithms. Loosely speaking, feature hashing uses a random sparse projection matrix $A : \mathbb{R}^n o \mathbb{R}^m$ (where $m \ll n$) in order to reduce the dimension of the data from $n$ to $m$ while approximately preserving the Euclidean norm. Every column of $A$ contains exactly one non-zero entry, equals to either $-1$ or $1$. Weinberger et al. showed tail bounds on $\|Ax\|_2^2$. Specifically they showed that for every $\varepsilon, δ$, if $\|x\|_{\infty} / \|x\|_2$ is sufficiently small, and $m$ is sufficiently large, then $$\Pr[ \; | \;\|Ax\|_2^2 - \|x\|_2^2\; | < \varepsilon \|x\|_2^2 \;] \ge 1 - δ\;.$$ These bounds were later extended by Dasgupta \etal (2010) and most recently refined by Dahlgaard et al. (2017), however, the true nature of the performance of this key technique, and specifically the correct tradeoff between the pivotal parameters $\|x\|_{\infty} / \|x\|_2, m, \varepsilon, δ$ remained an open question. We settle this question by giving tight asymptotic bounds on the exact tradeoff between the central parameters, thus providing a complete understanding of the performance of feature hashing. We complement the asymptotic bound with empirical data, which shows that the constants "hiding" in the asymptotic notation are, in fact, very close to $1$, thus further illustrating the tightness of the presented bounds in practice.

研究の動機と目的

  • 特徴ハッシュ化における ℓ∞/ℓ2 確率的比、目的次元 m、誤差パラメータ ε, δ の間の正確なトレードオフを解明する長年の未解決問題を解決すること。
  • 特徴ハッシュ化の性能限界を完全かつタイトに特徴づけ、先行の漸近的境界を解消すること。
  • 広範な実験的評価を通じて理論的境界を検証し、実世界の機械学習データにおける特徴が均等に分布している場合に、漸近的表記における隠れた定数が 1 に近いことを示すこと。
  • 入力ベクトルの質量が均等に分布している(ℓ∞/ℓ2 確率的比が低い)場合に、特徴ハッシュ化が最適な性能を発揮し、実際の密度の高い手法を上回ることを示すこと。

提案手法

  • 特徴ハッシュ化行列 A に対して、‖Ax‖₂² が ‖x‖₂² のまわりに集中するタイトな漸近的境界を導出するための新しい理論的枠組みを提案する。
  • 投影されたベクトルの ℓ2 ノルムの分布を、独立で有界な確率変数の和としてモデル化することで、特徴ハッシュ化の性能を分析する。
  • 三段階の実験的評価を実施する:(1) 制御された ℓ∞/ℓ2 確率的比を持つランダムベクトルを生成し、(2) 固定された m, ε に対して失敗確率 δ を測定し、(3) δ が目標値以下に保たれる最大の許容可能な ℓ∞/ℓ2 確率的比 ν(m, ε, δ) を推定する。
  • 測定された ν 値と理論的予測を比較することで、理論的境界における Θ-表記に隠された定数を実験的に推定する。
  • 理論的保証に必要なランダム性を確保するため、効率的かつ統計的に強いランダムプロジェクションを実現する二重テーブルハッシュを採用する。
  • 再現性と実験間の統計的独立性を確保するため、高品質な乱数生成器(メルセンヌ素数モジュラス)を用いる。

実験結果

リサーチクエスチョン

  • RQ1特徴ハッシュ化における入力ベクトルの ℓ∞/ℓ2 確率的比、目的次元 m、誤差パラメータ ε, δ の間の正確な漸近的トレードオフは何か?
  • RQ2理論的境界 m ≥ 2/(ε²δ) が、‖Ax‖₂² ∈ [(1−ε)‖x‖₂², (1+ε)‖x‖₂²] が確率 1−δ 以上で成立するように必要十分であるか?
  • RQ3実用的状況、特に特徴が均等に分布している実世界の機械学習データにおいて、漸近的境界における隠れた定数は 1 にどれほど近いか?
  • RQ4理論的境界の最小値式における両方の項が実際に必要であるか、それとも実際には常に一方の項が支配的であるか?

主な発見

  • 本稿は、m ≥ 2/(ε²δ) が、特徴ハッシュ化が相対誤差 ε 以内で ℓ2 ノルムを保持する確率が 1−δ 以上であるための必要十分条件であることを確立した。
  • 実験的評価により、ほとんどの実用的パラメータ範囲で、理論的境界における Θ-表記に隠された定数が 0.725 以上であることが示された。一部のスパースベクトルでは 0.6 の外れ値も観測された。
  • 境界はタイトである:m < 2/(ε²δ) のとき、あるベクトルでは ‖Ax‖₂² が ‖x‖₂² から ε‖x‖₂² 以上ずれる例が存在し、このしきい値の必要性が確認された。
  • 理論的最小値式における両方の項が、実験的に必要であることが示された。両方の項が存在しないと、すべてのパラメータ領域で ℓ∞/ℓ2 確率的比を適切に制限できない。
  • 実験的失敗確率 δ は理論的予測と非常によく一致しており、さまざまな ε と δ の範囲で測定された ν(m, ε, δ) 値が理論的境界と密接に一致した。
  • ℓ∞/ℓ2 確率的比 ≤ 1 のベクトルでは、ジョンソン=リンデンストラウス境界よりも顕著に小さい m でも、特徴ハッシュ化が高確率でノルムを保存することが確認され、均等に分布した状況での実用的優位性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。