[論文レビュー] Categorical Feature Compression via Submodular Optimization
本稿では、二値ラベルとの相互情報量を最大化するように、スケーラブルで分散処理可能なカテゴリカル特徴圧縮のためのアルゴリズムを提案する。この手法は、最適解の (1−1/e)≈63% の近似を保証し、逐次実行時間は O(n log n)、分散実装は対数ラウンドで実現可能であり、Criteo データセットにおける相互情報量の保持と学習性能の両面で、ヒューリスティクスを上回る。
In the era of big data, learning from categorical features with very large vocabularies (e.g., 28 million for the Criteo click prediction dataset) has become a practical challenge for machine learning researchers and practitioners. We design a highly-scalable vocabulary compression algorithm that seeks to maximize the mutual information between the compressed categorical feature and the target binary labels and we furthermore show that its solution is guaranteed to be within a $1-1/e \approx 63\%$ factor of the global optimal solution. To achieve this, we introduce a novel re-parametrization of the mutual information objective, which we prove is submodular, and design a data structure to query the submodular function in amortized $O(\log n )$ time (where $n$ is the input vocabulary size). Our complete algorithm is shown to operate in $O(n \log n )$ time. Additionally, we design a distributed implementation in which the query data structure is decomposed across $O(k)$ machines such that each machine only requires $O(\frac n k)$ space, while still preserving the approximation guarantee and using only logarithmic rounds of computation. We also provide analysis of simple alternative heuristic compression methods to demonstrate they cannot achieve any approximation guarantee. Using the large-scale Criteo learning task, we demonstrate better performance in retaining mutual information and also verify competitive learning performance compared to other baseline methods.
研究の動機と目的
- Criteo クリック予測データセットに見られるような、2800万個のユニークな値を持つ極めて大きな語彙を持つカテゴリカル特徴で機械学習モデルを学習することの課題に対処すること。
- 圧縮された特徴と二値ラベルとの間の相互情報量を最大化する、スケーラブルで分散処理可能なアルゴリズムを設計すること。
- 圧縮品質の理論的近似保証を提供し、解がグローバル最適解の 1−1/e ≈ 63% 以内にあることを保証すること。
- 頻度ベースやバケット化によるヒューリスティクスのような手法が、このような保証を持たず、実験的にも劣っていることを示すこと。
- 実世界のデータセットにおいて、相互情報量の保持とエンドツーエンドの学習性能の両面で、本手法の有効性を検証すること。
提案手法
- 新たな再パrameterization を通じて、相互情報量最大化の目的関数を部分集合関数に再定式化し、理論的近似保証を可能にする。
- 部分集合関数のクエリをアムortライブ O(log n) 時間で行えるデータ構造を設計し、効率的な最適化を可能にする。
- 最も高速な既知の部分集合最大化アルゴリズム(例:Badanidiyuru と Vondrák, 2014)を用い、O(n log n) 時間で (1−1/e−ε)-近似を達成する。
- クエリオラクルを O(k) 台のマシンに分散化することで、分散版を実装。各マシンは O(n/k) のメモリしか使用せず、近似保証を維持する。
- 複数のカテゴリカル特徴にわたるグローバル語彙予算の割り当てを可能にするために、限界寄与度をランク付けし、スコアの高い値を選択する。
- 神経ネットワークモデルにおける対数損失を用いて、エンドツーエンドの学習パイプラインに本手法を統合し、性能を比較する。
実験結果
リサーチクエスチョン
- RQ1カテゴリカル特徴圧縮のためのスケーラブルなアルゴリズムを設計できるか。その際、二値ラベルとの相互情報量を最大化し、最適解の定数倍近似を保証できるか。
- RQ2適切な再パrameterization を施した後、相互情報量の目的関数は部分集合最適化に適しているか。また、その結果として効率的なアルゴリズムが得られるか。
- RQ3部分集合オラクルをアムortライブ対数時間でクエリ可能か。これにより、近似的線形時間の逐次的および分散処理計算が可能になるか。
- RQ4提案手法は、頻度ベースやバケット化によるヒューリスティクスベースラインと比較して、相互情報量の保持と学習性能の両面で優れているか。
- RQ5近似品質を損なわず、完全なデータ複製を必要とせずに、複数のマシンに効果的にスケーリング・分散化できるか。
主な発見
- 提案された部分集合アルゴリズムは、Criteo データセットにおいて語彙サイズ 160,000 の条件下で、相互情報量の損失がたった 3×10−9 にとどまる。これに対して、頻度ヒューリスティクスは語彙サイズ 10,000 の条件下で最大 0.654 の損失を生じる。
- 部分集合手法は、すべてのテスト語彙サイズでほぼ最適の相互情報量を維持し、損失が 10−6 未満にとどまる。一方、分割型手法(Divisive)は最適な割り当て戦略を用いても、より高い損失を示す。
- 分散実装は、逐次版と同一の (1−1/e−ε)-近似保証を達成しており、各マシンが O(n/k) のメモリしか使用せず、通信ラウンド数も対数的である。
- エンドツーエンドの学習において、部分集合圧縮モデルは他の相互情報量ベースの手法と同等の対数損失を達成し、頻度ヒューリスティクスよりも顕著に優れた性能を示し、実用的な競争力を持つことを示した。
- 頻度、バケット化、分割型といったヒューリスティクス手法は、理論的近似保証を一切提供せず、実験的にもラベル関連の情報を保持する点で劣っている。
- 本アルゴリズムは大規模語彙(例:2800万語)にもスケーリング可能であり、O(n log n) 時間計算量を達成するため、実世界の産業スケールの機械学習システムにおいて実用的である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。