[論文レビュー] DS-MLR: Exploiting Double Separability for Scaling up Distributed Multinomial Logistic Regression
DS-MLR は、多項ロジスティック回帰における二重分離性を活用した分散確率的最適化アルゴリズムを提案する。これにより、同時にデータ並列とモデル並列が可能になり、ストレージのボトル neck を解消する。極めて多数のクラスを扱う問題において、最先端のスケーラビリティを達成しており、159 GB の Reddit データセット(パラメータが 358 GB)においても、従来の手法では適用不可能な領域をカバーする。
Scaling multinomial logistic regression to datasets with very large number of data points and classes is challenging. This is primarily because one needs to compute the log-partition function on every data point. This makes distributing the computation hard. In this paper, we present a distributed stochastic gradient descent based optimization method (DS-MLR) for scaling up multinomial logistic regression problems to massive scale datasets without hitting any storage constraints on the data and model parameters. Our algorithm exploits double-separability, an attractive property that allows us to achieve both data as well as model parallelism simultaneously. In addition, we introduce a non-blocking and asynchronous variant of our algorithm that avoids bulk-synchronization. We demonstrate the versatility of DS-MLR to various scenarios in data and model parallelism, through an extensive empirical study using several real-world datasets. In particular, we demonstrate the scalability of DS-MLR by solving an extreme multi-class classification problem on the Reddit dataset (159 GB data, 358 GB parameters) where, to the best of our knowledge, no other existing methods apply.
研究の動機と目的
- 膨大なデータ点および多数のクラスを有する巨大データセットにおける多項ロジスティック回帰(MLR)のスケーラビリティ課題に対処すること。
- L-BFGS や LC といった従来手法が、完全なモデルまたはデータの複製を必要とし、極めてスケールの大きな問題に対しては非現実的であるという制限を克服すること。
- データ並列とモデル並列を同時に実現し、単一マシンに収まらないデータやモデルを扱える状況をサポートすること。
- 同期のオーバーヘッドを低減し、分散環境でのパフォーマンスを向上させるために、ブロッキングのない非同期バージョンを設計すること。
- 分散機械学習のすべてのスケール領域、特に極めてスケールの大きな設定においても汎用性を示すことを目的とする。
提案手法
- データとモデルパラメータの独立的パーティショニングを可能にするために、MLR 目的関数を二重分離性を活用して再定式化する。
- 対数パーティション関数をデータおよびモデルの次元に沿って分離可能な成分に分解し、完全なパラメータ複製を回避した分散計算を可能にする。
- 局所勾配と集約された補助変数を用いて、複数のワーカーがパラメータを更新する同期型分散最適化アルゴリズムを実装する。
- 計算と通信をインタリーブする非同期的・ブロッキングのない変種(DS-MLR Async)を開発し、待機時間を削減してスループットを向上させる。
- 各イテレーションにおけるデータ転送のオーバーヘッドを最小限に抑えるため、効率的な通信パターンを備えたパラメータサーバー型アーキテクチャを採用する。
- 二重分離構造を活用して、勾配計算とパラメータ更新をデータサイズおよびモデルサイズに線形にスケーリングされる形で行う。
実験結果
リサーチクエスチョン
- RQ1完全なストレージコストが高騰する状況を避けて、同時にデータ並列とモデル並列を実現できる分散 MLR アルゴリズムを設計できるか?
- RQ2提案された二重分離性の再定式化は、従来手法が失敗する極めてスケールの大きな設定において、どのようにスケーラブルな最適化を可能にするか?
- RQ3ブロッキングのない非同期型(DS-MLR Async)は、同期的かつブロッキング型の代替手法に比べて、どの程度のパフォーランス向上を達成するか?
- RQ4DS-MLR は、データサイズおよびモデルサイズの両方が単一マシンの容量を超えるような状況を含め、さまざまなサイズのスケール領域において、どの程度スケーリング可能か?
- RQ5DS-MLR は、17億件のコメントと358,000クラスを有する Reddit データセットのような実世界の極めて多数クラス分類タスクにおいて、どの程度の性能を示すか?
主な発見
- DS-MLR は、159 GB のデータと 358 GB のモデルパラメータを有する Reddit データセットに対しても、スケーリングに成功した。これは、従来の手法では適用不可能な領域である。
- LSHTC1-large データセットでは、DS-MLR は 1,191 秒で収束したが、LC 法は 32,624 秒を要し、27 倍の高速化を達成した。
- データもモデルも単一マシンに収まらない状況において、DS-MLR は非同期的・ブロッキングのない設計のおかげで、YouTube8M-Video データセット(4,716 クラス、1,152 特徴量)においても迅速な収束を達成した。
- 355 GB のモデルパラメータを有する ODP データセットでは、DS-MLR が LC を上回った。LC はイテレーションごとのコストが高すぎて、1 イテレーションですら完了しなかった。
- LSHTC1-large では DS-MLR がほぼ線形のスループット向上を示し、20 個のワーカーで 16 倍の高速化を達成した。これは、強い水平スケーラビリティを示している。
- 非同期型バージョンは同期のオーバーヘッドを低減し、特に YouTube8M-Video のような密度の高いデータセットにおいて、マルチコア・マルチマシンシステムの利用効率を高めた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。