Skip to main content
QUICK REVIEW

[論文レビュー] DSCOVR: Randomized Primal-Dual Block Coordinate Algorithms for Asynchronous Distributed Optimization

Lin Xiao, Adams Wei Yu|arXiv (Cornell University)|Oct 13, 2017
Stochastic Gradient Optimization Techniques参考文献 8被引用数 8
ひとこと要約

本論文では、大規模な機械学習における非同期分散最適化のための、確率的プライマル・デュアルブロック座標アルゴリズムであるDSCOVRを提案する。双方向の確率的座標更新と分散低減を組み合わせた鞍点定式化を活用することで、従来の一次元手法と比較して、通信量と同期のコストを低減しつつ、より高速な収束を達成する。特にパラメータサーバー・アーキテクチャ下で顕著な効果を示す。

ABSTRACT

Machine learning with big data often involves large optimization models. For distributed optimization over a cluster of machines, frequent communication and synchronization of all model parameters (optimization variables) can be very costly. A promising solution is to use parameter servers to store different subsets of the model parameters, and update them asynchronously at different machines using local datasets. In this paper, we focus on distributed optimization of large linear models with convex loss functions, and propose a family of randomized primal-dual block coordinate algorithms that are especially suitable for asynchronous distributed implementation with parameter servers. In particular, we work with the saddle-point formulation of such problems which allows simultaneous data and model partitioning, and exploit its structure by doubly stochastic coordinate optimization with variance reduction (DSCOVR). Compared with other first-order distributed algorithms, we show that DSCOVR may require less amount of overall computation and communication, and less or no synchronization. We discuss the implementation details of the DSCOVR algorithms, and present numerical experiments on an industrial distributed computing system.

研究の動機と目的

  • パラメータサーバー上での効率的かつスケーラブルな最適化を可能にするために、分散機械学習における高い通信コストと同期コストを低減すること。
  • 同期のオーバーヘッドを最小限に抑えることができる、データおよびモデルのパーティショニングをサポートする分散最適化フレームワークの設計。
  • 非同期実行に適した、分散低減を組み込んだプライマル・デュアルブロック座標法の開発。
  • 従来の一次元分散アルゴリズムと比較して、通信量と計算量を削減しつつ、より高速な収束を達成すること。

提案手法

  • マシン間での同時的なデータおよびモデルパーティショニングを可能にするために、分散最適化問題を鞍点問題として定式化する。
  • 変数および制約のブロックを確率的に選択する二重確率的座標更新スキームを導入し、1イテレーションあたりのコストを低減する。
  • プライマル・デュアルブロック座標フレームワーク内に、SVRGおよびSAGAの変種を用いた分散低減技術を適用し、収束を加速する。
  • 他のマシンの更新を待たずにローカルモデルパラメータを更新できるように、パラメータサーバー・アーキテクチャを用いて非同期実装を設計する。
  • 非同期条件下での収束を保証するため、正則化付き増大ラグランジュ形式を用いてデュアルおよびプライマル変数の更新をバランスさせる。
  • リャプノフ関数とミンコフスキーの不等式を用いて期待値における収束レートを導出し、適切な条件下で線形収束を示す。

実験結果

リサーチクエスチョン

  • RQ1分散最適化において、最小限の同期で、分散低減を組み込んだ確率的プライマル・デュアルブロック座標法が、より高速な収束を達成できるか。
  • RQ2通信および計算効率の観点から、提案されたDSCOVRアルゴリズムは、既存の一次元分散手法と比較してどのように異なるか。
  • RQ3パラメータサーバーを用いた非同期実行下でのDSCOVRアルゴリズムの収束レートはどのようになるか。
  • RQ4分散環境下で二重確率的更新と分散低減を用いる場合、アルゴリズムが収束保証を維持できるか。
  • RQ5実世界の分散システムにおいて、データ量およびモデルサイズの増加に伴い、アルゴリズムはどのようにスケーリングするか。

主な発見

  • DSCOVRは、期待値において線形収束レートを達成し、レートは $ \big(1 - \frac{1}{2(1+\nu)}\big)^2 $ である。ここで $ \nu $ は近似精度を制御する。
  • 収束のための反復回数は $ r \rightarrow (1+\nu)\frac{1}{2} \frac{\text{log}(\tilde{z}^{(0)} - z^*)^2 / \tilde{\nu}}{\text{log}} $ に比例し、誤差許容値に対して対数的依存性を示す。
  • SVRGまたはSAGAの変種をDSCOVRに組み込むことで、分散が低減され、より高速で安定した収束が実現される。
  • 特に同期コストが高い状況では、標準的一次元分散アルゴリズムと比較して、全体的な計算量と通信量が削減される。
  • 産業用分散システム上で実施した数値実験により、DSCOVRがベースライン手法を上回る収束速度とスケーラビリティを示す。
  • 非同期更新下でも収束を維持できることから、大規模クラスタにおける遅延マシン(ストラグル)の影響に対して頑健である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。