Skip to main content
QUICK REVIEW

[論文レビュー] Distributed Asynchronous Dual Free Stochastic Dual Coordinate Ascent

Zhouyuan Huo, Heng Huang|arXiv (Cornell University)|May 29, 2016
Stochastic Gradient Optimization Techniques参考文献 36被引用数 5
ひとこと要約

本稿では、非凸目的関数を最適化するために双対定式を回避する分散非同期アルゴリズム、Dis-dfSDCAを提案する。局所ソルバとして双対フリーな確率的双対座標降下(dfSDCA)を用いる。個々の関数が非凸であっても、その総和が凸であれば線形収束を達成でき、非同期通信によりスローワーカー問題を顕著に軽減し、CoCoA+ や SVRG より収束速度と拡張性に優れる。

ABSTRACT

The primal-dual distributed optimization methods have broad large-scale machine learning applications. Previous primal-dual distributed methods are not applicable when the dual formulation is not available, e.g. the sum-of-non-convex objectives. Moreover, these algorithms and theoretical analysis are based on the fundamental assumption that the computing speeds of multiple machines in a cluster are similar. However, the straggler problem is an unavoidable practical issue in the distributed system because of the existence of slow machines. Therefore, the total computational time of the distributed optimization methods is highly dependent on the slowest machine. In this paper, we address these two issues by proposing distributed asynchronous dual free stochastic dual coordinate ascent algorithm for distributed optimization. Our method does not need the dual formulation of the target problem in the optimization. We tackle the straggler problem through asynchronous communication and the negative effect of slow machines is significantly alleviated. We also analyze the convergence rate of our method and prove the linear convergence rate even if the individual functions in objective are non-convex. Experiments on both convex and non-convex loss functions are used to validate our statements.

研究の動機と目的

  • 非凸目的関数に対して双対定式が得られないという、プライム・デュアル分散手法の制限を克服すること。
  • 遅延するワーカー(スローワーカー)によって性能が制限される分散システムにおけるスローワーカー問題を克服すること。
  • 双対定式に依存せず、同期通信にも依存しない分散最適化手法を開発すること。
  • 個々の関数が非凸であっても、全体の目的関数が凸である場合に理論的収束保証を確立すること。
  • CoCoA+ や SVRG と比較して、スローワーカーを伴う分散環境下で実用的に優れた性能を示すことを実証すること。

提案手法

  • 双対フリーな確率的双対座標降下(dfSDCA)を局所ソルバとして用いる分散非同期アルゴリズム、Dis-dfSDCA を提案し、双対定式への依存を排除する。
  • サーバとワーカー間で非同期通信を可能にし、遅延するワーカーを待たずにサーバが処理を継続できるようにすることで、スローワーカー問題を緩和する。
  • パラメータサーバー枠組みを採用し、ワーカーが古くなったグローバル変数を保持し、非同期に更新することで、システムスループットを向上させる。
  • 非凸な個々の損失関数を持つ正則化された経験的リスク最小化問題として最適化問題を定式化するが、その総和は凸である。
  • 個々の関数が非凸であっても、全体の目的関数が凸であれば、ややいなごろの条件下で線形収束率を証明する。
  • 実験では、{1, 0.1, 0.001, 0.0001} から学習率を適応的に選択し、さまざまな設定での性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1非凸な個々の損失関数に対して、双対定式に依存しない分散最適化手法が線形収束を達成できるか。
  • RQ2スローワーカー条件下における分散最適化において、非同期通信が収束性と拡張性に与える影響は何か。
  • RQ3個々の関数が非凸であってもその総和が凸である場合、提案手法が高速収束を維持できるか。
  • RQ4スローワーカーが存在する状況で、Dis-dfSDCA は CoCoA+ や SVRG と比較して収束速度と拡張性に優れているか。
  • RQ5主成分分析(PCA) やロジスティック回帰のような実世界の問題に、非凸成分を含む場合に、本手法は効果的に適用可能か。

主な発見

  • 個々の損失関数が非凸であっても、全体の目的関数が凸であれば、Dis-dfSDCA は線形収束を達成する。
  • 4ワーカーを用いた IJCNN1 データセットにおいて、時間的経過およびエポック数の両面で、CoCoA+ よりも Dis-dfSDCA が収束が速く、特にスローワーカー条件下で顕著である。
  • COVTYPE では8ワーカー、RCV1 では16ワーカーを用いた実験で、Dis-dfSDCA は CoCoA+ よりも優れたスループットを示し、非均質環境下での優れた拡張性を確認した。
  • 非凸ケース(PCA関連問題)において、Dis-dfSDCA は分散非同期 SVRG よりも収束速度が速く、1イテレーションあたりの勾配計算量が少ないためである。
  • 完全勾配が必要な状況や、個々の関数が効率的な勾配分解を許さない状況でも、本手法は高速収束と高い拡張性を維持する。
  • 実験により、Dis-dfSDCA はスローワーカーを伴う実際の分散システムにおいても頑健で効果的であることが確認され、理論的収束性と実用的性能の両方を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。