Skip to main content
QUICK REVIEW

[論文レビュー] Parallel Restarted SPIDER -- Communication Efficient Distributed Nonconvex Optimization with Optimal Computation Complexity

Pranay Sharma, Kafle, Swatantra|arXiv (Cornell University)|Dec 12, 2019
Stochastic Gradient Optimization Techniques参考文献 43被引用数 13
ひとこと要約

本稿では、並列再起動SGDフレームワークにSPIDER勾配推定を組み込み、分散非凸最適化における通信効率を高めたPR-SPIDERを提案する。有限和およびオンライン設定の両方で、最適な$O(\tilde{\rho}^{-1})$の通信複雑度と最適な$O(\tilde{\rho}^{-1})$の計算複雑度を達成し、従来の$O(\tilde{\rho}^{-2})$のIFO複雑度を著しく改善しつつ、線形スループットを維持し、非i.i.d.データ分布に対しても対応可能である。

ABSTRACT

In this paper, we propose a distributed algorithm for stochastic smooth, non-convex optimization. We assume a worker-server architecture where $N$ nodes, each having $n$ (potentially infinite) number of samples, collaborate with the help of a central server to perform the optimization task. The global objective is to minimize the average of local cost functions available at individual nodes. The proposed approach is a non-trivial extension of the popular parallel-restarted SGD algorithm, incorporating the optimal variance-reduction based SPIDER gradient estimator into it. We prove convergence of our algorithm to a first-order stationary solution. The proposed approach achieves the best known communication complexity $O(ε^{-1})$ along with the optimal computation complexity. For finite-sum problems (finite $n$), we achieve the optimal computation (IFO) complexity $O(\sqrt{Nn}ε^{-1})$. For online problems ($n$ unknown or infinite), we achieve the optimal IFO complexity $O(ε^{-3/2})$. In both the cases, we maintain the linear speedup achieved by existing methods. This is a massive improvement over the $O(ε^{-2})$ IFO complexity of the existing approaches. Additionally, our algorithm is general enough to allow non-identical distributions of data across workers, as in the recently proposed federated learning paradigm.

研究の動機と目的

  • 大規模かつ分散型のデータ環境下での分散非凸最適化における高い通信コストと計算コストを低減すること。
  • スケーラブルなアルゴリズムを構築し、最適な収束複雑度を達成しながら線形スループットを維持すること。
  • 複数のワーカー間で非同一のデータ分布をサポートすることで、フェデレーテッドラーニングの設定に適用可能になること。
  • 有限和およびオンライン非凸問題の両方において、反復複雑度(IFO複雑度)を最適レートにまで低減すること。

提案手法

  • アルゴリズムは、分散環境下での分散バリアンス低減のためのSPIDER勾配推定を組み込んだ並列再起動SGDを拡張したものである。
  • 各ワーカーはミニバッチを用いて局所的なSPIDER勾配を計算し、サーバーは各エポックの終了時に反復値と勾配を集約する。
  • 収束性の向上を図るため、各$m$反復後に新しい初期点で再起動するリスタート機構を採用する。
  • 通信は1エポックごとに行われ、通信ラウンド数を最小限に抑えつつ、バリアンス低減により勾配の正確性を維持する。
  • 有限和およびオンライン問題の両方に対応するため、バッチサイズと勾配推定器を適切に調整する。
  • 各ワーカーが自らの局所関数と勾配推定器を維持できるようにすることで、非i.i.d.データ分布に対応する。

実験結果

リサーチクエスチョン

  • RQ1分散非凸最適化アルゴリズムは、最適な通信複雑度$O(\tilde{\rho}^{-1})$を達成しつつ、最適な計算複雑度を維持できるか?
  • RQ2有限和およびオンライン非凸問題の両方で、$O(\tilde{\rho}^{-1})$のIFO複雑度を達成できるか?
  • RQ3非i.i.d.データ分布が存在する状況下でも、アルゴリズムはワーカー間で線形スループットを維持できるか?
  • RQ4非凸最適化に向け、SPIDERによるバリアンス低減を分散的かつ再起動型フレームワークに効果的に拡張できるか?

主な発見

  • 提案されたPR-SPIDERアルゴリズムは、有限和およびオンライン問題の両方で最適な通信複雑度$O(\tilde{\rho}^{-1})$を達成する。
  • 有限和問題では、IFO複雑度が$O\left(\frac{\sqrt{Nn}}{\epsilon}\right)$であり、これは最適であり、従来の$O(\tilde{\rho}^{-2})$の複雑度に比べて顕著な改善である。
  • オンライン問題では、IFO複雑度が$O\left(\frac{\sigma}{\epsilon^{3/2}} + \frac{\sigma^2}{\epsilon}\right)$であり、これは最適であり、従来の$O(\tilde{\rho}^{-2})$のレートに比べて大幅な改善である。
  • アルゴリズムは$N$ワーカー間で線形スループットを維持し、収束速度がワーカー数に比例して著しく改善される。
  • 非i.i.d.データ分布に対してもロバストであるため、フェデレーテッドラーニングやその他の分散型学習設定に適している。
  • 理論的分析により、標準的な滑らかさと有界分散の仮定の下で、$\epsilon$-一次静止点への収束が保証されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。