Skip to main content
QUICK REVIEW

[論文レビュー] Variance-Reduced Decentralized Stochastic Optimization with Gradient Tracking--Part I: GT-SAGA

Ran Xin, Usman A. Khan|arXiv (Cornell University)|Sep 25, 2019
Stochastic Gradient Optimization Techniques参考文献 61被引用数 9
ひとこと要約

本稿では、勾配追跡とSAGAのバリアンス低減技術を組み合わせることで、滑らかで強く凸な有限和問題に対して線形収束を達成する、バリアンス低減型分散処理分散確率的最適化アルゴリズムGT-SAGAを提案する。大規模な設定において、既存の分散処理手法を上回る性能を発揮し、$\mathcal{O}\left(\max\left\{M,\frac{M}{m}\frac{Q^{2}}{(1-\sigma)^{2}}\right\}\log\frac{1}{\epsilon}\right)$ の局所勾配計算の最適な複雑度を達成する。

ABSTRACT

In this paper, we study decentralized empirical risk minimization problems, where the goal is to minimize a finite-sum of smooth and strongly-convex functions available over a network of nodes. In this Part I, we propose extbf{ exttt{GT-SAGA}}, a decentralized stochastic first-order algorithm based on gradient tracking \cite{DSGT_Pu,DSGT_Xin} and a variance-reduction technique called SAGA \cite{SAGA}. We develop the convergence analysis and the iteration complexity of this algorithm. We further demonstrate various trade-offs and discuss scenarios in which extbf{ exttt{GT-SAGA}} achieves superior performance (in terms of the number of local gradient computations required) with respect to existing decentralized schemes. In Part II \cite{GT_SVRG} of this two-part paper, we develop and analyze extbf{ exttt{GT-SVRG}}, a decentralized gradient tracking based implementation of SVRG \cite{SVRG}, another well-known variance-reduction technique.

研究の動機と目的

  • 大規模で分散化されたデータを扱う分散型経験的リスク最小化において、高速な収束を達成する挑戦に応えること。
  • 分散環境下で勾配追跡とSAGAのバリアンス低減の長所を統合し、収束を加速すること。
  • 条件数$Q = L/\mu$、ネットワーク接続性$\sigma$、局所データサイズ$m$に有利に依存する収束レートを導出すること。
  • 既存の分散処理一階微分法と比較して、GT-SAGAが優れた反復複雑度を達成することを示すこと。

提案手法

  • GT-SAGAは、分散処理勾配追跡とSAGAのバリアンス低減メカニズムを統合し、ノード間で正確な勾配推定を維持する。
  • 各ノードはグローバル勾配の局所推定値を保持し、局所勾配と隣接ノードからの情報の組み合わせによってそれを更新する。
  • ネットワーク通信をモデル化するために、第二固有値が$\sigma$である双安定重み行列$W$を用いる。
  • 強凸性と滑らかさの仮定の下で線形収束を保証するため、$m$、$M$、$Q$、$L$、$\mu$、$\sigma$に依存するステップサイズ$\alpha$を採用する。
  • 収束解析は、リャプノフ関数を用いて誤差項をバインドし、線形レートを支配する収縮係数$1/\kappa$を導出することに依存する。
  • ステップサイズ$\alpha$が閾値$\overline{\alpha}$未満に選ばれる場合、アルゴリズムは線形収束することが証明される。この$\overline{\alpha}$は、$m/M$、$Q$、$L$、$\mu$、$\sigma$に依存する。

実験結果

リサーチクエスチョン

  • RQ1集中型最適化から得られるバリアンス低減技術が、分散確率的設定に効果的に適応可能か?
  • RQ2局所データサイズ$m$、グローバル条件数$Q$、ネットワーク接続性$\sigma$の相互作用が、分散アルゴリズムの収束レートにどのように影響するか?
  • RQ3分散確率的最適化における局所計算と通信の最適なトレードオフは何か?
  • RQ4勾配追跡とSAGAを組み合わせることで、既存の分散処理手法よりも理論的に速い収束レートが得られるか?
  • RQ5ステップサイズ$\alpha$が満たすべき条件は何か? これにより、提案アルゴリズムの線形収束が保証される。

主な発見

  • GT-SAGAは、$\epsilon$-精度に到達するまでに$\mathcal{O}\left(\max\left\{M,\frac{M}{m}\frac{Q^{2}}{(1-\sigma)^{2}}\right\}\log\frac{1}{\epsilon}\right)$ の局所勾配計算を実行し、大規模な設定において最適な複雑度を達成する。
  • 局所データサイズ$m$が大きい場合には、収束レートが著しく向上し、DSA や Diffusion-AVRG などの手法を凌駕する。
  • 線形収束を保証するためには、ステップサイズ$\alpha$を$\overline{\alpha} = \min\left\{\frac{(1-\sigma^{2})^{2}}{30\sqrt{10}}\frac{\sqrt{m}}{\sqrt{M}LQ}, \frac{m}{96M}\frac{1}{QL}, \frac{1-\sigma^{2}}{60\sqrt{5}L}\right\}$未満に選ぶ必要がある。
  • ステップサイズを$\alpha = \frac{m}{M}\frac{(1-\sigma^{2})^{2}}{150QL}$に設定した場合、収縮係数は$\frac{1}{\kappa} \leq \min\left\{\frac{3(1-\sigma^{2})}{10}, \frac{3}{1000}\frac{m}{M}\frac{(1-\sigma^{2})^{2}}{Q^{2}}, \frac{1}{6M}, \frac{1-\sigma^{2}}{2250}\right\}$を満たし、線形収束が証明される。
  • GT-SAGAの収束レートは、ネットワーク接続性$\sigma$が向上する($\sigma \to 1$に近づく)に従い、良好にスケーリングされ、より大きな$m$では有効な条件数依存性が軽減される。
  • 特に$m$が大きい場合には、DSA や Diffusion-AVRG、ADFS よりも、$m$、$M$、$Q$、$\sigma$の組み合わせに対する依存性が優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。