Skip to main content
QUICK REVIEW

[論文レビュー] Optimal Accelerated Variance Reduced EXTRA and DIGing for Strongly Convex and Smooth Decentralized Optimization

Huan Li, Zhouchen Lin|arXiv (Cornell University)|Sep 9, 2020
Stochastic Gradient Optimization Techniques参考文献 19被引用数 15
ひとこと要約

本稿では、分散学習のための加速型バリアンス低減バージョンの EXTRA および DIGing アルゴリズムを提案し、最適な確率的勾配評価と通信複雑性を同時に達成する。バリアンス低減を分散最適化と統合することで、これらの手法は最良の単一マシン VR 性能と、最良のバッチ処理分散通信効率を達成する。

ABSTRACT

We study stochastic decentralized optimization for the problem of training machine learning models with large-scale distributed data. We extend the famous EXTRA and DIGing methods with accelerated variance reduction (VR), and propose two methods, which require the time of $O((\sqrt{n\kappa_s}+n)\log\frac{1}{\epsilon})$ stochastic gradient evaluations and $O(\sqrt{\kappa_b\kappa_c}\log\frac{1}{\epsilon})$ communication rounds to reach precision $\epsilon$, where $\kappa_s$ and $\kappa_b$ are the stochastic condition number and batch condition number for strongly convex and smooth problems, $\kappa_c$ is the condition number of the communication network, and $n$ is the sample size on each distributed node. Our stochastic gradient computation complexity is the same as the single-machine accelerated variance reduction methods, such as Katyusha, and our communication complexity is the same as the accelerated full batch decentralized methods, such as MSDA, and they are both optimal. We also propose the non-accelerated VR based EXTRA and DIGing, and provide explicit complexities, for example, the $O((\kappa_s+n)\log\frac{1}{\epsilon})$ stochastic gradient computation complexity and the $O((\kappa_b+\kappa_c)\log\frac{1}{\epsilon})$ communication complexity for the VR based EXTRA. The two complexities are also the same as the ones of single-machine VR methods, such as SAG, SAGA, and SVRG, and the non-accelerated full batch decentralized methods, such as EXTRA, respectively.

研究の動機と目的

  • 大規模機械学習における分散確率的最適化の最適収束速度を達成する課題に対処すること。
  • 単一マシンの加速型バリアンス低減と分散フルバッチ手法のギャップを埋めるために、両者の利点を統合すること。
  • 最適な確率的勾配評価と通信複雑性を同時に達成する新しい分散アルゴリズムを設計すること。
  • VRに基づく EXTRA および DIGing の加速および非加速バリアントの明示的な複雑性境界を提供すること。

提案手法

  • バリアンス低減技術を用いて EXTRA および DIGing を拡張し、AVRG-EXTRA および AVRG-DIGing を提案する。
  • 分散環境においてモーメンタムとバリアンス低減を組み合わせる新しい加速メカニズムを導入する。
  • 時間変動型ステップサイズと勾配追跡を用いて、分散ネットワークにおける収束を安定化する。
  • 条件数 $κ_s$(確率的)、$κ_b$(バッチ)、$κ_c$(ネットワーク通信)を用いて理論的境界を導出する。
  • 局所的勾配計算とグローバルな一貫性を重み付き平均化によってバランスするハイブリッド更新ルールを採用する。
  • 加速および非加速バリアントをそれぞれ分析し、それぞれに別個の複雑性保証を提供する。

実験結果

リサーチクエスチョン

  • RQ1バリアンス低減を分散最適化と効果的に組み合わせることで、最適な収束速度を達成できるか?
  • RQ2提案された AVRG-EXTRA および AVRG-DIGing の手法は、単一マシンの加速型 VR 方法の最良の既知の複雑性を達成するか?
  • RQ3新規手法の通信複雑性は、MSDA のようなフルバッチ加速分散アルゴリズムのものと一致するか?
  • RQ4分散 VR 環境における、確率的勾配評価と通信ラウンドの明確なトレードオフは何か?
  • RQ5非加速バリアントは、SAG、SAGA、EXTRA、SVRG といった古典的手法と比較して、複雑性においてどのように異なるか?

主な発見

  • 加速型 VR を用いた EXTRA および DIGing は、$O((\sqrt{n\kappa_s}+n)\log\frac{1}{\epsilon})$ の確率的勾配評価を達成し、単一マシンの Katyusha の性能と一致する。
  • 通信複雑性は $O(\sqrt{\kappa_b\kappa_c}\log\frac{1}{\epsilon})$ であり、フルバッチ加速手法(例:MSDA)の最適レートと一致する。
  • 非加速型 VR を用いた EXTRA は、$O((\kappa_s+n)\log\frac{1}{\epsilon})$ の確率的勾配評価を達成し、SAG、SAGA、SVRG と一致する。
  • 非加速型 VR を用いた EXTRA は、$O((\kappa_b+\kappa_c)\log\frac{1}{\epsilon})$ の通信ラウンドを達成し、元の EXTRA メソッドの複雑性と一致する。
  • 加速および非加速両バリアントとも、勾配評価と通信の両方で最適な複雑性を達成し、新たな理論的ベンチマークを確立する。
  • 提案手法は、分散の強凸かつ滑らかな最適化において、初めて同時に最適な確率的および通信複雑性を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。