Skip to main content
QUICK REVIEW

[論文レビュー] Linearly Converging Error Compensated SGD

Eduard Gorbunov, Dmitry Kovalev|arXiv (Cornell University)|Oct 23, 2020
Stochastic Gradient Optimization Techniques参考文献 10被引用数 13
ひとこと要約

本稿は、誤差補償、圧縮、遅延更新を併用する分散確率的最適化手法を分析する統一的な理論的枠組みを導入する。EC-SGD-DIANA や EC-LSVRG-DIANA といった新規な変種について、一般の圧縮と分散低減を前提に、凸および強凸問題において定数学習率のもとで正確な収束を示す線形収束性を証明する。

ABSTRACT

In this paper, we propose a unified analysis of variants of distributed SGD with arbitrary compressions and delayed updates. Our framework is general enough to cover different variants of quantized SGD, Error-Compensated SGD (EC-SGD) and SGD with delayed updates (D-SGD). Via a single theorem, we derive the complexity results for all the methods that fit our framework. For the existing methods, this theorem gives the best-known complexity results. Moreover, using our general scheme, we develop new variants of SGD that combine variance reduction or arbitrary sampling with error feedback and quantization and derive the convergence rates for these methods beating the state-of-the-art results. In order to illustrate the strength of our framework, we develop 16 new methods that fit this. In particular, we propose the first method called EC-SGD-DIANA that is based on error-feedback for biased compression operator and quantization of gradient differences and prove the convergence guarantees showing that EC-SGD-DIANA converges to the exact optimum asymptotically in expectation with constant learning rate for both convex and strongly convex objectives when workers compute full gradients of their loss functions. Moreover, for the case when the loss function of the worker has the form of finite sum, we modified the method and got a new one called EC-LSVRG-DIANA which is the first distributed stochastic method with error feedback and variance reduction that converges to the exact optimum asymptotically in expectation with a constant learning rate.

研究の動機と目的

  • 分散学習およびフェデレーテッドラーニングにおける通信ボトル neck を軽減するため、効率的な勾配圧縮と誤差フィードバックを可能にする。
  • 量子化 SGD、EC-SGD、D-SGD といった既存手法を、一つの理論的枠組みで統一する。
  • 誤差フィードバックと分散低減、任意のサンプリングを組み合わせた新規アルゴリズムを開発し、収束速度を向上させる。
  • 定数学習率のもとで、EC-SGD-DIANA や EC-LSVRG-DIANA といった新規手法の線形収束保証を確立する。
  • 本フレームワークに含まれるすべての手法について、タイトな複雑度バウンドを提供し、先行研究を上回る結果を得る。

提案手法

  • 誤差フィードバックと圧縮更新を併用する一般化された反復スキームを提案:$ x^{k+1} = x^k - \frac{1}{n}\sum_{i=1}^n v_i^k $, $ e_i^{k+1} = e_i^k + \gamma g_i^k - v_i^k $、ここで $ v_i^k $ は圧縮された更新量。
  • すべての適合する手法の収束を捉えるための単一の定理に基づく統一的分析フレームワークを導入。
  • 収縮係数 $ \delta $ と分散パラメータ $ \omega $ を持つ一般化された圧縮器クラスを定義し、バイアスあり・なしの両方の圧縮を分析可能にする。
  • 誤差フィードバックにバイアスあり圧縮演算子と勾配差分の量子化を組み合わせた EC-SGD-DIANA を設計し、正確な収束を実現。
  • 誤差フィードバックと分散低減(LSVRG)および圧縮を組み合わせた EC-LSVRG-DIANA を開発し、定数ステップサイズのもとで線形収束を達成。
  • 複雑度バウンドを $ \varepsilon $-許容誤差、滑らかさ $ L $、条件数 $ \kappa $、勾配分散の観点から導出。改善された収束レートを示す。

実験結果

リサーチクエスチョン

  • RQ1圧縮、遅延更新、誤差フィードバックを併用する分散 SGD の分析を統一する理論的枠組みを一つのもので統合できるか?
  • RQ2誤差補償と分散低減、圧縮を組み合わせた新規手法の収束速度はどの程度か?
  • RQ3EC-SGD-DIANA は、一般の圧縮のもとで定数学習率のもとで、凸および強凸問題において正確な最適解に線形収束するか?
  • RQ4EC-LSVRG-DIANA は、分散低減と誤差フィードバックを維持しつつ、定数ステップサイズのもとで線形収束するか?
  • RQ5通信効率と収束速度の観点から、新規手法は既存の最先端手法と比較してどのように異なるか?

主な発見

  • 提案されたフレームワークは、EC-SGD や D-SGD といった既存手法について、知られている最良の収束複雑度バウンドを達成する。
  • EC-SGD-DIANA は、誤差フィードバックとバイアスあり圧縮を併用する最初の手法であり、凸および強凸問題において定数学習率のもとで正確な最適解に線形収束する。
  • EC-LSVRG-DIANA は、誤差フィードバックと分散低減を併用する最初の分散確率的最適化手法であり、作業者が全勾配を計算する場合に、定数ステップサイズのもとで正確な最適解に線形収束する。
  • フレームワークによりタイトな複雑度バウンドを導出可能であり、強凸設定における $ \varepsilon $-精度を達成するための反復複雑度が $ \mathcal{O}\left(\frac{1}{\varepsilon}\right) $ であることを示す。
  • EC-LSVRG-DIANA は定数ステップサイズのもとで $ \mathcal{O}\left(\frac{1}{\varepsilon}\right) $ の複雑度を達成し、ステップサイズを減少させる必要がある先行手法を上回る。
  • フレームワークは 16 種類の新規手法をサポートしており、任意のサンプリングや量子化を含む変種が含まれ、すべてが線形収束保証を有する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。