Skip to main content
QUICK REVIEW

[論文レビュー] MARINA: Faster Non-Convex Distributed Learning with Compression

Eduard Gorbunov, Konstantin Burlachenko|arXiv (Cornell University)|Feb 15, 2021
Stochastic Gradient Optimization Techniques参考文献 45被引用数 15
ひとこと要約

MARINA は、勾配差分の圧縮を用いた非凸分散学習における通信効率の高い1次元手法であり、優れた理論的・実験的性能を達成するために、新しいバイアス付き勾配推定器を導入している。通信複雑度は $\mathcal{O}\left(\frac{1 + \omega / \sqrt{n}}{\varepsilon^2}\right)$ に低減され、$\varepsilon$-停留点を求める際、通信およびオракル複雑度の両面で先行手法を上回っている。

ABSTRACT

We develop and analyze MARINA: a new communication efficient method for non-convex distributed learning over heterogeneous datasets. MARINA employs a novel communication compression strategy based on the compression of gradient differences that is reminiscent of but different from the strategy employed in the DIANA method of Mishchenko et al. (2019). Unlike virtually all competing distributed first-order methods, including DIANA, ours is based on a carefully designed biased gradient estimator, which is the key to its superior theoretical and practical performance. The communication complexity bounds we prove for MARINA are evidently better than those of all previous first-order methods. Further, we develop and analyze two variants of MARINA: VR-MARINA and PP-MARINA. The first method is designed for the case when the local loss functions owned by clients are either of a finite sum or of an expectation form, and the second method allows for a partial participation of clients -- a feature important in federated learning. All our methods are superior to previous state-of-the-art methods in terms of oracle/communication complexity. Finally, we provide a convergence analysis of all methods for problems satisfying the Polyak-Lojasiewicz condition.

研究の動機と目的

  • 特にフェデレーテッド学習や非均質学習の文脈において、分散非凸最適化における通信ボトルネックを解消すること。
  • 効果的な圧縮を用いて通信コストを最小限に抑えつつ、高い収束速度を維持する手法の開発。
  • 既存手法の限界を打ち破るために、圧縮通信に特化したバイアス付き勾配推定器を導入すること。
  • 先行の最先端手法と比較して、より優れた理論的通信およびオラクル複雑度境界を達成すること。
  • 部分的クライアント参加や有限和または期待値ベースの局所的目的関数といった実用的展開シナリオをサポートすること。

提案手法

  • DIANAとは異なり、圧縮勾配差分に基づくバイアス付き勾配推定器を用いる1次元手法であるMARINAを導入。
  • 期待密度 $\zeta_{\mathcal{Q}}$ を持つ量子化演算子 $\mathcal{Q}$ を採用し、バイアスを制御しながら勾配の圧縮を可能にしている。
  • ポリャク=ロジャシエフスキー(PL)条件の下で収束保証を導出し、非凸問題において線形収束を保証している。
  • 2つの変種を提案:有限和および期待値ベースの局所的損失のためのVR-MARINA、フェデレーテッド学習における部分的クライアント参加のためのPP-MARINA。
  • 収束解析と誤差伝搬の制御のため、リャプノフ関数 $\Phi_k = f(x^k) - f(x^*) + \frac{\gamma}{p}\|g^k - \nabla f(x^k)\|^2$ を使用している。
  • 収束速度と誤差蓄積のバランスを最適化するため、ステップサイズ $\gamma$ を最適化し、$\mathbf{E}[\Phi_{k+1}] \leq (1 - \gamma\mu)\mathbf{E}[\Phi_k]$ を満たすようにしている。

実験結果

リサーチクエスチョン

  • RQ1非凸分散学習において、バイアス付き勾配推定器は、非バイアス付き手法を上回る通信効率を達成できるか?
  • RQ2非凸分散最適化において、$\varepsilon$-停留点を求めるための最適な通信複雑度は何か?
  • RQ3部分的クライアント参加は、圧縮付きフェデレーテッド学習における収束性と通信コストにどのように影響するか?
  • RQ4勾配差分の圧縮は、標準的な勾配圧縮よりも理論的境界を改善できるか?
  • RQ5PL 条件は、圧縮付き分散手法の収束境界をより厳密にできるか?

主な発見

  • MARINA は通信複雑度 $\mathcal{O}\left(\frac{1 + \omega / \sqrt{n}}{\varepsilon^2}\right)$ を達成し、DIANA の $\mathcal{O}\left(\frac{1 + (1+\omega)\sqrt{\omega/n}}{\varepsilon^2}\right)$ を上回っている。
  • VR-MARINA は、圧縮更新における分散低減を活用することで、有限和および期待値ベースの問題におけるオラクル複雑度を低減している。
  • PP-MARINA は、1ラウンドあたり $r$ 個のクライアントがサンプリングされる状況をサポートし、通信コストを $\mathcal{O}\left(dn + \max\left\{dn, \frac{L}{\mu}\left(\zeta_{\mathcal{Q}}r + \sqrt{(1+\omega)\zeta_{\mathcal{Q}}(dn - \zeta_{\mathcal{Q}}r)}\right)\right\} \log \frac{\Delta_0}{\varepsilon}\right)$ に抑える。
  • PL 条件の下で、MARINA は $\mathbf{E}[f(x^K) - f(x^*)] \leq \varepsilon$ を満たす $K = \mathcal{O}\left(\frac{dn}{\zeta_{\mathcal{Q}}r} \frac{L}{\mu} \left(1 + \sqrt{\frac{1+\omega}{r}\left(\frac{dn}{\zeta_{\mathcal{Q}}r} - 1\right)}\right)\right)$ ラウンドで線形収束を保証している。
  • この手法のバイアス付き推定器は、圧縮誤差と収束速度の間でより良いトレードオフを実現でき、理論的および実践的に DIANA や FedCOMGATE といった非バイアス付き手法を上回っている。
  • 実験結果は、特に高圧縮条件下でも、深層学習ベンチマークにおいて MARINA が通信効率および収束速度の点で優位であることを確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。