Skip to main content
QUICK REVIEW

[論文レビュー] Distributed Second Order Methods with Fast Rates and Compressed Communication

Rustem Islamov, Xun Qian|arXiv (Cornell University)|Feb 14, 2021
Stochastic Gradient Optimization Techniques参考文献 51被引用数 11
ひとこと要約

本稿では、通信効率の高い分散2次最適化手法である NEWTON-STAR、NEWTON-LEARN、CUBIC-NEWTON-LEARN を提案する。これらの手法は、勾配降下と同等の通信コストでニュートン法に類似した2次収束を達成する。確率的スパース化によるヘッセ行列のパラメータ学習と、グローバル化のための3次正則化を組み合わせることで、最先端の手法と比較して通信コストを桁違いに削減しながら、ニュートン法と同等の2次収束を実現する。

ABSTRACT

We develop several new communication-efficient second-order methods for distributed optimization. Our first method, NEWTON-STAR, is a variant of Newton's method from which it inherits its fast local quadratic rate. However, unlike Newton's method, NEWTON-STAR enjoys the same per iteration communication cost as gradient descent. While this method is impractical as it relies on the use of certain unknown parameters characterizing the Hessian of the objective function at the optimum, it serves as the starting point which enables us design practical variants thereof with strong theoretical guarantees. In particular, we design a stochastic sparsification strategy for learning the unknown parameters in an iterative fashion in a communication efficient manner. Applying this strategy to NEWTON-STAR leads to our next method, NEWTON-LEARN, for which we prove local linear and superlinear rates independent of the condition number. When applicable, this method can have dramatically superior convergence behavior when compared to state-of-the-art methods. Finally, we develop a globalization strategy using cubic regularization which leads to our next method, CUBIC-NEWTON-LEARN, for which we prove global sublinear and linear convergence rates, and a fast superlinear rate. Our results are supported with experimental results on real datasets, and show several orders of magnitude improvement on baseline and state-of-the-art methods in terms of communication complexity.

研究の動機と目的

  • 分散機械学習における通信ボトル neck を解消するため、通信負荷が低い2次最適化手法の設計。
  • 従来のニュートン法が高コストである1回の反復における通信コストを抑えつつ、高速な収束速度を維持する。
  • 分散環境下で効率的にヘッセ行列情報を学習できる実用的で、グローバル収束性を保証するニュートン型手法の変種を開発する。
  • 適応的ヘッセ行列学習と通信圧縮を用いて、条件数に依存しない高速な局所収束を達成する。
  • 3次正則化を用いることでグローバル収束を保証し、さまざまな問題条件において安定した性能を発揮する。

提案手法

  • NEWTON-STAR を提案。1つのヘッセ行列近似を用いるニュートン型手法であり、勾配降下と同等の通信コストで2次収束を達成する。
  • 反復的かつ通信効率の良い方法で未知のヘッセ行列パラメータを学習するための確率的スパース化戦略を導入し、NEWTON-LEARN を得る。
  • 異なる仮定(λ > 0 および λ ≥ 0)の下でヘッセ係数を学習する NL1 および NL2 の変種を設計し、高速な局所収束を実現する。
  • NEWTON-LEARN に3次正則化を適用して CUBIC-NEWTON-LEARN (CNL) を構築し、部分線形・線形・超線形収束率を保証するグローバル収束性を実現する。
  • ランダムスパース化、ジタリング、ネイチャラル圧縮などの圧縮演算子を用い、収束速度に影響を与えることなく通信帯域を削減する。
  • 理論的分析により、NEWTON-LEARN は局所線形および超線形収束を証明し、CNL はグローバルで部分線形および線形収束を示す。有利な条件下では超線形収束率を達成する。

実験結果

リサーチクエスチョン

  • RQ1分散2次最適化手法は、1次最適化手法と同等の通信効率を維持しながら、ニュートン法に類似した高速収束を達成できるか?
  • RQ2分散環境下で、高い通信コストを伴わずに、反復的にヘッセ行列情報を学習し、圧縮する方法は何か?
  • RQ33次正則化を用いる通信効率の高い2次最適化手法に対して、どのようなグローバル収束保証を確立できるか?
  • RQ4さまざまなデータセットおよび圧縮方式において、提案手法は最先端の1次および2次最適化手法と比較して、通信複雑度でどの程度優れているか?
  • RQ5手法の性能は、条件数や正則化パラメータにどの程度依存するか?

主な発見

  • NEWTON-LEARN は条件数に依存しない局所超線形収束を達成し、BFGS や ADIANA と比較して通信複雑度において顕著に優れている。
  • NL1 および NL2 は、特に低ランク圧縮(例:r = d/4)の下で、ニュートン法と比較して通信コストを数桁削減する。
  • CUBIC-NEWTON-LEARN はグローバルで部分線形および線形収束を達成し、有利な条件下では超線形収束率を示す。正則化パラメータが小さい場合、DIANA や DCGD よりも優れた性能を発揮する。
  • フィッシング、a9a、w8a といった実データセットにおいて、NL1 および NL2 は、すべての圧縮タイプにおいて ADIANA や DINGO よりも一貫して優れており、通信効率においてしばしば複数桁の優位性を示す。
  • 正則化パラメータが小さい場合(λ = 10⁻⁴、10⁻⁵)、CNL は条件数が高いために脆弱な1次最適化手法(DIANA や DCGD)と比較して顕著に優れた性能を発揮する。
  • 実験結果により、通信複雑度が性能の主なボトル neck であることが確認され、提案手法は収束速度と通信コストの間で優れたトレードオフを達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。