Skip to main content
QUICK REVIEW

[論文レビュー] Dual-Free Stochastic Decentralized Optimization with Variance Reduction

Hadrien Hendrikx, Francis Bach|arXiv (Cornell University)|Jun 25, 2020
Stochastic Gradient Optimization Techniques参考文献 38被引用数 6
ひとこと要約

本稿では、双対変数を必要とせず、局所的な確率的勾配のみを用いて分散低減を達成する双対フリーな確率的分散型最適化アルゴリズムDVRを提案する。この手法は、全データの1/nのデータ量で動作する単一マシン用確率的分散低減手法と同等の計算効率を達成する。Bregman勾配降下法を特定のBregman発散に基づく双対問題に適用することで、双対計算を排除し、高価な近接オракルや共役勾配オラクルを必要とせず、高速な収束を実現する。

ABSTRACT

We consider the problem of training machine learning models on distributed data in a decentralized way. For finite-sum problems, fast single-machine algorithms for large datasets rely on stochastic updates combined with variance reduction. Yet, existing decentralized stochastic algorithms either do not obtain the full speedup allowed by stochastic updates, or require oracles that are more expensive than regular gradients. In this work, we introduce a Decentralized stochastic algorithm with Variance Reduction called DVR. DVR only requires computing stochastic gradients of the local functions, and is computationally as fast as a standard stochastic variance-reduced algorithms run on a $1/n$ fraction of the dataset, where $n$ is the number of nodes. To derive DVR, we use Bregman coordinate descent on a well-chosen dual problem, and obtain a dual-free algorithm using a specific Bregman divergence. We give an accelerated version of DVR based on the Catalyst framework, and illustrate its effectiveness with simulations on real data.

研究の動機と目的

  • 既存手法が線形収束を達成できないか、高価な双対オラクルを必要とする分散型確率的最適化におけるギャップを埋めること。
  • 双対変数や複雑なサブルーチンに依存せずに、単一マシン用確率的分散低減手法と同等の計算速度を達成する分散型アルゴリズムを設計すること。
  • 分散型環境においてBregman発散と分散低減を活用することで、計算および通信の両面で最適な収束レートを達成すること。
  • 近接作用素やFenchel共役勾配を必要としない実用的で効率的な分散型確率的最適化手法の代替案を提供すること。

提案手法

  • 適切に選ばれた双対問題に対してBregman座標降下法を適用することで、双対フリーな手法を導出するDVR(分散型分散低減)アルゴリズムを提案する。
  • 特定のBregman発散を用いることで、双対変数や共役勾配の計算を回避し、実装を簡素化する。
  • 局所関数の確率的勾配のみを用い、近接作用素やFenchel共役を必要とする高価なオラクルを避ける。
  • Catalystフレームワークを用いた加速版を導入し、収束レートを向上させつつ計算効率を維持する。
  • gossip行列の固有値スペクトルおよび条件数を用いて、仮想誤差とパrameterのずれをバウンディングすることで収束保証を導出する。
  • 外側の反復でウォームスタート戦略を採用し、直前の反復結果を活用して内側の仮想降下ステップの収束を加速する。

実験結果

リサーチクエスチョン

  • RQ1双対変数や高価なオラクルを必要とせず、単一マシン用確率的分散低減手法と同等の計算効率を達成できる分散型確率的最適化アルゴリズムは構築可能か?
  • RQ2局所的な確率的勾配計算のみで、双対フリーな分散型アルゴリズムが線形収束を維持できるか?
  • RQ3双対問題にBregman座標降下法を適用することで、分散型環境において計算的に効率的で双対フリーなアルゴリズムを実現できるか?
  • RQ4通信コストとネットワーク構造(スペクトルギャップγによる)が、分散低減型分散最適化アルゴリズムの収束に与える影響は何か?
  • RQ5Catalystフレームワークによる加速は、計算効率を保ちつつ分散型確率的最適化に効果的に適用可能か?

主な発見

  • DVRは、全データセットの1/nのデータ量で動作する標準的な確率的分散低減アルゴリズムと同等の計算複雑度を達成し、ノードごとの計算量を顕著に削減する。
  • アルゴリズムは局所的確率的勾配評価のみを必要とし、近接作用素やFenchel共役勾配を必要としないため、計算的に高価なオラクルを回避できる。
  • Catalystフレームワークに基づく加速版DVRは、対数要因を除き最適なO(√κb(1 + τ/√γ) log(ε⁻¹))の収束レートを達成する。
  • RCV1データセットにおけるシミュレーションでは、通信コストτが中程度のとき、加速DVRが標準的および加速型EXTRAを上回る全体の実行時間性能を示す。
  • アルゴリズムは、確率的条件数κsとネットワークのスペクトルギャップγに依存する線形収束レートを維持し、さまざまなグラフトポロジに対して頑健であることが示された。
  • 理論的解析により、内側ループの仮想誤差が(1−ρ)^Kのレートで幾何的に減少することが確認され、Kを適切に選べば高速収束が保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。