Skip to main content
QUICK REVIEW

[論文レビュー] RelaySum for Decentralized Deep Learning on Heterogeneous Data

Thijs Vogels, Lie He|arXiv (Cornell University)|Oct 8, 2021
Privacy-Preserving Technologies in Data参考文献 44被引用数 7
ひとこと要約

本稿では、データの非独立同分布性にかかわらず有限時間内に正確に均等にモデル更新を配布できる、分散型確率的勾配降下法であるRelaySGDを提案する。この手法は、スパニングツリーに基づくメッセージリレーメカニズム「RelaySum」を用いる。Gossip平均化とは異なり、信号の減衰や漸近的収束に依存せず、ネットワーク径に比例する遅延内で、各ワーカーがすべての更新を完全で減衰のない形で受信できる。これにより、非均質なデータにおいても、収束保証付きで強固でスケーラブルかつ高精度な学習が可能となる。

ABSTRACT

In decentralized machine learning, workers compute model updates on their local data. Because the workers only communicate with few neighbors without central coordination, these updates propagate progressively over the network. This paradigm enables distributed training on networks without all-to-all connectivity, helping to protect data privacy as well as to reduce the communication cost of distributed training in data centers. A key challenge, primarily in decentralized deep learning, remains the handling of differences between the workers' local data distributions. To tackle this challenge, we introduce the RelaySum mechanism for information propagation in decentralized learning. RelaySum uses spanning trees to distribute information exactly uniformly across all workers with finite delays depending on the distance between nodes. In contrast, the typical gossip averaging mechanism only distributes data uniformly asymptotically while using the same communication volume per step as RelaySum. We prove that RelaySGD, based on this mechanism, is independent of data heterogeneity and scales to many workers, enabling highly accurate decentralized deep learning on heterogeneous data. Our code is available at http://github.com/epfml/relaysgd.

研究の動機と目的

  • 分散型ディープラーニングにおけるデータの非独立同分布性の課題に対処し、従来のGossip平均化が遅く偏った収束を引き起こす問題を解消すること。
  • 非漸近的収束や信号の減衰を回避し、有限時間内に正確かつ均等にモデル更新を配布する通信メカニズムを設計すること。
  • 各ワーカーの局所的データ分布の変化にかかわらず、収束速度と精度を維持する分散型学習アルゴリズムを開発すること。
  • 中央集権的サーバーなしで、プライバシーを守りながら大規模ネットワーク上でスケーラブルかつ耐障害性を備えた分散学習を実現すること。

提案手法

  • RelaySumはスパニングツリーを用いて、各ワーカーからのモデル更新を中間ノードを介して全ワーカーにルーティングし、更新が完全な重みで減衰せずに届くように保証する。
  • 各ノードは中継役として機能し、エッジに沿ってメッセージを転送するが、再重み付けを行わず、複数のソースからのメッセージを加算することで通信コストを一定に保つ。
  • アルゴリズムは分散的にスパニングツリー協定を用いて構築され、任意のネットワークトポロジーに適用可能である。
  • RelaySGDはRelaySumを確率的勾配降下法に統合し、各ワーカーが局所勾配とリレーツリー経由で受信した均等なグローバル更新を平均化する。
  • 通信量は1ステップあたりO(n)(エッジ1本あたり1メッセージ)に抑えられ、Gossip平均化と同等の帯域幅コストを維持するが、有限時間内に正確な均等配布を達成する。
  • 理論的解析により、収束はスペクトルギャップではなくネットワーク径に依存するため、不規則なグラフにおける混合性の悪さに対しても頑健であることが示された。

実験結果

リサーチクエスチョン

  • RQ1データの非独立同分布性に依存せず、有限時間内にすべてのワーカーに正確に均等にモデル更新を配布できる分散型学習アルゴリズムは実現可能か?
  • RQ2更新伝搬が正確かつ遅延が有界である場合、漸近的Gossip平均化と比較して分散型SGDの収束特性はどのように変化するか?
  • RQ3Gossip平均化と同等の帯域コストを維持しながら、複数ホップにわたる信号の減衰を排除できる通信メカニズムは設計可能か?
  • RQ4特に従来の理論的に頑健とされる手法が実際には失敗する状況において、RelaySGDは既存の分散型手法を上回る性能を示せるか?
  • RQ5特にツリー型トポロジーと一般のグラフとの比較において、ネットワークトポロジーは分散型ディープラーニングの収束性とスケーラビリティにどのような影響を与えるか?

主な発見

  • RelaySGDはデータの非独立同分布性に依存せず収束し、ε-最適性を達成するための理論的反復複雑度がO(1/ε³/² + 1/ε)で抑えられる。ここでεは目標精度を表す。
  • 収束速度はスペクトルギャップではなくネットワーク径τ_maxに依存するため、接続性が低いか不規則なトポロジーに対しても頑健である。
  • 二重バイナリツリー構造では、RelaySGDは定数メモリ(2つの追加モデルコピー)で動作し、1反復あたり送信・受信するパラメータは2つに抑えられ、線形スケーラビリティを達成する。
  • CIFAR-10とVGG-11を用いた実験では、非均質なデータにおいて、標準的なGossipベースの手法やヒューリスティックな代替手法を上回る性能を示した。特にモーメンタムを用いない状況で顕著であった。
  • 勾配平均化を用いる変種であるRelaySGD/Gradは、固定学習率下で収束が平坦化するのに対し、RelaySGDは線形収束を示し、非独立同分布性の影響をより受けにくい。
  • 実験結果から、極端なデータスケュー下でも、RelaySGDは高い精度(α=0.01のときCIFAR-10でトップ1精度88.4%)を維持しており、ベースラインのGossip手法やモーメンタム拡張型手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。