Skip to main content
QUICK REVIEW

[論文レビュー] Distributed Deep Learning with Event-Triggered Communication

Jemin George, Prudhvi Gurram|arXiv (Cornell University)|Sep 8, 2019
Stochastic Gradient Optimization Techniques参考文献 53被引用数 8
ひとこと要約

本稿では、非凸最適化の収束を維持しながら通信量を削減するための、イベントトリガー通信を用いた分散ディープラーニングアルゴリズムであるDETSGRADを提案する。エージェントは局所的な誤差閾値を超えた場合にのみ、周期的でない頻度でモデルパラメータを更新し、通信負荷を著しく低減しながら、中央集権的学習と同等の性能を達成する。

ABSTRACT

We develop a Distributed Event-Triggered Stochastic GRAdient Descent (DETSGRAD) algorithm for solving non-convex optimization problems typically encountered in distributed deep learning. We propose a novel communication triggering mechanism that would allow the networked agents to update their model parameters aperiodically and provide sufficient conditions on the algorithm step-sizes that guarantee the asymptotic mean-square convergence. The algorithm is applied to a distributed supervised-learning problem, in which a set of networked agents collaboratively train their individual neural networks to recognize handwritten digits in images, while aperiodically sharing the model parameters with their one-hop neighbors. Results indicate that all agents report similar performance that is also comparable to the performance of a centrally trained neural network, while the event-triggered communication provides significant reduction in inter-agent communication. Results also show that the proposed algorithm allows the individual agents to recognize the digits even though the training data corresponding to all the digits are not locally available to each agent.

研究の動機と目的

  • 中央集権的なデータ転送に起因する通信コストとプライバシー懸念を低減すること。
  • マスタースレーブ依存関係のない完全に分散化されたピアツーピア学習アーキテクチャの構築。
  • 確率的勾配法を用いて、ディープラーニングで一般的な非凸最適化問題における収束を実現すること。
  • イベントトライガー方式を用いてエージェント間通信頻度を低減しつつ、モデル性能を維持すること。
  • 周期的でない通信効率の良い更新において、理論的収束保証を確保すること。

提案手法

  • エージェントが局所的な誤差閾値を超えた場合にのみ更新を行う、新しいイベントトライガー通信メカニズムを提案。
  • 非凸最適化を想定した分散イベントトライガー確率的勾配降下法(DETSGRAD)アルゴリズムを設計。
  • 隣接エージェント間のパラメータ交換をトリガーするための局所的誤差指標を導入。
  • 漸近的平均二乗収束を保証するためのステップサイズに関する十分条件を提示。
  • 分散型教師あり学習タスクに適用し、分散データとピアツーピアモデル共有を実現。
  • 局所的更新と周期的でないグローバル同期を組み合わせた確率的勾配降下法を活用し、通信負荷を低減。

実験結果

リサーチクエスチョン

  • RQ1イベントトライガー通信は、分散ディープラーニングにおける収束を維持しつつ、エージェント間通信量を削減できるか?
  • RQ2中央サーバーやマスターノードを一切持たない完全に分散化されたピアツーピア学習アーキテクチャをどのように設計できるか?
  • RQ3周期的でない更新において、非凸分散最適化で漸近的平均二乗収束を保証するためのステップサイズ条件は何か?
  • RQ4全訓練データの一部しか入手できないエージェントが、中央集権的学習と同等の性能を達成できるか?
  • RQ5イベントトライガー通信は、分散学習タスクにおいてどの程度モデル精度を維持できるか?

主な発見

  • すべてのエージェントが、中央集権的に訓練されたニューラルネットワークと同等の性能を示した。
  • イベントトライガー通信により、周期的または連続的通信と比較して、エージェント間通信量が顕著に削減された。
  • 全データセットの一部しか入手できないにもかかわらず、すべてのエージェントがすべての数字を正しく認識できるようになった。
  • 理論的分析により、適切なステップサイズ条件下で漸近的平均二乗収束が保証された。
  • 通信が稀で周期的でない状況でも、アルゴリズムは性能を維持した。
  • 期待値の勾配ノルムがゼロに収束することを解析的に証明し、効果的な最適化が実現されたことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。