Skip to main content
QUICK REVIEW

[論文レビュー] Distributed Learning of Deep Neural Networks using Independent Subnet Training

Binhang Yuan, Wolfe, Cameron R.|arXiv (Cornell University)|Oct 4, 2019
Stochastic Gradient Optimization Techniques参考文献 74被引用数 14
ひとこと要約

本稿では、メモリ制限やプライバシー制限のある環境で、通信量を最小限に抑え、完全に分散型の学習を可能にする、全結合ニューラルネットワーク向けの新しい分散学習手法である独立サブネットワーク学習(IST)を提案する。この手法は、モデルを狭い、独立したサブネットワークに分解し、別々のデバイス上で局所的に学習することで、従来の分散手法と比較して顕著に高速な収束を達成する。

ABSTRACT

Distributed machine learning (ML) can bring more computational resources to bear than single-machine learning, thus enabling reductions in training time. Distributed learning partitions models and data over many machines, allowing model and dataset sizes beyond the available compute power and memory of a single machine. In practice though, distributed ML is challenging when distribution is mandatory, rather than chosen by the practitioner. In such scenarios, data could unavoidably be separated among workers due to limited memory capacity per worker or even because of data privacy issues. There, existing distributed methods will utterly fail due to dominant transfer costs across workers, or do not even apply. We propose a new approach to distributed fully connected neural network learning, called independent subnet training (IST), to handle these cases. In IST, the original network is decomposed into a set of narrow subnetworks with the same depth. These subnetworks are then trained locally before parameters are exchanged to produce new subnets and the training cycle repeats. Such a naturally "model parallel" approach limits memory usage by storing only a portion of network parameters on each device. Additionally, no requirements exist for sharing data between workers (i.e., subnet training is local and independent) and communication volume and frequency are reduced by decomposing the original network into independent subnets. These properties of IST can cope with issues due to distributed data, slow interconnects, or limited device memory, making IST a suitable approach for cases of mandatory distribution. We show experimentally that IST results in training times that are much lower than common distributed learning approaches.

研究の動機と目的

  • プライバシー制限やメモリ制限のため、データがデバイス間で断片化されている必須分散環境における深層ニューラルネットワークの学習の課題に対処すること。
  • 既存のデータ並列型およびモデル並列型手法に起因する高コストな通信や、非理想的なハードウェア環境における同期更新の必要性といった制限を克服すること。
  • データ共有や高帯域幅の通信インターコネクトを必要としない、効率的で完全に分散型の学習を可能にする手法を開発すること。
  • 実用的な分散制約下での完全結合ニューラルネットワークにおけるスケーラビリティと収束保証を確保すること。
  • モデルの精度と学習速度を維持しつつ、各デバイスのメモリ使用量を削減する学習フレームワークを設計すること。

提案手法

  • 全結合ニューラルネットワークを、複数の狭い、深さが一致するサブネットワークに分解し、それぞれを別々のデバイス上で独立して学習する。
  • 各サブネットワークを、そのデバイスの局所データ上で確率的勾配降下法を用いて局所的に学習し、デバイス間でのデータ転送を不要にする。
  • 局所学習後、サブネットワークの更新済みパラメータのみを交換して、次の反復のための新しいサブネットワークを構成する。
  • ドロップアウトにインspiredされたマスキング機構と近似行列乗算を用いて、効率的なパラメータ更新と通信オーバーヘッドの低減を実現する。
  • 圧縮反復最適化フレームワークを形式化し、滑らかさとノルム条件の仮定の下で、ISTの収束を証明する。
  • 理論的分析を通じて、ISTが通信頻度および通信量に依存性が低いサブ線形収束レートを達成できることを示す。

実験結果

リサーチクエスチョン

  • RQ1デバイス間でのデータ転送を回避しながらも、モデルの収束性と性能を維持できる分散学習手法を設計できるか?
  • RQ2通信帯域が限られている状況において、分散学習における通信量と頻度をどのように最小化できるか?
  • RQ3独立したサブネットワークを学習する分散型・モデル並列型アプローチに対して、どのような理論的収束保証を確立できるか?
  • RQ4メモリ制限およびネットワーク制限下でも、大規模なモデルやデータセットに対して効率的にスケーリングできる手法を開発できるか?
  • RQ5非理想的な分散環境下で、標準的なデータ並列型およびモデル並列型手法と比較して、ISTの学習効率はどのように異なるか?

主な発見

  • ISTは、通信遅延が高く帯域が限られている環境において、標準的な分散学習手法と比較して顕著に低い学習時間を達成する。
  • 本手法により、各デバイスがモデルパラメータのサブセットのみを保持するため、リソース制限のあるハードウェアでも学習が可能になる。
  • データ共有を一切必要としないため、フェデレーテッドラーニングなどのプライバシーに配慮した応用に適している。
  • 理論的分析により、ISTはモデルの滑らかさ、圧縮誤差、ノルム条件に依存するサブ線形収束レートで収束することが示された。
  • 実験的結果により、ISTは通信オーバーヘッドを著しく削減しながらも、集中型学習と同等のモデル精度を維持していることが確認された。
  • 収束境界は、勾配ノイズの有界性と圧縮演算子のノルム条件といった現実的な仮定の下で導出されており、実用的応用性が保証されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。