Skip to main content
QUICK REVIEW

[論文レビュー] Layer-Parallel Training of Deep Residual Neural Networks

Stefanie Günther, Lars Ruthotto|arXiv (Cornell University)|Dec 11, 2018
Advanced Neural Network Applications参考文献 48被引用数 9
ひとこと要約

本稿では、誤差逆伝播法を最適制御問題に再定式化し、時系列方向に並列化する多重グリッド法(MGRIT)を適用することで、深層残差ニューラルネットワーク(ResNets)のレイヤー並列学習を提案する。この手法は、従来のレイヤー逐次学習と比較して最大8.5倍の高速化を達成しながら同等のモデル精度を維持しており、レイヤー間の新たな並列性を実現することでスケーラブルな学習を実現している。

ABSTRACT

Residual neural networks (ResNets) are a promising class of deep neural networks that have shown excellent performance for a number of learning tasks, e.g., image classification and recognition. Mathematically, ResNet architectures can be interpreted as forward Euler discretizations of a nonlinear initial value problem whose time-dependent control variables represent the weights of the neural network. Hence, training a ResNet can be cast as an optimal control problem of the associated dynamical system. For similar time-dependent optimal control problems arising in engineering applications, parallel-in-time methods have shown notable improvements in scalability. This paper demonstrates the use of those techniques for efficient and effective training of ResNets. The proposed algorithms replace the classical (sequential) forward and backward propagation through the network layers by a parallel nonlinear multigrid iteration applied to the layer domain. This adds a new dimension of parallelism across layers that is attractive when training very deep networks. From this basic idea, we derive multiple layer-parallel methods. The most efficient version employs a simultaneous optimization approach where updates to the network parameters are based on inexact gradient information in order to speed up the training process. Using numerical examples from supervised classification, we demonstrate that the new approach achieves similar training performance to traditional methods, but enables layer-parallelism and thus provides speedup over layer-serial methods through greater concurrency.

研究の動機と目的

  • 深層ResNetsの学習におけるスケーラビリティのボトルネック(順次的レイヤー単位の順方向および逆方向伝播によるもの)を解消すること。
  • ResNetの学習と時間に依存する力学的系の最適制御問題との数学的類似性を活用し、時系列方向に並列化可能な手法を適用すること。
  • レイヤー方向の逐次的伝播を非線形多重グリッド反復に置き換えることで、レイヤー間における新たな並列性を実現すること。
  • 学習速度、収束性、最終的なモデル精度の観点から、レイヤー並列学習の性能と効率を評価すること。
  • 不正確な勾配情報や同時最適化の使用を検討し、さらに学習を高速化する可能性を調査すること。

提案手法

  • ネットワーク重みを非線形初期値問題における時間に依存する制御変数として定式化することで、ResNetの学習を最適制御問題に再定式化する。
  • 時系列方向の多重グリッド法(MGRIT)を用いて、レイヤー全体にわたる状態方程式および随伴方程式を並列に解き、逐次的な順方向および逆方向伝播を置き換える。
  • 2つの変種を開発:(1) 標準的な誤差逆伝播法のMGRITによる置き換え、(2) 不正確な勾配情報を用いた同時レイヤー並列アプローチ。
  • 非線形多重グリッドサイクルを用いて、レイヤー単位の連立式を効率的に解き、レイヤーのチャンクにわたる並列更新を可能にする。
  • アーキテクチャの変更なしに、確率的勾配降下法(SGD)を含む標準的な学習フレームワークに統合する。
  • 非侵襲的であるMGRITの特性を踏まえ、並列効率は低下する可能性があるが、依然として顕著な実行時間の短縮が達成できることを認識し、実行時間の観点から効率を定義する。

実験結果

リサーチクエスチョン

  • RQ1MGRITのような時系列方向に並列化可能な手法を、レイヤーを時間ステップとみなして深層ResNetsの学習に効果的に適用できるか?
  • RQ2MGRITを用いたレイヤー並列学習は、レイヤー逐次学習と比較して顕著な高速化を達成するか、かつモデル精度を維持するか?
  • RQ3同時レイヤー並列アプローチにおける不正確な順方向および逆方向伝播は、学習性能にどの程度影響を与えるか?
  • RQ4ネットワークの深さおよび計算コア数の増加に伴い、この手法はどの程度スケーリングするか?
  • RQ5TensorFlow や PyTorch などの既存のディープラーニングフレームワークに、大きな変更なしに統合可能か?

主な発見

  • MNISTデータセットにおいて、128コアを用いてレイヤー並列学習を実行した結果、学習時間を619分から71分に短縮し、最大8.5倍の高速化を達成した。
  • PeaksおよびIndian Pinesデータセットでは、それぞれ256コアおよび128コアを用いて6.0倍および4.4倍の高速化が確認され、ネットワークの深さに応じたスケーラビリティが示された。
  • MGRIT置換アプローチおよび同時レイヤー並列アプローチの両方とも、標準的なレイヤー逐次学習と同等の損失関数値および検証精度を達成した。
  • 同時アプローチで不正確な勾配を用いることで、内部反復の精度が低下したが、学習性能は維持され、各反復の高速化が達成された。
  • 本手法により、真のレイヤー並列性が実現され、深層ネットワークにおける逐次的レイヤー伝播の線形スケーリングボトルネックが解消された。
  • 結果から、高速化された学習により、より効率的なハイパーパramータ探索が可能となり、実用的な文脈でより優れたモデル性能が得られる可能性があると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。