Skip to main content
QUICK REVIEW

[論文レビュー] Parallelizing Over Artificial Neural Network Training Runs with Multigrid

Jacob B. Schroder|arXiv (Cornell University)|Aug 7, 2017
Neural Networks and Applications参考文献 3被引用数 7
ひとこと要約

本論文は、人工ニューラルネットワークの逐次的トレーニングランを並列化するための多スケール時間削減(MGRIT)アルゴリズムの新しい応用を提案する。各トレーニングステップを時間的進化とみなすことで、ネットワーク重みの更新を進化方程式として再定式化し、MGRITは従来の逐次的トレーニングと同一の解に収束する一方で、数千のトレーニングステップを同時に処理可能となる。モデル問題において顕著な高速化が示された。

ABSTRACT

Artificial neural networks are a popular and effective machine learning technique. Great progress has been made parallelizing the expensive training phase of an individual network, leading to highly specialized pieces of hardware, many based on GPU-type architectures, and more concurrent algorithms such as synthetic gradients. However, the training phase continues to be a bottleneck, where the training data must be processed serially over thousands of individual training runs. This work considers a multigrid reduction in time (MGRIT) algorithm that is able to parallelize over the thousands of training runs and converge to the exact same solution as traditional training would provide. MGRIT was originally developed to provide parallelism for time evolution problems that serially step through a finite number of time-steps. This work recasts the training of a neural network similarly, treating neural network training as an evolution equation that evolves the network weights from one step to the next. Thus, this work concerns distributed computing approaches for neural networks, but is distinct from other approaches which seek to parallelize only over individual training runs. The work concludes with supporting numerical results for two model problems.

研究の動機と目的

  • 深層ニューラルネットワークにおける逐次的トレーニングの継続的ボトルneckを解消するため。
  • トレーニングステップを時間的進化とみなすことにより、MGRITのような時間方向並列化手法がニューラルネットワークトレーニングに適用可能かどうかを検討するため。
  • 解の正確性を保持しつつ、トレーニングランにわたる並列化を可能にする非侵襲的かつスケーラブルなアプローチを開発するため。
  • 異なるアーキテクチャとソルバ設定を用いたモデル問題を用いて、MGRITがニューラルネットワークトレーニングに適用可能かどうか、およびその性能を調査するため。

提案手法

  • 各トレーニングステップ i を時間的増分とみなして、w_{i+1} = Φ(w_i) の形でニューラルネットワークトレーニングを進化方程式として再定式化する。
  • MGRITアルゴリズムを適用し、粗化されたトレーニングステップ集合を用いた階層的マルチグリッドレベルを用いて収束を加速する。
  • 正確性と安定性を維持するため、学習率を調整するか、Φを二回適用することで粗いレベルの伝搬子 Φ^(ℓ) を定義する。
  • マルチグリッドソルバで F-サイクルと V-サイクルを用い、収束を改善するため、粗いレベルで緩和パラメータ α^(ℓ) を増加させる。
  • 従来の逐次的トレーニングコード Φ を変更せずにラップする非侵襲的フレームワークを実装する。
  • α^(ℓ) を粗いレベルで増加させる戦略や、すべてのトレーニング例を逐次処理することで、並列性とスケーラビリティを向上させる。

実験結果

リサーチクエスチョン

  • RQ1MGRITは、人工ニューラルネットワークトレーニングにおけるトレーニングランのシーケンスを並列化するために効果的に適用可能か?
  • RQ2並列処理されたトレーニングステップを扱うにもかかわらず、MGRITベースのアプローチは従来の逐次的トレーニングと同一の解に収束するか?
  • RQ3異なる緩和戦略と粗いレベルの伝搬子の構築法が収束性とスケーラビリティに与える影響は何か?
  • RQ4モデル問題におけるニューラルネットワークトレーニングにMGRITを適用することで、どの程度の高速化が達成可能か?
  • RQ5異なるネットワークアーキテクチャとソルバ設定は、MGRITアプローチの性能と頑健性にどのように影響を与えるか?

主な発見

  • MGRITはトレーニングステップにわたる並列処理に成功し、従来の逐次的トレーニングと同一の解に収束することを確認した。これにより、本手法の核心仮説が妥当であることが裏付けられた。
  • Solver 2 を用いた4層モデル問題において、12,800ステップのトレーニングで最大約13倍の潜在的高速化が達成された。反復回数はゆっくりと増加した。
  • F-サイクルの結果、粗いレベルで α^(ℓ) を徐々に増加させる(1.25^ℓ)ことで、固定値を用いた場合に見られた劣化が解消された。
  • V-サイクルの収束は、最大の問題サイズ(12,800ステップ)でわずかに説明不能な劣化を示したが、反復回数は管理可能であった。
  • Solver 3 は、すべての問題サイズで最も頑健な性能を示し、広範な応用可能性を示唆した。
  • 本手法は非侵襲的であり、既存の逐次的トレーニングコードを最小限の変更で利用可能にし、即座に現在のワークフローに統合できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。