Skip to main content
QUICK REVIEW

[論文レビュー] Reducing the Training Time of Neural Networks by Partitioning

Conrado Silva Miranda, Fernando J. Von Zuben|arXiv (Cornell University)|Nov 10, 2015
Stochastic Gradient Optimization Techniques参考文献 20被引用数 6
ひとこと要約

本論文は、ニューラルネットワークを複数の小さな独立したサブモデルに分割し、同じタスク上で並列に学習させる、新たな事前学習手法を提案する。この手法により、パフォーマンスを損なわずに学習時間を短縮できる。サブモデルは分割数にほぼ逆2乗に比例してスケーリングされるため、特に大きなモデルでは最大3.3倍の高速化を達成する。また、既存の学習フレームワークと互換性があり、分散学習における潜在的な利点を提供する。

ABSTRACT

This paper presents a new method for pre-training neural networks that can decrease the total training time for a neural network while maintaining the final performance, which motivates its use on deep neural networks. By partitioning the training task in multiple training subtasks with sub-models, which can be performed independently and in parallel, it is shown that the size of the sub-models reduces almost quadratically with the number of subtasks created, quickly scaling down the sub-models used for the pre-training. The sub-models are then merged to provide a pre-trained initial set of weights for the original model. The proposed method is independent of the other aspects of the training, such as architecture of the neural network, training method, and objective, making it compatible with a wide range of existing approaches. The speedup without loss of performance is validated experimentally on MNIST and on CIFAR10 data sets, also showing that even performing the subtasks sequentially can decrease the training time. Moreover, we show that larger models may present higher speedups and conjecture about the benefits of the method in distributed learning systems.

研究の動機と目的

  • 深層ニューラルネットワークの学習時間を短縮するが、最終的なパフォーマンスを損なわないこと。
  • 特にリソース制限や分散環境下での大規模モデルの事前学習にかかる高コストを軽減すること。
  • 元の学習タスクを維持することで、サブモデルを並列かつ通信不要に学習可能にすること。
  • 本手法のスケーラビリティと効率性を、より大きなモデルおよび分散学習システムにおいて評価すること。
  • 既存のアーキテクチャ、最適化手法、損失関数と互換性を持つ事前学習アプローチを提供すること。

提案手法

  • ニューラルネットワークを複数の小さなサブモデルに分割し、それぞれを同じ元のタスク上で独立に学習する。
  • 各サブモデルは入力データのサブセットを学習し、パラメータはランダムに初期化され、標準的な誤差逆伝播法で更新される。
  • 学習後、サブモデルの重みを結合することで、元のネットワーク全体の事前学習初期モデルが形成される。
  • 異なるランダム初期化と重み転送時のノイズ注入により、サブモデルが多様な表現を学習することを保証する。
  • マージ処理には、各パrameterセットに最大絶対値の2%の均一ノイズを追加し、蓄積されたモーメンタムをゼロにリセットする。
  • 標準的な学習パイプラインと互換性があり、任意のニューラルネットワークアーキテクチャ、最適化手法、損失関数に適用可能である。

実験結果

リサーチクエスチョン

  • RQ1独立したサブモデルにニューラルネットワークを分割することで、最終パフォーマンスを損なわず事前学習時間を短縮できるか?
  • RQ2サブモデル数やモデルサイズの増加に伴い、学習の高速化はどのようにスケーリングされるか?
  • RQ3サブモデルを並列ではなく逐次に学習した場合でも、本手法は高速化を達成できるか?
  • RQ4サブモデルが学習する表現の多様性が、マージ後の一般化性能向上に寄与するか?
  • RQ5分散学習やモデル並列学習システムにおいて、本手法がもたらす潜在的な利点は何か?

主な発見

  • 2つのサブモデルを作成した場合、パラメータ数43万の3層モデルでは2.1倍、210万パラメータの4層モデルでは3.3倍の高速化を達成した。
  • サブモデルを逐次に学習した場合でも、元のフルモデルを直接学習する場合と比較して1.45倍の高速化を達成した。
  • MNISTおよびCIFAR10における実験から、最終的なパフォーマンスに劣化がなく、維持されたことが確認された。
  • 分割数の増加に伴い、サブモデルが学習する表現のペアワイズ多様性が向上し、本手法の設計が裏付けられた。
  • サブモデルあたりのパラメータ数をほぼ逆2乗に比例して減少させることで、分散学習における通信オーバーヘッドが低減された。
  • 既存の学習フレームワークと互換性があり、Net2Netを用いたモデル拡張手法とも組み合わせ可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。