Skip to main content
QUICK REVIEW

[論文レビュー] Backprop Evolution

Maximilian Alber, Irwan Bello|arXiv (Cornell University)|Aug 8, 2018
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

この論文は、ドメイン特化言語における原始関数の合成としてバックプロパゲーション式を扱うことで、自動的に新しいバックプロパゲーション更新則を発見する進化的探索手法を提案する。初期学習段階で標準のバックプロパゲーションを上回る複数の更新則を発見し、20エポック後の大きなモデルでは最大15%の精度向上を達成したが、収束時には標準性能と同等であった。

ABSTRACT

The back-propagation algorithm is the cornerstone of deep learning. Despite its importance, few variations of the algorithm have been attempted. This work presents an approach to discover new variations of the back-propagation equation. We use a domain specific lan- guage to describe update equations as a list of primitive functions. An evolution-based method is used to discover new propagation rules that maximize the generalization per- formance after a few epochs of training. We find several update equations that can train faster with short training times than standard back-propagation, and perform similar as standard back-propagation at convergence.

研究の動機と目的

  • 深層学習における一般化性能を向上させる、自動で発見可能な改善されたバックプロパゲーション更新則の開発。
  • ニューラルネットワークの学習に根幹的な役割を果たすバックプロパゲーションにおいて、実用的な変種が不足している問題の解決。
  • 数学的演算のドメイン特化言語上で進化的探索を実施することで、標準のバックプロパゲーションよりも優れた学習ダイナミクスをもたらすかの調査。
  • 発見された更新則が、モデルアーキテクチャーや学習期間に跨って一般化するかの評価。
  • 収束時に最終性能を損なわず収束を加速させる更新則の同定、特に早期停止やハイパーパramータ探索の文脈で有用。

提案手法

  • 本手法は、ドメイン特化言語(DSL)を用い、バックプロパゲーション更新式を、被演算子(例:重み、活性化、勾配)、単項関数(例:転置、ReLU、ドロップアウト)、および二項関数(例:加算、要素ごとの乗算)の合成として表現する。
  • 進化的コントローラーは、事前に定義された関数および被演算子の集合から選択し、誤差勾配更新 $ b^{p}_i $ の式を生成・変異化する。
  • 各候補式は、固定されたニューラルネットワークアーキテクチャ(例:WRN 16-2、WRN 10-1)を用いて、提案された更新則で学習させ、固定エポック数後に検証精度を報告することで評価される。
  • 探索は初期エポック後の一般化性能を最大化するように条件付けられ、モデルサイズや学習期間を変えて結果をテストすることで、耐性および転送可能性を評価する。
  • 進化的プロセスはコントローラー・ワーカーのアーキテクチャを採用:コントローラーが変異を加えた式のバッチをワーカーに送信し、ワーカーはモデルを学習して検証精度を返却し、選抜およびさらなる変異に用いる。
  • 本手法は、標準のSGDとSGDにモーメンタムを適用した場合の両方を評価し、ベースラインとなる標準バックプロパゲーションと比較する。

実験結果

リサーチクエスチョン

  • RQ1ドメイン特化言語上で進化的探索を実施することで、初期学習段階において標準バックプロパゲーションを上回る一般化性能を示す更新則を発見できるか?
  • RQ2発見された更新則は、同じモデルのより深いまたは広いバージョンのような、より大きなニューラルネットワークアーキテクチャにも一般化可能か?
  • RQ3発見されたルールは収束時に性能を維持するのか、それとも初期学習ダイナミクスの向上に限定されるのか?
  • RQ4最適化にモーメンタムを組み込むことで、発見された更新則の耐性はどのように変化するか?
  • RQ5発見された式に一貫した構造的パターンが存在するか。これにより、将来のより効果的なバックプロパゲーション変種の設計に寄与できるか?

主な発見

  • 進化的探索により、WRN 16-2で20エポック学習した後、検証精度が標準バックプロパゲーションを上回る更新式が発見された。SGDでは最大1.2%、SGDにモーメンタムを適用した場合では最大0.8%の向上を達成した。
  • より大きなWRN 28-10モデルでは、SGDで20エポック学習した場合、最良の発見された式が標準バックプロパゲーションを15%上回る精度を達成した。モーメンタムを適用した場合でも10%の向上を示した。
  • 100エポック学習した場合、発見された式は標準バックプロパゲーションと同等の性能を示した。これは、主に初期収束を加速させるものであり、最終的な一般化性能の向上ではないことを示している。
  • 最も優れた式は、異なるモデルアーキテクチャーや学習環境においても耐性を示した。これは、探索段階で小さなモデルを効果的に使用できることを示唆している。
  • SGDにモーメンタムを適用した場合の探索結果はベースラインと同等であった。これは、モーメンタムが更新則の選択に対する感受性を低下させている可能性を示している。
  • 特定の式、例えば $ (0.5g^{p}_{i}) / ( ext{softplus}( rac{ ext{d}h_{i}}{ ext{d}h^{p}_{i}}}) + 0.1) $ は87.72%の精度を達成し、$ (g^{p}_{i} imes ext{clip}_{1.0}(b^{p}_{i+1} rac{ ext{d}h^{p}_{i+1}}{ ext{d}h_{i}})) $ は88.93%の精度を達成した。両者とも初期学習段階でベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。