Skip to main content
QUICK REVIEW

[論文レビュー] Meta Learning Backpropagation And Improving It

Louis Kirsch, Jürgen Schmidhuber|arXiv (Cornell University)|Dec 29, 2020
Domain Adaptation and Few-Shot Learning参考文献 52被引用数 8
ひとこと要約

この論文は、バックプロパゲーションに類似した学習アルゴリズムのエンドツーエンド微分可能学習を可能にする、新しいメタラーニングフレームワークである変数共有メタラーニング(VSML)を紹介する。この手法は、ニューラルネットワークの重みを共有でスパースなLSTMに置き換えることで、勾配計算を明示的に行わずとも、前方ダイナミクスのみを用いて一般化可能な勾配フリーの学習ルールを学習する。これにより、Fashion MNISTのような未観測データセットへの優れたサンプル効率と一般化性能が達成される。

ABSTRACT

Many concepts have been proposed for meta learning with neural networks (NNs), e.g., NNs that learn to reprogram fast weights, Hebbian plasticity, learned learning rules, and meta recurrent NNs. Our Variable Shared Meta Learning (VSML) unifies the above and demonstrates that simple weight-sharing and sparsity in an NN is sufficient to express powerful learning algorithms (LAs) in a reusable fashion. A simple implementation of VSML where the weights of a neural network are replaced by tiny LSTMs allows for implementing the backpropagation LA solely by running in forward-mode. It can even meta learn new LAs that differ from online backpropagation and generalize to datasets outside of the meta training distribution without explicit gradient calculation. Introspection reveals that our meta learned LAs learn through fast association in a way that is qualitatively different from gradient descent.

研究の動機と目的

  • バックプロパゲーションのような固定で人間が設計したコンponentsに依存しない一般用途の学習アルゴリズム(LAs)を学習できるメタラーニングフレームワークを開発すること。
  • 従来のメタラーニング手法がタスク固有の解決策に過適合してしまうという限界を克服するため、重み共有とスパarsityを用いて $|V_L| \gg |V_M|$ の比を強く制約すること。
  • 強力で再利用可能なLAs(例:バックプロパゲーション)が、記号的プログラミングやハードコーディングされた計算グラフを必要とせずに、再帰的ダイナミクスに暗黙的に符号化可能であることを示すこと。
  • 多様なデータセットに一般化し、メタトレーニング分布を超えて、MNISTからFashion MNISTへの分布外タスクに対しても一般化可能なメタ最適化された学習アルゴリズムを可能にすること。

提案手法

  • 標準的なニューラルネットワークの重みを、小さな共有LSTMに置き換えることで、変数共有メタラーニング(VSML)アーキテクチャを構築する。
  • 重み行列におけるスパース接続を用いることで、パラメータ数を削減しながら表現力を維持し、効率的なパラメータ再利用を実現する。
  • RNNが前方ダイナミクスを通じて学習ルールを学習するように、エンドツーエンドでメタ最適化を実行する。
  • システムを単一のスパースで共有重みを持つRNN、またはメッセージをやり取りする複数のRNNとして解釈することで、再帰的ダイナミクスによる自己発生的信用割り当てを可能にする。
  • RNNがタスクの分布上でトレーニングされることで、一般用途のLAを学習するメタ最適化ループを採用する。
  • 内省と学習アルゴリズムクローンを適用し、学習されたLAsが勾配降下とは質的に異なる高速で関連的学習を実行することを確認する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークは、勾配計算を明示的に実行せずとも、前方モードダイナミクスのみを用いてバックプロパゲーションを実装できるか?
  • RQ2メタトレーニング分布外のデータセット(例:MNISTからFashion MNIST)に対しても、メタ学習された学習アルゴリズムは一般化可能か?
  • RQ3メタ学習された学習アルゴリズムは、確率的勾配降下とは質的に異なる学習ダイナミクスを示すか?
  • RQ4RNNアーキテクチャにおける重み共有とスパarsityは、一般用途で再利用可能な学習アルゴリズムの発見を可能にするか?
  • RQ5VSMLの性能は、サンプル効率と一般化の観点で、標準的なバックプロパゲーションと比較してどうなるか?

主な発見

  • VSMLは、勾配計算や記号的プログラミングを明示的に行わずとも、前方モードダイナミクスのみを用いてバックプロパゲーションに類似した学習アルゴリズムを成功裏に学習した。
  • メタ学習された学習アルゴリズムは、MNISTでトレーニングされたにもかかわらず、Fashion MNISTのような未観測データセットに対しても一般化でき、分布外一般化性能が顕著に優れている。
  • 内省の結果、学習されたLAsは勾配降下とは異なり、高速で関連的メカニズムに依存していることが判明し、質的に異なる学習プロセスであることが示された。
  • 特に少サンプル学習や継続的学習の設定において、標準的なバックプロパゲーションと比較して、MNISTでの性能が競争力を持ち、サンプル効率が向上した。
  • 本手法は多様な環境やタスクに一般化可能であり、継続的かつサンプル効率の高い学習への応用可能性が示唆された。
  • 有望な結果が得られた一方で、現在の実装は早期収束を示し、標準的なバックプロパゲーションよりも計算コストが高いため、最適化とスケーリングの余地がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。