Skip to main content
QUICK REVIEW

[論文レビュー] A Biologically Plausible Learning Rule for Deep Learning in the Brain

Isabella Pozzi, Sander M. Bohté|arXiv (Cornell University)|Nov 5, 2018
Advanced Memory and Neural Computing参考文献 35被引用数 17
ひとこと要約

本稿では、グローバルな報酬予測誤差と局所的な注意フィードバックを用いて、試行錯誤による画像分類タスクを深層ニューラルネットワークが学習可能にする、生物学的に妥当な強化学習ルール、Q-AGRELを提案する。バックプロパゲーションと同等の性能を達成しており、CIFAR100(100クラス)でも訓練エポック数が1.5–2.5倍程度にとどまる。

ABSTRACT

Researchers have proposed that deep learning, which is providing important progress in a wide range of high complexity tasks, might inspire new insights into learning in the brain. However, the methods used for deep learning by artificial neural networks are biologically unrealistic and would need to be replaced by biologically realistic counterparts. Previous biologically plausible reinforcement learning rules, like AGREL and AuGMEnT, showed promising results but focused on shallow networks with three layers. Will these learning rules also generalize to networks with more layers and can they handle tasks of higher complexity? We demonstrate the learning scheme on classical and hard image-classification benchmarks, namely MNIST, CIFAR10 and CIFAR100, cast as direct reward tasks, both for fully connected, convolutional and locally connected architectures. We show that our learning rule - Q-AGREL - performs comparably to supervised learning via error-backpropagation, with this type of trial-and-error reinforcement learning requiring only 1.5-2.5 times more epochs, even when classifying 100 different classes as in CIFAR100. Our results provide new insights into how deep learning may be implemented in the brain.

研究の動機と目的

  • 脳における深層学習を強化学習の原則に基づいて可能にする生物学的に妥当な学習ルールの開発。
  • 深層ネットワークにおけるシナプスが、グローバルなバックプロパゲーションに依存せずに、局所的に誤差の微分を計算する方法の課題に取り組む。
  • 既存の低ランク強化学習ルール(例:AGREL や AuGMEnT)を、任意の深さをもつ深層多層ネットワークに一般化する。
  • このようなルールが、標準的な画像分類ベンチマークで教師あり誤差バックプロパゲーションと同等の性能を達成できるかどうかを評価する。
  • CIFAR100のような高クラス数の複雑なタスクに対しても、学習ルールのスケーラビリティを示す。

提案手法

  • Q-AGRELは、脳内のニューロモジュレーター信号に類似したグローバルな報酬予測誤差(RPE)信号と、運動または意思決定領域からの局所的な注意フィードバック信号を組み合わせる。
  • 注意フィードバックは、選択された行動に関与するシナプスを特定的にマークし、それらのシナプスのみが可塑性を示すようにする。
  • 学習ルールは、選択された出力ユニットに関連する重みのみを更新する形の誤差バックプロパゲーションの一種と数学的に同等である。
  • ルールは直接報酬設定で動作し、各ネットワーク推論後に即座にフィードバックが提供され、遅延した責任帰属は行わない。
  • ネットワークは、データオーグメンテーションや高度な最適化手法を用いずに、Q-AGRELルールに基づく確率的勾配降下法で訓練される。
  • 本手法は、全結合型、畳み込み型、局所接続型アーキテクチャを対象とし、MNIST、CIFAR10、CIFAR100で評価された。

実験結果

リサーチクエスチョン

  • RQ1生物学的に妥当な強化学習ルールを、任意の深さをもつ深層順方向ネットワークに拡張可能か?
  • RQ2Q-AGRELの性能は、画像分類タスクにおける標準的な誤差バックプロパゲーションと比較して、正確性と収束速度の面でどう異なるか?
  • RQ3CIFAR100のような高複雑度のタスク(100クラス)に対し、Q-AGRELルールは著しい訓練コストを伴わずにスケーラブルか?
  • RQ4グローバルなRPEと局所的な注意フィードバックの組み合わせは、深層ネットワークにおける効果的なバックプロパゲーションに類似した学習を可能にするか?
  • RQ5ルールは、脳における生物学的妥当性に一致する低ランクの学習ダイナミクスを維持するか?

主な発見

  • Q-AGRELはMNISTでテスト精度99.17%を達成し、全結合型および畳み込み型ネットワークにおいて標準的な誤差バックプロパゲーションと同等の性能を示した。
  • CIFAR10では、Q-AGRELはバックプロパゲーションと同等またはわずかに高い精度に到達したが、収束には1.5~2倍のエポック数を要した。
  • CIFAR100では、最終的な精度はバックプロパゲーションをやや下回ったが、訓練エポック数は2~2.5倍にとどまり、高クラス数タスクへのスケーラビリティを示した。
  • Q-AGRELの学習プロセスでは、エポックを経て報酬確率が安定して上昇し、バックプロパゲーションで観察される誤差の減少と類似した傾向を示したが、速度は遅めであった。
  • ルールが選択されたアクションに関連する重みのみを更新する選択的バックプロパゲーション形式と同等であることは、解析的および実験的に検証された。
  • データオーグメンテーションや高度な最適化手法を用いなくても、本手法は有効であることが示され、コアメカニズムのロバストさと生物学的妥当性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。