Skip to main content
QUICK REVIEW

[論文レビュー] Thalamocortical contribution to solving credit assignment in neural systems

Mien Brabeeba Wang, Michael M. Halassa|arXiv (Cornell University)|Apr 3, 2021
Neural dynamics and brain function参考文献 153被引用数 4
ひとこと要約

本稿では、網様体が感覚フィルタリング、作業記憶ゲーティング、運動準備といった制御機能を有することで、皮質活動の関連付けをパrameter化するメタラーニングを、視床皮質線条体系が可能にすると提案している。線条体の強化学習によって、迅速(文脈的)および遅く(一般化的)な時間スケールでこれらの制御機能を階層的に選択することで、神経回路における構造的・文脈的・時間的信用割り当て問題を効率的に解決する。

ABSTRACT

Animal brains evolved to optimize behavior in dynamically changing environments, selecting actions that maximize future rewards. A large body of experimental work indicates that such optimization changes the wiring of neural circuits, appropriately mapping environmental input onto behavioral outputs. A major unsolved scientific question is how optimal wiring adjustments, which must target the connections responsible for rewards, can be accomplished when the relation between sensory inputs, action taken, environmental context with rewards is ambiguous. The computational problem of properly targeting cues, contexts and actions that lead to reward is known as structural, contextual and temporal credit assignment respectively. In this review, we survey prior approaches to these three types of problems and advance the notion that the brain's specialized neural architectures provide efficient solutions. Within this framework, the thalamus with its cortical and basal ganglia interactions serve as a systems-level solution to credit assignment. Specifically, we propose that thalamocortical interaction is the locus of meta-learning where the thalamus provides cortical control functions that parametrize the cortical activity association space. By selecting among these control functions, the basal ganglia hierarchically guide thalamocortical plasticity across two timescales to enable meta-learning. The faster timescale establishes contextual associations to enable rapid behavioral flexibility while the slower one enables generalization to new contexts. Incorporating different thalamic control functions under this framework clarifies how thalamocortical-basal ganglia interactions may simultaneously solve the three credit assignment problems.

研究の動機と目的

  • 複雑で動的な環境において、神経回路が特定の刺激、文脈、行動に信用を割り当てる方法が未解決の問題であることを扱う。
  • フィードバックが遅く曖昧な生物学的回路において、ナーブな誤差逆伝搬に類似した学習の制限を脳がどのように克服するかを説明する。
  • 視床皮質相互作用と線条体の調節に中心を置いた、システムレベルのメカニズムを提案し、効率的で生物学的に妥当な信用割り当てを可能にする。
  • 構造的・文脈的・時間的信用割り当て問題の3つを、視床による皮質可塑性の制御を含む統一的枠組みの下に統合する。

提案手法

  • 視床が、皮質制御機能を提供することで皮質活動関連付け空間をパrameter化するメタラーナーとして機能すると提案する。
  • 2つの時間スケールの学習フレームワークを導入する:視床皮質回路における迅速な可塑性が即時の文脈適応を可能にし、ゆっくりとした可塑性が一般化可能な表現を統合する。
  • 前頭前野(PFC)の作業記憶の有効時間定数を、視床入力(r_MD)の関数としてモデル化し、τ_eff = τ / [1 - (1 + r_MD)w_PFC f(inp_PFC)(1 - f(inp_PFC))] の式を用いる。ここで r_MD は記憶持続性を調整する。
  • 線条体の強化学習を用いて視床制御機能を選択・調整し、どの皮質関連付けが強化されるかをゲーティングする。
  • 視床出力を、特定の皮質再帰的結合を動的に増幅するものとして位置づけ、タスク関連情報を選択的に維持可能にする。
  • 皮質視床フィードバックを統合することで、長期記憶維持に線条体への依存を減らし、学習された関連付けの長期的統合を可能にする。

実験結果

リサーチクエスチョン

  • RQ1報酬信号が遅く曖昧な状況において、脳が特定の感覚的刺激、内部状態、行動に信用を割り当てる神経メカニズムは何か?
  • RQ2途切れなく変化する文脈において、壊滅的忘却を回避しながら迅速な行動の柔軟性を実現する神経機構は何か?
  • RQ3脳はどのようにして長時間にわたり過去の感覚的入力や行動の関連性を維持し、時間的信用割り当てを可能にするか?
  • RQ4神経回路における信用割り当て問題を解決する上で、視床は単なる中継装置を越えて果たす役割は何か?
  • RQ5生物学的に妥当なシステムは、文脈に一般化しつつもタスク固有の関連付けを維持するメタラーニングをどのように実装できるか?

主な発見

  • 視床皮質系は、動的視床制御機能を通じて皮質活動関連付けをパrameter化することで、メタラーニングの場として機能する。
  • 線条体は強化学習を用いて視床制御機能を階層的に選択し、迅速な文脈適応と一般化のための2つの時間スケールの学習を可能にする。
  • 前頭前野作業記憶の有効時間定数は、視床入力(r_MD)によって調整され、r_MD が高くなるほど記憶持続性が向上し、時間的信用割り当てが可能になる。
  • 視床投射による機能的皮質再帰的結合の選択的増幅を通じて、壊滅的忘却を回避しながらタスク関連情報を維持する。
  • このフレームワークは、視床皮質と線条体のダイナミクスを統合することで、同じ神経アーキテクチャが構造的・文脈的・時間的信用割り当てを同時に解決できることを説明する。
  • 皮質視床フィードバックにより、時間経過に伴う作業記憶維持に線条体への依存を減らし、学習された関連付けの長期的統合を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。