Skip to main content
QUICK REVIEW

[論文レビュー] Action-modulated midbrain dopamine activity arises from distributed control policies

Jack Lindsey, Ashok Litwin-Kumar|arXiv (Cornell University)|Jul 1, 2022
Neurotransmitter Receptor Influence on Behavior被引用数 9
ひとこと要約

本論文は、補体側索の報酬予測誤差(RPE)に加えて「行動の驚き」項(行動の期待値からの逸脱を測る)を導入することで、中脳ドーパミン活動の行動調節的側面を説明する生物学的に妥当なオフポリシー強化学習モデルを提案する。このモデルは、モーター皮質や小脳といった他の脳領域が制御する行動からも有効に学習可能であり、従来のオンポリシーモデルでは達成できない。実験的事実として、運動関連のドーパミン信号、練習に伴う信号の減少、および背側/腹側 striatum 間の活動差異を説明可能である。

ABSTRACT

Animal behavior is driven by multiple brain regions working in parallel with distinct control policies. We present a biologically plausible model of off-policy reinforcement learning in the basal ganglia, which enables learning in such an architecture. The model accounts for action-related modulation of dopamine activity that is not captured by previous models that implement on-policy algorithms. In particular, the model predicts that dopamine activity signals a combination of reward prediction error (as in classic models) and "action surprise," a measure of how unexpected an action is relative to the basal ganglia's current policy. In the presence of the action surprise term, the model implements an approximate form of Q-learning. On benchmark navigation and reaching tasks, we show empirically that this model is capable of learning from data driven completely or in part by other policies (e.g. from other brain regions). By contrast, models without the action surprise term suffer in the presence of additional policies, and are incapable of learning at all from behavior that is completely externally driven. The model provides a computational account for numerous experimental findings about dopamine activity that cannot be explained by classic models of reinforcement learning in the basal ganglia. These include differing levels of action surprise signals in dorsal and ventral striatum, decreasing amounts movement-modulated dopamine activity with practice, and representations of action initiation and kinematics in dopamine activity. It also provides further predictions that can be tested with recordings of striatal dopamine activity.

研究の動機と目的

  • 補体側索における古典的なオンポリシー強化学習モデルの限界を解消すること。特に、モーター皮質や小脳といった外部コントローラーが行動を支配する状況では失敗する点を改善する。
  • 中脳ドーパミンニューロンが報酬予測誤差(RPE)以外の行動関連信号(例:行動開始、活力)を示す理由を説明すること。
  • RPEと行動の驚きを統合した単一の生物学的に妥当な学習フレームワーク内で、ドーパミン活動を統一的に説明すること。
  • 行動の驚きが、特に複雑で多段階的なタスクにおいて、オフポリシー行動からの学習に不可欠であることを示すこと。

提案手法

  • 報酬予測誤差(RPE)と行動の驚き項 ||a − μ(s)||² を組み合わせた修正されたドーパミン信号を導入。ここで a は実際の行動、μ(s) は状態 s における補体側索の期待行動である。
  • 連続的行動空間におけるQ学習の近似形としてアルゴリズムを導出し、オフポリシー学習を可能にする。
  • 合成可塑性がRPEと行動の驚き信号の両方によって調節されるポリシー勾配フレームワークを採用。
  • ドーパミン放出が、結果の予測誤差と行動の期待値からの逸脱の両方を基に可塑性をゲートする生物学的に妥当な学習ルールを採用。
  • 外部ポリシー(例:モーター皮質)が生成するデータを用いてナビゲーションおよび到達タスクの学習をシミュレート。オンポリシーモデルに比べて優れた性能を示す。
  • 背側と腹側 striatum 間の行動の驚きの表現差をモデル化。この非対称性が外部コントローラーのポリシーの学習を加速できることを示す。

実験結果

リサーチクエスチョン

  • RQ1複数の脳領域が異なる制御ポリシーを持つ場合、補体側索は外部コントローラー(例:モーター皮質、小脳)によって完全に支配される行動から効果的に学習できるか?
  • RQ2なぜ中脳ドーパミンニューロンはRPE以外の行動関連信号(例:行動開始、運動の激しさ)を示すのか?
  • RQ3行動の驚きがドーパミン信号に果たす機能的役割は何か?また、補体側索におけるオフポリシー学習をどのように支援するか?
  • RQ4なぜ練習を重ねるにつれて、運動に依存するドーパミン活動が減少するのか?このモデルはその理由をどのように説明できるか?
  • RQ5行動の驚きの背側対腹側 striatum 間の異なる表現を、このモデルはどのように説明できるか?

主な発見

  • 行動の驚きを含むモデルは、外部コントローラー(例:モーター皮質)によって完全に支配される行動からも有効に学習可能であるのに対し、オンポリシーモデルはこのような状況では完全に失敗する。
  • 行動の驚きは、長時間にわたる行動シーケンスを必要とするタスクにおいて不可欠である。補体側索のポリシーと外部コントローラーのポリシーとの不一致が生じる場合、標準的なRPEベースのモデルでは学習が失敗する。
  • 本モデルは、実験的に観察された運動関連のドーパミン活動(行動開始や運動力学に関連する信号)を説明可能であり、別個の動機付け機能を仮定する必要がない。
  • 本モデルは、背側 striatum のドーパミンニューロンが腹側 striatum のニューロンよりも強い行動の驚き信号を示すと予測しており、実験データが示す背側領域のより強い運動調節性と整合的である。
  • 本モデルは、練習に伴って行動が予測可能になるにつれて行動の驚きが減少することに起因して、運動に依存するドーパミン活動が減少することを説明可能である。
  • 本モデルは、行動の驚きが補体側索にとって監督学習信号として機能し、外部コントローラーのポリシーの統合を加速するメカニズムを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。