Skip to main content
QUICK REVIEW

[論文レビュー] A learning gap between neuroscience and reinforcement learning

Samuel T. Wauthier, Pietro Mazzaglia|arXiv (Cornell University)|Apr 22, 2021
Neural dynamics and brain function参考文献 32被引用数 4
ひとこと要約

本論文は、神経科学と強化学習(RL)の間の重要な学習ギャップを特定し、最先端のRLアルゴリズムが信念に基づく推論と曖昧性の解消をテストする神経科学にインspiredされたT-maze環境を解けないことを示している。著者らはFristonら(2016)の抽象的T-mazeをピクセルベースでゲームライクな環境(E-maze)に再実装し、PPO、DQN、Rainbow、Dreamerといった高度なアルゴリズムですら安定して解けないことを示した。これは、認知神経科学の原則に基づいたRLベンチマークの必要性を示しており、より生物学的に妥当な知能を促進するものである。

ABSTRACT

Historically, artificial intelligence has drawn much inspiration from neuroscience to fuel advances in the field. However, current progress in reinforcement learning is largely focused on benchmark problems that fail to capture many of the aspects that are of interest in neuroscience today. We illustrate this point by extending a T-maze task from neuroscience for use with reinforcement learning algorithms, and show that state-of-the-art algorithms are not capable of solving this problem. Finally, we point out where insights from neuroscience could help explain some of the issues encountered.

研究の動機と目的

  • 現在の強化学習(RL)ベンチマークと神経科学で研究されているコアな認知的課題(曖昧性、記憶、信念形成など)との乖離を特定すること。
  • 信念に基づく意思決定をテストする目的で設計されたT-maze環境において、概念的には単純であるにもかかわらず、最先端のRLアルゴリズムが困難を示すことの実証。
  • 将来のRLベンチマークは、生物学的認知にインspiredされたwell-establishedな神経科学タスクに基づくべきだと提言すること。
  • 現在のRL手法が、持続的な信念状態を要するタスクに必要な表象的・推論的能力を欠いているという実証的証拠を提供すること。

提案手法

  • Fristonら(2016)の抽象的T-mazeをピクセルベースで、ゲームライクな環境(E-maze)に再実装。連続的な移動と視覚的観測を含む。
  • 視野を198度に設定し、最大250手で報酬のスパarsityを制御し、複雑なナビゲーションを可能にした。
  • 標準的な深層RLアルゴリズム(DQN、Rainbow、PPO、Dreamer)を、Atari 2600ベンチマークに適応した標準的なハイパーパrameterで訓練。
  • 報酬がスパースな状況での探索を促進するために、ICMとRNDによる内因的探索ボーナスを導入し、外因的報酬信号に組み込んだ。
  • 観測を84×84のグレースケール画像に前処理し、Atariベンチマークの基準に合わせて、既存のRLベースラインとの公平な比較を確保。
  • 標準的なPPOを用いて訓練し、重み初期化と探索スケジューリングを適用。20%の性能に達した時点で内因的ボーナスを無効化した。

実験結果

リサーチクエスチョン

  • RQ1最先端の深層強化学習アルゴリズムは、曖昧性下での信念に基づく推論を要する神経科学にインスパイアされたT-mazeタスクを解けるか?
  • RQ2Atariや他のゲーム環境で成功を収めているにもかかわらず、なぜ現在のRLアルゴリズムはこのタスクに失敗するのか?
  • RQ3ICM や RND といった内因的探索手法は、曖昧で報酬がスパースな環境で学習をどのように促進するのか?
  • RQ4モデルフリーとモデルベースのRLアプローチ(例:PPO と Dreamer)は、信念形成を通じて不確実性をどの程度解消できるか?
  • RQ5神経科学にインスパイアされた環境は、より認知的に妥当なRLアルゴリズムの開発をどの程度改善できるか?

主な発見

  • DQN、Rainbow、PPO、Dreamerのいずれの最先端RLアルゴリズムに対しても、E-maze環境で安定したパフォーマンスを達成できなかった。
  • ICM や RND による内因的探索ボーナスを導入しても、PPOエージェントのパフォーマンスは20%にとどまり、信念空間における探索が不十分であることが示された。
  • 環境設計が、持続的な信念状態の維持と、手がかりによる曖昧性の解消を要するため、現在のRLアーキテクチャの根本的限界が露呈された。
  • モデルフリー手法(PPO や DQN)は、ランダムベースラインと顕著な差がなく、時間経過に伴う信念の維持・更新のメカニズムを欠いていることが示された。
  • モデルベースエージェントのDreamerですら失敗したことは、世界モデルの学習だけでは、信念表現の明示的メカニズムがなければ不十分であることを示している。
  • 結果から、現在のRLアルゴリズムは、生物的エージェントが示す確率的推論や記憶依存的推論を自然にサポートしていないことが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。