Skip to main content
QUICK REVIEW

[論文レビュー] Interval timing in deep reinforcement learning agents

Ben Deverett, Ryan Faulkner|arXiv (Cornell University)|May 31, 2019
Neuroscience and Music Perception参考文献 31被引用数 7
ひとこと要約

この論文は、神経科学にインspiredされたタスクを用いて、深層強化学習エージェントにおける間隔時間の認識を調査している。エージェントは、報酬を得るためにサンプルの時間間隔を再現する必要がある。LSTMを用いた再帰的エージェントとフィードフォワードエージェントの両方がタスクを成功裏に学習した。再帰的エージェントはLSTMユニット内の内部カウンターを用い、フィードフォワードエージェントは生物学的時間認識メカニズムに類似したstigmergy的戦略を開発した。

ABSTRACT

The measurement of time is central to intelligent behavior. We know that both animals and artificial agents can successfully use temporal dependencies to select actions. In artificial agents, little work has directly addressed (1) which architectural components are necessary for successful development of this ability, (2) how this timing ability comes to be represented in the units and actions of the agent, and (3) whether the resulting behavior of the system converges on solutions similar to those of biology. Here we studied interval timing abilities in deep reinforcement learning agents trained end-to-end on an interval reproduction paradigm inspired by experimental literature on mechanisms of timing. We characterize the strategies developed by recurrent and feedforward agents, which both succeed at temporal reproduction using distinct mechanisms, some of which bear specific and intriguing similarities to biological systems. These findings advance our understanding of how agents come to represent time, and they highlight the value of experimentally inspired approaches to characterizing agent abilities.

研究の動機と目的

  • 制御された実験的環境において、深層強化学習エージェントがどのように間隔時間認識能力を発達させるかを調査すること。
  • 成功した時間再現に必要なアーキテクチャ的要因(再帰的対フィードフォワード)を特定すること。
  • 人工エージェントが発現する時間認識戦略を、動物における既知の生物学的メカニズムと比較すること。
  • エンドツーエンド学習されたエージェントが、生物学的系で観察されたものと類似した解決策に収束するかどうかを評価すること。
  • 時間的依存性の学習における、時間による誤差逆伝播と責任割り当ての役割を調査すること。

提案手法

  • エージェントは、神経科学実験を模倣した間隔再現タスクにおいて、PsychLab環境でエンドツーエンドで訓練された。
  • タスクでは、エージェントが中央の十字に注視し、'Set'のシグナル後にサンプル時間間隔を待機し、その後'Go'ターゲットを注視することで試行を完了する必要があった。
  • 性能は、'Set'から'Go'への注視までの生産時間間隔が、許容誤差内にサンプル時間間隔と一致するかどうかで評価された。
  • 再帰的エージェントは時間による誤差逆伝播を用いたLSTMコントローラーを使用した。フィードフォワードエージェントは、ポリシー勾配更新に依存する非再帰的ネットワークを使用した。
  • アーキテクチャのアブレーションとして、LSTM重みの凍結、10ステップの制限付き誤差逆伝播(10-step RL)、および通常のRNN、GRU、RMCへの置換が行われた。
  • 戦略は、隠れユニットの活性化、行動経路、および異なる時間間隔への一般化を通じて分析された。

実験結果

リサーチクエスチョン

  • RQ1再帰的およびフィードフォワードの深層強化学習エージェントは、間隔時間認識に対して異なる戦略を発達させるか?
  • RQ2アーキテクチャ的選択(例:再帰性、時間による誤差逆伝播)は、時間的表現の出現にどのように影響するか?
  • RQ3人工エージェントの時間認識戦略は、生物学的系で観察されたものとどの程度類似しているか?
  • RQ4フィードフォワードエージェントは、明示的な再帰的記憶がなくても、ポリシー責任割り当てに依存して間隔時間認識を学習できるか?
  • RQ5凍結された重みや制限付き学習更新などのアーキテクチャ的変更に対して、間隔時間認識の性能はどの程度頑健か?

主な発見

  • 再帰的(LSTM)およびフィードフォワードの深層強化学習エージェントは、エンドツーエンドの方法で間隔再現タスクを成功裏に解決した。
  • 再帰的エージェントは、経過時間に対応するLSTM隠れユニットの活性化パターンを示す内部時間認識メカニズムを発達させた。
  • フィードフォワードエージェントは、明示的な記憶に依存せず、蓄積された行動パターンから時間認識が生じるstigmergy的戦略を採用した。これは、動物における心理物理学的発見と類似している。
  • LSTM重みを凍結したエージェントは、学習可能なLSTMと同等の性能を達成した。これは、内部重みが学習不能であっても学習が可能であることを示唆している。
  • 再帰的エージェントは制限付き誤差逆伝播(10-step RL)においても高い性能を維持したが、フィードフォワードエージェントは著しく性能を落とした。これは、非再帰的ネットワークにおける時間的責任割り当ての重要性を示している。
  • アーキテクチャの変更に対して性能は頑健であったが、通常のRNN、GRU、RMCへの置換では一部に性能バイアスが見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。