Skip to main content
QUICK REVIEW

[論文レビュー] Self-organization of action hierarchy and compositionality by reinforcement learning with recurrent neural networks

Dongqi Han, Kenji Doya|arXiv (Cornell University)|Jan 29, 2019
Reinforcement Learning in Robotics参考文献 79被引用数 5
ひとこと要約

本稿では、確率的ダイナミクスを備えた繰り返し処理可能なマルチタイムスケール・アクタ・クリティック枠組みReMASTERを提案する。この枠組みにより強化学習エージェントは、事前のタスク分解なしに自己組織的に行動階層と組み合わせ的スキルを形成できる。神経ダイナミクスと報酬割引の両方に複数のタイムスケールを活用することで、エージェントは抽象的な部分目標と低レベルの行動プリミティブを発展させ、再組み合わせされた以前に学習済みのスキルを新たなタスクに適用する際の再学習速度が向上する。

ABSTRACT

Recurrent neural networks (RNNs) for reinforcement learning (RL) have shown distinct advantages, e.g., solving memory-dependent tasks and meta-learning. However, little effort has been spent on improving RNN architectures and on understanding the underlying neural mechanisms for performance gain. In this paper, we propose a novel, multiple-timescale, stochastic RNN for RL. Empirical results show that the network can autonomously learn to abstract sub-goals and can self-develop an action hierarchy using internal dynamics in a challenging continuous control task. Furthermore, we show that the self-developed compositionality of the network enhances faster re-learning when adapting to a new task that is a re-composition of previously learned sub-goals, than when starting from scratch. We also found that improved performance can be achieved when neural activities are subject to stochastic rather than deterministic dynamics.

研究の動機と目的

  • 繰り返しニューラルネットワークに複数のタイムスケールを適用することで、事前のタスク分解なしに強化学習において階層的行動構造を自律的に発展させられるかを調査すること。
  • 再組み合わせられた以前に学習済みの部分目標を用いて新しいタスクに適応する際、自己発生した組み合わせ的性質が再学習効率をどのように向上させるかを検討すること。
  • 確率的ニューラルダイナミクスが強化学習における学習性能と階層的抽象化の向上に果たす役割を調査すること。
  • マルチタイムスケール報酬割引が、1つのフレームワーク内で長期的計画と短期的スキル実行の両方を支援するかを評価すること。
  • 内部ニューラルダイナミクスによる階層的制御が、初期から学習するのと比較して再組み合わせタスクへの適応をいかに迅速に可能にするかを実証すること。

提案手法

  • 神経活性化ダイナミクスと報酬割引の両方に複数のタイムスケールを持つ、新しいオフポリシー・アクタ・クリティックアルゴリズムReMASTERを提案する。
  • 生物学的ニューロンノイズをモデル化するため、すべてのネットワーク層に確率性を導入し、探索性と耐障害性を向上させる。
  • 異なるタイムスケールに別個の割引係数を適用する:低レベル行動には速い割引、高レベルの部分目標には遅い割引を適用する。
  • 高速コンテキストとスローバイコンテキストニューロンを備えた階層的RNNアーキテクチャを採用し、詳細な運動スキルと抽象的な行動シーケンスの両方を表現する。
  • 一般化性と訓練中の安定性を向上させるために、確率的サンプリングを用いた経験リプレイを適用する。
  • 部分目標が順番に達成されなければならないが、明示的な部分目標信号が与えられない、順序付きの組み合わせ的制御タスクを設計する。

実験結果

リサーチクエスチョン

  • RQ1マルチタイムスケールRNNを備えた強化学習エージェントは、事前のタスク分解なしに内部で行動階層を自律的に発展させられるか?
  • RQ2再組み合わせされた新しい目標順序でタスクが再構成された際、学習済みの部分目標の自己組織的組み合わせ性が再学習速度を向上させるか?
  • RQ3確率的ニューラルダイナミクスは、強化学習における階層的制御の出現と性能向上にどのように寄与するか?
  • RQ4神経ダイナミクスと報酬割引のタイムスケールの整合性が、階層的スキル習得に与える影響は何か?
  • RQ5エージェントは、以前に学習済みの部分目標を再結合することで、新しいタスクに一般化できるか?また、初期から学習するのと比べてどうなるか?

主な発見

  • ReMASTERフレームワークは、エージェントが行動階層を自己組織化することに成功した。スローバイコンテキストニューロンが抽象的な部分目標を表し、ファストコンテキストニューロンが低レベルの行動プリミティブをエンコードした。
  • 再組み合わせされた以前に学習済みの部分目標を含む新しいタスクに適応する際、初期から学習するのと比較して、再学習速度が著しく向上した。
  • 高レベルと低レベルのコンponent間のタイムスケールを交換した場合、性能劣化が発生した。これは、適切なタイムスケール整合性が効果的な階層形成に不可欠であることを示している。
  • 確率的ニューラルダイナミクスは学習性能を向上させ、階層的スキル開発の耐障害性を高め、決定論的ダイナミクスを上回った。
  • 自己発生した組み合わせ的性質により、エージェントは学習済みの部分目標を再結合することで、柔軟に制御ポリシーを再構成し、新しいタスク目標に適応できた。
  • 部分目標が明示的に観測できない順序付きの組み合わせ的制御タスクにおいて、フレームワークは優れた性能を達成し、タスク構造の内部表現を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。