Skip to main content
QUICK REVIEW

[論文レビュー] What Can Learned Intrinsic Rewards Capture?

Zeyu Zheng, Junhyuk Oh|arXiv (Cornell University)|Dec 11, 2019
Reinforcement Learning in Robotics参考文献 45被引用数 5
ひとこと要約

本論文では、複数のエージェントライフタイムにわたる長期的探索と報酬の知識を捉えるために、スケーラブルなメタ勾配フレームワークを提案する。再帰的ニューラルネットワークを用いてライフタイムの報酬を最大化するように訓練することで、非定常な内在的報酬を学習し、新しいエージェント、アクション空間、学習アルゴリズムへ一般化可能となる。これは、ポリシーに基づく「どうやるか」の知識とは異なり、柔軟な「何をやるか」の知識の局所化を実現する。

ABSTRACT

The objective of a reinforcement learning agent is to behave so as to maximise the sum of a suitable scalar function of state: the reward. These rewards are typically given and immutable. In this paper, we instead consider the proposition that the reward function itself can be a good locus of learned knowledge. To investigate this, we propose a scalable meta-gradient framework for learning useful intrinsic reward functions across multiple lifetimes of experience. Through several proof-of-concept experiments, we show that it is feasible to learn and capture knowledge about long-term exploration and exploitation into a reward function. Furthermore, we show that unlike policy transfer methods that capture "how" the agent should behave, the learned reward functions can generalise to other kinds of agents and to changes in the dynamics of the environment by capturing "what" the agent should strive to do.

研究の動機と目的

  • 内在的報酬関数が強化学習における複雑で長期的な知識を捕える有効な局所化として機能するかを調査すること。
  • 異なる環境やエージェントのダイナミクスにわたって一般化可能な、効果的で非定常な内在的報酬を学習する課題に対処すること。
  • 学習された報酬が、新しいアクション空間や学習アルゴリズムへ一般化する際に、ポリシートランスファーを上回る性能を示すかを検討すること。
  • 内在的報酬が、ポリシーに埋め込まれた「どうやるか」の知識とは異なり、より適応性の高い「何をやるか」の知識を符号化できることを示すこと。

提案手法

  • エージェントが各エピソードの開始時に再初期化され、1つの共有された内在的報酬関数を用いて学習する、複数のライフタイムを想定した強化学習設定を採用する。
  • エージェントライフタイム全体にわたって展開された再帰的ニューラルネットワークを用いて、内在的報酬関数をパラメータライズし、長期的な時系列依存性をモデル化する。
  • ライフタイム価値関数を用いて残りの累積報酬を推定し、長時間にわたる経験系列における責任割り当てを可能にする。
  • エージェントのライフタイム全体における累積外的報酬を最大化するように、内在的報酬をメタ勾配最適化により訓練する。
  • ポリシー更新と報酬関数の間の微分可能相互作用を活用し、内在的報酬のエンドツーエンド訓練を可能にする。
  • 学習プロセスをポリシー(θ)と内在的報酬(η)のパラメータに分解することで、「何をやるか」の知識のモジュラーなトランスファーを可能にする。

実験結果

リサーチクエスチョン

  • RQ1学習された内在的報酬は、複数のエピソードにわたって長期的探索と報酬行動を効果的に捉えられるか?
  • RQ2ポリシートランスファー手法とは異なり、異なるアクション空間や学習アルゴリズムを持つ新しいエージェントへ一般化できるか?
  • RQ3サンプル効率および漸近的性能の観点から、学習された内在的報酬の性能は、RL2 や MAML などのポリシートランスファー手法と比べてどうなるか?
  • RQ4非定常な環境において、内在的報酬がタスク依存の規則性をどの程度捉えることができるか?
  • RQ5有効なタスク分布に対して効果的である場合、学習された報酬関数は、知られている内在的動機付けメカニズム(例:好奇心)と類似した性質を示すようになるか?

主な発見

  • 学習された内在的報酬関数は、ノイズ探索や環境変化の予測といった長期的探索と報酬行動を効果的に捉えている。
  • ランダムベースラインを上回り、RL2 と同等の漸近的性能を達成している。これは、初期ポリシーがランダムであり、間接的な報酬ガイダンスに依存しているにもかかわらず成立する。
  • アクション空間が入れ替えられたり拡張されたりした新しいエージェントに対しても、報酬が行動ではなく状態の変化に基づいているため、効果的に一般化されている。
  • Q学習などの異なる学習アルゴリズムに対しても、学習された内在的報酬はトランスファー可能であり、そのロバストさと、下位のポリシー更新メカニズムからの独立性が示された。
  • RL2 や MAML などのポリシートランスファー手法とは異なり、本手法はアクション空間や学習アルゴリズムの変更に対しても一般化がうまくいく。これは、「何をやるか」の知識の優位性を示している。
  • フレームワークにより、タスクに依存しない内在的動機付け信号(例:好奇心)が、ライフタイムにわたるタスク分布に対して有効である場合に、自然に出現することが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。