Skip to main content
QUICK REVIEW

[論文レビュー] Disentangled Cumulants Help Successor Representations Transfer to New Tasks

Christopher Grimm, Irina Higgins|arXiv (Cornell University)|Nov 25, 2019
Reinforcement Learning in Robotics参考文献 31被引用数 7
ひとこと要約

本論文では、エージェントが最初に内在的興味を通じて分離可能な特徴量と制御方策を学習し、その後それらの方策を一般化方策改善(GPI)によって統合することで、多様な下流タスクを迅速に解決する二段階の強化学習フレームワークを提案する。本手法は、効果的な方策再結合を可能にする分離可能な表現を活用することで、特に複雑なタスクにおいて、ベースラインと比較して顕著に高いデータ効率とタスクカバレッジを達成する。

ABSTRACT

Biological intelligence can learn to solve many diverse tasks in a data efficient manner by re-using basic knowledge and skills from one task to another. Furthermore, many of such skills are acquired without explicit supervision in an intrinsically driven fashion. This is in contrast to the state-of-the-art reinforcement learning agents, which typically start learning each new task from scratch and struggle with knowledge transfer. In this paper we propose a principled way to learn a basis set of policies, which, when recombined through generalised policy improvement, come with guarantees on the coverage of the final task space. In particular, we concentrate on solving goal-based downstream tasks where the execution order of actions is not important. We demonstrate both theoretically and empirically that learning a small number of policies that reach intrinsically specified goal regions in a disentangled latent space can be re-used to quickly achieve a high level of performance on an exponentially larger number of externally specified, often significantly more complex downstream tasks. Our learning pipeline consists of two stages. First, the agent learns to perform intrinsically generated, goal-based tasks in the total absence of environmental rewards. Second, the agent leverages this experience to quickly achieve a high level of performance on numerous diverse externally specified tasks.

研究の動機と目的

  • 深層強化学習における知識転移の悪さという課題に取り組むこと。具体的には、エージェントが各新しいタスクに対して再びセンシングと制御をから立ち上げて学習しなおすこと。
  • 内部的報酬に基づく、タスクに依存しない相互作用を通じて、再利用可能で分離可能な方策を体系的かつ原理的につくる手法を開発すること。
  • 外部から指定された、目的ベースの多様な下流タスクに、学習済みの基本方策の少数を用いて迅速に一般化できることを実現すること。
  • 理論的および実験的に、分離可能な特徴制御方策がGPIによって組み合わされると、混合されたあるいは非分離可能なアプローチと比較して、優れたカバレッジとデータ効率を達成することを検証すること。

提案手法

  • エージェントは外部報酬なしで環境を探索し、観測不変累積報酬(OIC)性質を満たすと仮定される、分離可能な特徴量を内在的興味を通じて学習する。
  • 分離可能な特徴量はボックスに離散化され、各特徴量を特定のボックス値に誘導する $km$ 個の特徴制御方策が学習され、基本方策の集合が形成される。
  • 下流RL段階では、一般化方策改善(GPI)が、各目的に対して最適な方策の組み合わせを選択することで、新しいタスクを解決する。
  • 後続表現行列に「非対角項のトリック」を適用し、推定された非対角成分を、分離可能な特徴量と割引率 $\gamma$ から導出された正確な値に置き換えることで、計算効率と推定精度を向上させる。
  • 本手法は、真値の分離可能な特徴量(x/y 位置)を用いた Spriteworld 環境で評価され、異なるボックス数とタスク整合性の下で DQN や DIAYN と性能を比較した。

実験結果

リサーチクエスチョン

  • RQ1内在的でタスクに依存しない設定で学習された分離可能な特徴制御方策は、GPIを用いて効果的に再結合可能であり、多様な下流タスクを解決できるか?
  • RQ2GPIに基づく方策改善において、分離可能な特徴量と混合された特徴量とを比較した場合、データ効率とタスクカバレッジの面でどちらが優れているか?
  • RQ3後続表現推定における非対角項のトリックは、ERL設定において計算効率と性能を向上させるか?
  • RQ4本手法は、特徴量の離散化ボックス数の変動や、ERLのボックス境界と下流タスクの目的との整合性の変化に対して、どれほど頑健か?

主な発見

  • 分離可能な特徴制御方策を用いたGPIエージェントは、約50k学習ステップでタスクを解決したが、DQNベースラインは400kステップ以上を要し、顕著なデータ効率の優位性を示した。
  • 性能向上は特に難易度の高いタスクで顕著であり、DQNベースラインがGPIエージェントの性能に追いつくまでに著しく長い時間がかかっていた。
  • 分離可能な特徴量を用いたGPIは、混合された特徴量を用いたGPIを上回った。これは、効果的な方策再結合と一般化のためには分離性が不可欠であることを示している。
  • 非対角項のトリックは、計算効率と推定精度を向上させ、特に分離可能なGPI設定において利益をもたらしたが、性能に悪影響を及げなかった。
  • 本手法は、異なるボックス数($m = \{5,7,9\}$)に対して頑健であり、タスクの目的がERLのボックス境界と一致する場合にわずかな性能向上が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。