Skip to main content
QUICK REVIEW

[論文レビュー] Explore then Execute: Adapting without Rewards via Factorized Meta-Reinforcement Learning

Evan Zheran Liu, Aditi Raghunathan|arXiv (Cornell University)|Jun 12, 2020
Reinforcement Learning in Robotics参考文献 21被引用数 6
ひとこと要約

この論文では、タスク固有の報酬に依存せずに、環境の重要な情報を独立して特定することにより、探索とタスク実行を分離する因子化されたメタ強化学習手法DREAMを提案する。報酬信号が存在しない環境でも、探索とタスク解決の『鶏とたまご』問題を解消し、従来の手法が失敗するスパarsely-rewardedな3次元視覚ナビゲーションタスクにおいても成功を収める。

ABSTRACT

We seek to efficiently learn by leveraging shared structure between different tasks and environments. For example, cooking is similar in different kitchens, even though the ingredients may change location. In principle, meta-reinforcement learning approaches can exploit this shared structure, but in practice, they fail to adapt to new environments when adaptation requires targeted exploration (e.g., exploring the cabinets to find ingredients in a new kitchen). We show that existing approaches fail due to a chicken-and-egg problem: learning what to explore requires knowing what information is critical for solving the task, but learning to solve the task requires already gathering this information via exploration. For example, exploring to find the ingredients only helps a robot prepare a meal if it already knows how to cook, but the robot can only learn to cook if it already knows where the ingredients are. To address this, we propose a new exploration objective (DREAM), based on identifying key information in the environment, independent of how this information will exactly be used solve the task. By decoupling exploration from task execution, DREAM explores and consequently adapts to new environments, requiring no reward signal when the task is specified via an instruction. Empirically, DREAM scales to more complex problems, such as sparse-reward 3D visual navigation, while existing approaches fail from insufficient exploration.

研究の動機と目的

  • 報酬信号が利用できない状況で、探索を要する新しい環境に適応する課題に対処すること。
  • 探索にタスク知識が依存し、タスク解決に探索が依存するというメタ強化学習における『鶏とたまご』問題を克服すること。
  • 特定の探索を要する環境、たとえば新しい台所で材料を探す、あるいは3次元視覚環境をナビゲートするような状況において、効果的な適応を可能にすること。
  • タスク固有の報酬設計に依存せずに、環境の重要な情報を同定する手法を開発すること。
  • 従来のアプローチが探索が不十分であるために失敗する、複雑でスパarsely-rewardedな環境へのメタ強化学習のスケーリングを実現すること。

提案手法

  • DREAMは、タスク固有の報酬に依存せずに、環境の重要な情報を同定する新しい探索目的を導入する。
  • メタ強化学習を2段階に因子化する:環境の重要な状態を発見することに焦点を当てた「探索」フェーズと、その知識を用いてタスクを実行する「実行」フェーズ。
  • 探索目的は、タスク報酬ではなく、環境の構造から得られる自己教師信号を用いて学習される。
  • 環境の潜在表現を用いて、タスクそのものとは無関係に、将来のタスクに役立つ可能性のある情報を同定する。
  • DREAMは、将来のタスクパフォーマンスとは無関係に、環境に関する情報量の増加を最大化するように探索を誘導するメタポリシーを学習する。
  • このフレームワークにより、報酬信号を必要とせず、自然言語による指示によって新しいタスクにゼロショットで適応可能となる。

実験結果

リサーチクエスチョン

  • RQ1報酬信号が利用できない状況で、探索を要する新しい環境にメタ強化学習エージェントがどのように適応できるか。
  • RQ2報酬なしで特定の探索を要する環境において、従来のメタ強化学習手法がなぜ失敗するのか。
  • RQ3探索とタスク実行を分離することで、報酬信号なしに効果的な適応を可能にする方法はあるか。
  • RQ4どのような自己教師信号が、多様なタスクを解消する上で重要な情報を有する探索を誘導できるか。
  • RQ5因子化されたメタ強化学習アプローチは、複雑でスパarsely-rewardedな視覚ナビゲーションタスクにスケーリング可能か。

主な発見

  • DREAMは報酬信号が存在しない状況でも、従来のメタ強化学習手法が失敗するタスクを成功に解決する。
  • スパarsely-rewardedな3次元視覚ナビゲーションタスクにおいても、効果的な適応を達成しており、従来のアプローチが探索が不十分であるために失敗する原因を解消している。
  • 探索とタスク実行を分離することで、探索を要するタスクに特有のメタ強化学習における『鶏とたまご』問題が解消される。
  • DREAMの自己教師信号に基づく探索目的は、タスク報酬や真値の教師信号に依存せず、有用な環境情報を同定する。
  • DREAMは、自然言語による指示によって指定された新しいタスクに対して、報酬信号を必要とせずゼロショットで適応可能である。
  • 実験的結果から、DREAMは従来のメタ強化学習アプローチよりもより複雑な環境にスケーリング可能であり、とくに報酬がスパースまたは遅延する設定において顕著な性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。