Skip to main content
QUICK REVIEW

[論文レビュー] Interesting Object, Curious Agent: Learning Task-Agnostic Exploration

Simone Parisi, Victoria Dean|arXiv (Cornell University)|Nov 25, 2021
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本稿では、未学習状態の強化学習における探索の限界を克服するため、複数の環境にまたがって共同でエージェント中心および環境中心の探索方策を学習する、タスクに依存しない探索フレームワークであるChange-Based Exploration Transfer (C-BET) を提案する。C-BETは内因的欲求と環境レベルの興味を組み合わせることで、多様なテストシナリオにおいて優れたカバレッジと一貫性を達成し、先行手法を上回る性能を発揮する。

ABSTRACT

Common approaches for task-agnostic exploration learn tabula-rasa --the agent assumes isolated environments and no prior knowledge or experience. However, in the real world, agents learn in many environments and always come with prior experiences as they explore new ones. Exploration is a lifelong process. In this paper, we propose a paradigm change in the formulation and evaluation of task-agnostic exploration. In this setup, the agent first learns to explore across many environments without any extrinsic goal in a task-agnostic manner. Later on, the agent effectively transfers the learned exploration policy to better explore new environments when solving tasks. In this context, we evaluate several baseline exploration strategies and present a simple yet effective approach to learning task-agnostic exploration policies. Our key idea is that there are two components of exploration: (1) an agent-centric component encouraging exploration of unseen parts of the environment based on an agent's belief; (2) an environment-centric component encouraging exploration of inherently interesting objects. We show that our formulation is effective and provides the most consistent exploration across several training-testing environment pairs. We also introduce benchmarks and metrics for evaluating task-agnostic exploration strategies. The source code is available at https://github.com/sparisi/cbet/.

研究の動機と目的

  • 強化学習におけるタブラ・ラサ探索の限界を解消するため、探索を生涯にわたる、転送可能なプロセスとしてモデル化すること。
  • 個別で単一環境に限定された探索から、複数環境での事前学習と新環境への転送へとパラダイム転換すること。
  • 探索の2つの要素を特定・モデル化すること:エージェント中心(未到達状態)と環境中心(本質的に興味深い対象)。
  • タスクに依存しない探索戦略の転送設定における評価のためのベンチマークとメトリクスを開発すること。
  • 多様な環境からの学習が、探索方策の一般化および転送可能性を向上させることを実証すること。

提案手法

  • C-BETは、エージェントの状態訪問回数に基づくエージェント中心の驚きと、パノラマまたはエゴセントリックな視覚的変化に基づく環境中心の変化検出を組み合わせて、探索方策を学習する。
  • 二重構成の内因的報酬を用いる:一つはエージェントが未探索状態をどう信じているかに基づくもので、もう一つはドアやスイッチのような相互作用を引き起こす対象のような高影響の環境的変化に基づくものである。
  • 事前学習は外因的報酬なしに複数の環境で実施され、エージェントが転送可能な探索行動を学習できるようにする。
  • 転送段階では、事前学習済み方策を新たな未学習環境に適用し、追加の訓練なしにカバレッジと一貫性を評価する。
  • フレームワークはパノラマおよびエゴセントリックな視覚符号化を用いて環境的変化を評価し、アブレーションスタディにより両モodalの併用の重要性を示している。
  • アブレーションスタディでは、Count、Curiosity、RND、RIDEといったベースラインと比較し、方策分布とノイズ条件下での頑健性を評価している。

実験結果

リサーチクエスチョン

  • RQ1複数の環境で事前学習された探索方策は、タスク固有の報酬なしに未学習環境へ効果的に一般化できるか?
  • RQ2エージェント中心と環境中心の探索要因を組み合わせることで、単独のエージェント中心手法に比べて、転送性能がどのように向上するか?
  • RQ3ドアや鍵のような高い内因的興味を示す環境的対象が、効果的な探索をどのように導くか?
  • RQ4環境のノイズが、探索方策の頑健性および転送可能性にどのように影響するか?
  • RQ5多様な環境で事前学習をすることで、特定の行動や状態への過学習がどの程度軽減されるか?

主な発見

  • C-BETは、すべての未学習環境で最高かつ最も一貫性のあるシーンカバレッジを達成し、Room 0 や Room 1 といった小さなシーンではほぼすべての状態を訪問し、Apt. 0 や Hotel 0 といった大きなシーンでは1エピソードで大多数の状態をカバーした。
  • C-BETは、事前学習段階および転送段階の両方で、すべてのベースライン(Count、Curiosity、RND、RIDE)を上回り、視覚的多様性の高い環境では特に顕著な性能向上を示した。
  • エゴセントリックな視覚符号化のみを用いても、C-BETは強く性能を維持しており、パノラマ的変化検出とエゴセントリックな状態カウントの組み合わせが成功の要因であることが示された。
  • ノイズのある環境でも、C-BETの方策分布は安定しており、「ドロップ」に対する確率が低く抑えられ、一貫した行動確率を維持している。これに対して、Countは「フォワード」に過学習し、性能が著しく低下した。
  • リセットの有無がCountの性能に重要である一方、C-BETはリセットがなくても強い転送性を維持しており、より高い頑健性を示した。
  • C-BETの方策エントロピーは、すべての設定で低く(0.74–0.99)安定した集中型の行動を示したが、リセットなしのベースラインはノイズ条件下でもほぼランダムな行動を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。