Skip to main content
QUICK REVIEW

[論文レビュー] Learn to Effectively Explore in Context-Based Meta-RL.

Jin Zhang, Jianhao Wang|arXiv (Cornell University)|Jun 15, 2020
Reinforcement Learning in Robotics参考文献 14被引用数 7
ひとこと要約

この論文は、情報理論的内因的報酬によって駆動される専用の探索方策を学習することで、探索と活用を分離する、新しいオフポリシーの文脈ベースのメタ強化学習フレームワークを提案する。本手法は、適応段階における情報豊富な経験収集を可能にすることで、スパarsely-rewardedなMuJoCoおよびMeta-Worldタスクにおいて、既存のベースラインを上回る優れた適応性能を達成する。

ABSTRACT

Meta reinforcement learning (meta-RL) provides a principled approach for fast adaptation to novel tasks by extracting prior knowledge from previous tasks. Under such settings, it is crucial for the agent to perform efficient exploration during adaptation to collect useful experiences. However, existing methods suffer from poor adaptation performance caused by inefficient exploration mechanisms, especially in sparse-reward problems. In this paper, we present a novel off-policy context-based meta-RL approach that efficiently learns a separate exploration policy to support fast adaptation, as well as a context-aware exploitation policy to maximize extrinsic return. The explorer is motivated by an information-theoretical intrinsic reward that encourages the agent to collect experiences that provide rich information about the task. Experiment results on both MuJoCo and Meta-World benchmarks show that our method significantly outperforms baselines by performing efficient exploration strategies.

研究の動機と目的

  • スパarsely-rewardedな設定における非効率な探索のための既存のメタ強化学習手法の低い適応性能を是正すること。
  • 適応段階で情報豊富な経験を収集する専用の探索方策を学習することで、高速適応を実現すること。
  • タスクの文脈に基づいて外因的報酬を最大化する文脈に適応した活用方策を設計すること。
  • 内因的報酬の形状付けを通じて、文脈ベースのメタ強化学習におけるサンプル効率と探索効果を向上させること。
  • 特に挑戦的なスパarsely-rewarded環境において、標準的なメタ強化学習ベンチマークで優れた性能を示すこと。

提案手法

  • 本手法は、タスクの文脈に関する情報量を最大化するように訓練される、別個の探索方策を導入する。
  • 内因的報酬は、エージェントの行動とタスクの文脈の間の相互情報量に基づいて導出され、情報豊富な状態・行動ペアの探索を促進する。
  • 外因的報酬を最大化する文脈に適応した活用方策を、探索者が使用するのと同じ文脈に条件付けられて訓練する。
  • フレームワークはオフポリシーで動作し、適応エピソード間で経験の再利用と効率的なリプレイを可能にする。
  • 探索方策と活用方策は、多様なタスクにおける高速適応を最適化するメタ強化学習の目的関数を用いて同時に訓練される。
  • 本手法は、文脈に依存する方策と内因的報酬割り当てを用いたオフポリシーのアルゴリズム(SAC や TD3 など)を活用する。

実験結果

リサーチクエスチョン

  • RQ1文脈ベースのメタ強化学習における高速適応を実現するため、どのように探索をより効果的にすることができるか?
  • RQ2情報理論的内因的報酬は、スパarsely-rewardedなメタ強化学習環境における探索効率を向上させることができるか?
  • RQ3探索と活用を分離することで、統合最適化と比較してより優れた適応性能が得られるか?
  • RQ4本手法は、標準的なベンチマークにおける既存のオフポリシーのメタ強化学習ベースラインと比較してどのように評価されるか?
  • RQ5本手法は、未観測のタスクにわたるサンプル効率と一般化性能をどの程度向上させるか?

主な発見

  • 提案手法は、MuJoCoおよびMeta-Worldベンチマークにおいて、既存のオフポリシーのメタ強化学習ベースラインと比較して、適応性能において顕著に優れている。
  • 情報理論的内因的報酬の使用により、特にスパarsely-rewardedな環境において、より効率的な探索が実現される。
  • 分離された探索方策と活用方策により、統合学習アプローチと比較して、適応段階での収束がより速くなる。
  • 適応段階におけるより良い経験収集のおかげで、未学習のタスクにおいてより高い最終報酬が達成される。
  • 学習曲線の急峻さとサンプル複雑度の低減という点で、サンプル効率の向上が裏付けられている。
  • アブレーションスタディの結果、スパarsely-rewardedな設定におけるパフォーマンス向上には、内因的報酬メカニズムが不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。