Skip to main content
QUICK REVIEW

[論文レビュー] Offline Meta Learning of Exploration

Ron Dorfman, Idan Shenfeld|arXiv (Cornell University)|Aug 6, 2020
Reinforcement Learning in Robotics参考文献 46被引用数 9
ひとこと要約

本稿では、従来の強化学習エージェントのオフラインデータからベイズ最適探索方策を学ぶ、オフラインメタ強化学習フレームワークBOReLを提案する。VariBADをオフポリシーQ学習に拡張し、データ収集と報酬再ラベル化によりMDPの不確実性を解消することで、メタエージェントが訓練データにない、たとえば報酬が疎な環境における体系的探索といった、新たな探索戦略を発見できる。これはオンラインのトムソンサンプリングベースラインを上回る性能を示す。

ABSTRACT

Consider the following instance of the Offline Meta Reinforcement Learning (OMRL) problem: given the complete training logs of $N$ conventional RL agents, trained on $N$ different tasks, design a meta-agent that can quickly maximize reward in a new, unseen task from the same task distribution. In particular, while each conventional RL agent explored and exploited its own different task, the meta-agent must identify regularities in the data that lead to effective exploration/exploitation in the unseen task. Here, we take a Bayesian RL (BRL) view, and seek to learn a Bayes-optimal policy from the offline data. Building on the recent VariBAD BRL approach, we develop an off-policy BRL method that learns to plan an exploration strategy based on an adaptive neural belief estimate. However, learning to infer such a belief from offline data brings a new identifiability issue we term MDP ambiguity. We characterize the problem, and suggest resolutions via data collection and modification procedures. Finally, we evaluate our framework on a diverse set of domains, including difficult sparse reward tasks, and demonstrate learning of effective exploration behavior that is qualitatively different from the exploration used by any RL agent in the data.

研究の動機と目的

  • 従来の強化学習エージェントの事前収集済みデータから、有効な探索方策を学ぶオフラインメタ強化学習手法の開発。
  • 信念拡張状態を用いてベイズ最適性を保ちつつ、VariBADフレームワークをオフポリシー学習に拡張すること。
  • オフラインデータが状態遷移が疎または重複するため環境構造を特定できない場合に生じるMDPの不確実性問題を形式化し、解決すること。
  • メタエージェントが訓練データ内のいかなるエージェントとも質的に異なる、より効果的な探索行動を学習できることを示すこと。

提案手法

  • VariBADの信念拡張状態表現をオフポリシーQ学習に適応させ、オンライン相互作用なしにベイズ強化学習を実現する。
  • 変分オートエンコーダを用いて、オフライン軌道から適応的なニューラル信念推定値を学習する。
  • 後方確率的不確実性の下で探索と活用のバランスを取るメタポリシーを、オフポリシーQ学習で訓練する。
  • 異なるタスク間で識別可能な状態が重複せず、多様であるように保証するデータ収集プロトコルを提案する。
  • 再収集を必要とせず、報酬の違いのみで生じるMDPの不確実性を解消するための報酬再ラベル化技術を導入する。
  • これらの要素を統合し、メタ強化学習におけるベイズ的オフライン強化学習フレームワークBOReLを構築する。

実験結果

リサーチクエスチョン

  • RQ1メタエージェントは、オンライン相互作用なしに、従来の強化学習エージェントのオフラインデータから効果的な探索戦略を学習できるか?
  • RQ2メタ強化学習におけるベイズ強化学習をオフポリシー設定に拡張する方法は何か? その際、ベイズ最適性を維持できるか?
  • RQ3オフラインメタ強化学習におけるMDPの不確実性の原因は何か? また、データ収集または前処理段階でどのように緩和できるか?
  • RQ4環境の差が報酬の違いに限る場合、報酬再ラベル化はMDPの不確実性を解消できるか?
  • RQ5提案手法は、訓練データ内のエージェントとは根本的に異なる探索行動を学習するか?

主な発見

  • BOReLは、報酬が疎な環境で未知のゴールを体系的に探索するベイズ最適探索方策を学習する。例として、半円を回って隠れたゴールを発見するようなタスク。
  • Ant-Semi-circleドメインでは、均一なデータ収集条件下で平均報酬171.8 ± 7.0を達成し、適切なデータ多様性が欠如した手法よりも顕著に優れた性能を示す。
  • メタエージェントは訓練データとは質的に異なる行動を示す:最初のエピソードで探索し、2番目のエピソードで活用する。訓練データ内のいかなるエージェントとも異なる行動である。
  • ポリシーの再利用が行われない場合、非重複する識別可能な状態を持つドメインでは性能が急激に低下し、MDPの不確実性が性能劣化の要因であることを確認する。
  • 報酬再ラベル化のアブレーション実験では、誤った信念更新が生じる(最初に訪問したゴールに誤って固定される)ため、再ラベル化ステップの必要性を示す。
  • 固定された初期位置など、低多様性のデータセットに対しても、BOReLは非自明な探索行動を学習できることから、データ品質の制限に強く、ロバストであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。