Skip to main content
QUICK REVIEW

[論文レビュー] Offline Meta-Reinforcement Learning with Advantage Weighting

Eric Mitchell, Rafael Rafailov|arXiv (Cornell University)|Aug 13, 2020
Reinforcement Learning in Robotics参考文献 47被引用数 11
ひとこと要約

この論文は、複数のタスクからの固定で事前に収集されたデータ上でメタ学習を行い、新しいタスクにオンラインインタラクションなしで少数の軌道のみを用いて適応する、オフラインメタ強化学習(オフラインメタ-RL)という設定を導入する。提案されたMACAWアルゴリズムは、MAMLスタイルのメタ学習とアドバンテージ重み付き回帰(AWR)を組み合わせることで、完全にオフラインな設定において一貫性があり、サンプル効率の高い適応を可能にし、連続制御ベンチマークで先行手法を上回る性能を示す。

ABSTRACT

This paper introduces the offline meta-reinforcement learning (offline meta-RL) problem setting and proposes an algorithm that performs well in this setting. Offline meta-RL is analogous to the widely successful supervised learning strategy of pre-training a model on a large batch of fixed, pre-collected data (possibly from various tasks) and fine-tuning the model to a new task with relatively little data. That is, in offline meta-RL, we meta-train on fixed, pre-collected data from several tasks in order to adapt to a new task with a very small amount (less than 5 trajectories) of data from the new task. By nature of being offline, algorithms for offline meta-RL can utilize the largest possible pool of training data available and eliminate potentially unsafe or costly data collection during meta-training. This setting inherits the challenges of offline RL, but it differs significantly because offline RL does not generally consider a) transfer to new tasks or b) limited data from the test task, both of which we face in offline meta-RL. Targeting the offline meta-RL setting, we propose Meta-Actor Critic with Advantage Weighting (MACAW), an optimization-based meta-learning algorithm that uses simple, supervised regression objectives for both the inner and outer loop of meta-training. On offline variants of common meta-RL benchmarks, we empirically find that this approach enables fully offline meta-reinforcement learning and achieves notable gains over prior methods.

研究の動機と目的

  • メタ学習が完全に固定で事前に収集されたデータ上でのみ行われる、オフラインメタ-RLの問題設定を形式化すること。
  • メタ学習中にオンラインデータ収集が一切ないにもかかわらず、分布内および分布外のテストタスクの両方で良好な性能を達成する一貫性を維持するメタ-RLアルゴリズムの設計。
  • MAMLと価値ベースの強化学習をオフライン設定で組み合わせた際の不安定性を克服するため、ポリシー更新の表現力の向上と、教師あり回帰の目的関数の使用。
  • メタ学習にオフラインデータのみに依存しながらも、テストタスクからの少数の軌道(5未満)を用いて迅速に適応できるようにすること。
  • サンプル効率が高く、劣悪な品質やスパarsな訓練データに対しても頑健な、実用的でエンドツーエンドのオフラインメタ-RLフレームワークの開発。

提案手法

  • オンラインポリシー勾配を避けるために、内側と外側のループの両方で教師あり回帰を用いる最適化ベースのメタ-RLアルゴリズムであるMACAWを提案。
  • ブートストラップや動的計画法を用いない価値関数のフィッティングに、アドバンテージ重み付き回帰(AWR)をコアな強化学習サブルーチンとして採用。
  • メタラーナーの表現力向上を図るため、内側ループでの修正されたポリシー更新を導入し、適応性能の向上を実現。
  • オフライン設定における安定的かつ効果的なメタ学習を実現するために、特定のアーキテクチャ設計が不可欠であることが示された、浅い順伝播ニューラルネットワークを採用。
  • テストタスクの小さなデータセットからの勾配を用いてMAMLスタイルのメタ最適化を実行し、高速な適応を可能にする。
  • TDバックアップの不安定性や長時間スケールの問題を回避するため、価値関数推定にモンテカルロリターンを適用。

実験結果

リサーチクエスチョン

  • RQ1メタ学習中にオンラインインタラクションが一切ないオフラインデータのみで学習したメタ-RLアルゴリズムは、新しいタスクへの一貫性ある適応を達成できるか?
  • RQ2TDバックアップが不安定なオフライン設定において、MAMLスタイルのメタ学習とオフポリシーで価値ベースの強化学習を効果的に組み合わせることは可能か?
  • RQ3内側ループのポリシー更新の表現力を高めることで、オフラインメタ-RLにおける適応性能と安定性が向上するか?
  • RQ4完全にオフラインなメタ-RLアルゴリズムは、既存のオフポリシーおよびオンラインメタ-RLベースラインを、低データ環境下で上回ることができるか?
  • RQ5提案手法は、スパarsなまたは低品質なメタトレーニングデータに対し、どの程度頑健であるか?また、このような条件下でも性能を維持できるか?

主な発見

  • MACAWは、標準的な連続制御メタ-RLベンチマークのオフライン版において、先行する最先端手法を顕著に上回る性能を達成した。
  • 新しいタスクからの5未満の軌道ですら、分布内および分布外の両方のテストタスクにおいて一貫した適応性能を示した。
  • MACAWは、オフポリシーRLおよびメタ-RLベースラインの完全にオフラインなバージョンを上回り、特に完全にオフライン設定では性能が低下するPEARLでさえも上回った。
  • 修正された内側ループのポリシー更新は、特に困難なあるいはスパースなデータ環境下で、適応の安定性と性能を顕著に向上させた。
  • AWRに基づく価値推定にモンテカルロリターンを用いることは、オフラインメタ-RLにおいて効果的で安定した結果をもたらし、TDバックアップの不安定性を回避した。
  • MACAWのアーキテクチャ設計—特に浅い順伝播ネットワーク—が、良好な性能を達成するために不可欠であることが判明し、深層または標準的なアーキテクチャを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。