Skip to main content
QUICK REVIEW

[論文レビュー] Fast Adaptation via Policy-Dynamics Value Functions

Roberta Răileanu, Max A. Goldstein|arXiv (Cornell University)|Jul 6, 2020
Reinforcement Learning in Robotics参考文献 56被引用数 9
ひとこと要約

本稿では、オフラインの軌道からポリシーと環境の埋め込みを学習することで、強化学習における新しい環境ダイナミクスへの高速適応を実現する、ポリシー・ダイナミクス価値関数(PD-VF)を提案する。これらの埋め込みに条件付けられた価値関数を訓練することで、わずかな環境との相互作用のみで迅速なポリシー選択が可能となり、未学習のダイナミクスを有するMuJoCo連続制御タスクにおいて、メタ学習および転移学習のベースラインを上回る性能を発揮する。

ABSTRACT

Standard RL algorithms assume fixed environment dynamics and require a significant amount of interaction to adapt to new environments. We introduce Policy-Dynamics Value Functions (PD-VF), a novel approach for rapidly adapting to dynamics different from those previously seen in training. PD-VF explicitly estimates the cumulative reward in a space of policies and environments. An ensemble of conventional RL policies is used to gather experience on training environments, from which embeddings of both policies and environments can be learned. Then, a value function conditioned on both embeddings is trained. At test time, a few actions are sufficient to infer the environment embedding, enabling a policy to be selected by maximizing the learned value function (which requires no additional environment interaction). We show that our method can rapidly adapt to new dynamics on a set of MuJoCo domains. Code available at https://github.com/rraileanu/policy-dynamics-value-functions.

研究の動機と目的

  • 訓練時のダイナミクスとは異なる環境において、強化学習における迅速な適応を解決すること。
  • 特定の環境固有の特徴に過剰に適合してしまう標準的なRLエージェントが、小さな摂動に対しても一般化に失敗するという限界を克服すること。
  • 完全なロールアウトや追加の環境相互作用を必要とせずに、未学習の環境において迅速なポリシー選択を可能にすること。
  • 多様なダイナミクスにおいて、ポリシー、環境ダイナミクス、期待報酬の関係をモデル化する価値関数を学習すること。
  • 複雑な制御タスクにおける連続的および離散的ダイナミクス変化に一般化可能なフレームワークを開発すること。

提案手法

  • 多様な訓練環境で標準的なRLポリシーを学習し、軌道を生成する。
  • これらの軌道を用いて自己教師あり学習を実施し、ポリシー行動と環境ダイナミクスを低次元表現に同時に埋め込む。
  • 初期状態、ポリシー埋め込み、環境埋め込みを入力とし、真の累積報酬をターゲットとして、教師あり価値関数を訓練する。
  • テスト時、最初の数ステップの環境相互作用からのみ環境埋め込みを推論する。
  • 追加の環境相互作用を一切行わずに、ポリシー埋め込み上で学習済み価値関数を最大化することで最適なポリシーを選択する。
  • 選択されたポリシーを用いて新しい環境で行動することで、最小限のサンプル複雑性で迅速な適応を実現する。

実験結果

リサーチクエスチョン

  • RQ1ポリシーおよび環境埋め込みに条件付けられた価値関数は、連続制御タスクにおいて未学習の環境ダイナミクスへの迅速な適応を可能にするか?
  • RQ2標準的なメタ学習および転移学習手法と比較して、PD-VFはどの程度新しいダイナミクスに一般化するか?
  • RQ3わずかな環境相互作用で十分に環境埋め込みを推論し、高性能なポリシーを選択できるか?
  • RQ4最適でないポリシーを最適なポリシーとともにモデル化することで、ダイナミクス全体にわたる一般化が向上するか?
  • RQ5学習済みのポリシー・ダイナミクス埋め込み空間は、行動と環境ダイナミクスの関係に意味的な構造を捉えられるか?

主な発見

  • PD-VFは、未学習のダイナミクスを有するMuJoCo環境において、メタ学習および転移学習のベースラインを著しく上回り、特に初期適応段階で顕著な優位性を示す。
  • スイマー領域では、PD-VFが最後の環境(E10)で平均報酬203.95を達成し、次に優れた手法よりも30点以上も上回った。
  • スペースシップ領域では、E10で報酬196.18を達成し、多様なダイナミクスにわたる強力な一般化性能を示した。
  • わずかな環境相互作用(数ステップ)で十分に新しい環境を埋め込み、ポリシーを選択可能であり、環境との相互作用を最小限に抑えた。
  • ポリシー・ダイナミクス埋め込みに基づく価値関数は、連続的および離散的ダイナミクスの変化にわたって一般化可能であり、摂動に対して頑健であることが示された。
  • PD-VFは完全なロールアウトを必要とせずポリシーを効率的にランク付けでき、フィードバックが少ない、またはコストの高い環境でも迅速な推論と展開が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。