Skip to main content
QUICK REVIEW

[論文レビュー] A Model-based Approach for Sample-efficient Multi-task Reinforcement Learning

Nicholas C. Landolfi, Garrett Thomas|arXiv (Cornell University)|Jul 11, 2019
Reinforcement Learning in Robotics参考文献 36被引用数 7
ひとこと要約

本論文は、学習段階で共有動的モデルを学習し、それを用いて新しいタスクへのサンプル効率的でゼロショット適応を可能にするモデルベースのマルチタスク強化学習アルゴリズムを提案する。まず、実環境との相互作用を一切行わず、学習済みモデル上でポリシーのウォームアップ訓練を実施した後、最小限の実環境サンプルを用いてファインチューニングすることで、MAMLが要する環境相互作用の1%未満(0.4百万対8000万)で、多様な連続制御ベンチマークで優れたサンプル効率を達成する。

ABSTRACT

The aim of multi-task reinforcement learning is two-fold: (1) efficiently learn by training against multiple tasks and (2) quickly adapt, using limited samples, to a variety of new tasks. In this work, the tasks correspond to reward functions for environments with the same (or similar) dynamical models. We propose to learn a dynamical model during the training process and use this model to perform sample-efficient adaptation to new tasks at test time. We use significantly fewer samples by performing policy optimization only in a "virtual" environment whose transitions are given by our learned dynamical model. Our algorithm sequentially trains against several tasks. Upon encountering a new task, we first warm-up a policy on our learned dynamical model, which requires no new samples from the environment. We then adapt the dynamical model with samples from this policy in the real environment. We evaluate our approach on several continuous control benchmarks and demonstrate its efficacy over MAML, a state-of-the-art meta-learning algorithm, on these tasks.

研究の動機と目的

  • 複数のタスク間で共有される動的モデルを活用することで、マルチタスク強化学習におけるサンプル効率を向上させること。
  • 実環境との相互作用を伴わずに、学習済み仮想環境でポリシーを事前訓練することで、新しいタスクへのゼロショット適応を可能にすること。
  • 適応段階における実環境サンプルへの依存度を低くすることで、MAMLのようなポリシー転送手法の主な限界を克服すること。
  • 報酬関数や動的モデルの変化を含む分布シフトに対して、そのロバストネスを評価すること。
  • トレーニング段階で情報量の多いタスクを優先するためのアクティブタスク選択戦略の検討

提案手法

  • アルゴリズムは、複数のタスクにわたる相互作用から、順次的トレーニングフェーズ中に共有動的モデルを学習する。
  • 新しいタスクに直面した際、まず学習済みのシミュレーテッド環境(仮想環境)でポリシー最適化を実施し、ウォームスタートポリシーを生成する。
  • このウォームアップフェーズでは、実環境のサンプルを一切必要とせず、ゼロショット適応を実現する。
  • その後、ウォームスタートポリシーから少量の実環境サンプルを収集し、動的モデルとポリシーのファインチューニングを実施する。
  • トレーニングフェーズ中に、最先端のモデルベース強化学習アルゴリズムであるSLBOを用いて、動的モデルの訓練と改善を実施する。
  • タスクの難易度を仮想環境と実環境でのポリシー性能の差異を推定することで評価し、情報量の多いタスクを優先するアクティブタスク選択を検討する。

実験結果

リサーチクエスチョン

  • RQ1共有され、学習された動的モデルは、実環境との最小限の相互作用で、多様なタスクに効果的にゼロショットポリシー適応を可能にするか?
  • RQ2連続制御ベンチマークにおいて、提案手法のサンプル効率はMAMLと比べてどの程度優れているか?
  • RQ3学習済み動的モデルは、報酬関数のシフトや動的特性の変更といった分布外タスクに対し、どの程度一般化可能か?
  • RQ4限られたサンプル予算下で、トレーニング段階におけるアクティブタスク選択が適応性能を向上させるか?
  • RQ5学習済みモデル上で実施するウォームアップフェーズは、直接的な実環境ファインチューニングと比較して、最終的なポリシー性能にどの程度影響を与えるか?

主な発見

  • 提案手法は、MAMLと比較してテストタスクで顕著に優れた性能を示し、トレーニング段階でMAMLの1%未満(0.4百万対8000万)の環境相互作用で実現した。
  • ハーフチーターおよびアンチの速度タスクにおいて、モデルベース手法はMAMLを上回り、特にゼロショット適応の場面で顕著な優位性を示した。
  • 報酬分布がシフトした場合(例:正の速度から負の速度に変更)でも、性能が著しく低下せず、報酬変更に対してロバストであることが示された。
  • 真の動的モデルが大きくシフトした場合(例:摩擦の低下や脚の無効化)には性能が低下したため、大規模な動的シフトには限界があることが示された。
  • 20タスクではアクティブタスク選択によりわずかな向上が得られたが、30タスクに達すると収益の減少が見られたため、現在のベンチマークではアクティブサンプリングがなくても、手法自体はすでに効果的であることが示唆された。
  • 学習済みモデル上でのウォームアップフェーズは極めて重要である。仮想環境での計算が大部分を占め、実環境との相互作用を最小限に抑えながら、高速かつサンプル効率的な適応が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。