Skip to main content
QUICK REVIEW

[論文レビュー] Model-based Adversarial Meta-Reinforcement Learning

Zichuan Lin, Garrett Thomas|arXiv (Cornell University)|Jun 16, 2020
Adversarial Robustness in Machine Learning参考文献 50被引用数 15
ひとこと要約

本稿では、パrameterized task family におけるすべてのタスクの最悪ケース下でのサブ最適性ギャップを最小化するように、共有のダイナミクスモデルを学習するミニマックスフレームワークであるModel-based Adversarial Meta-Reinforcement Learning (AdMRL) を提案する。勾配の暗黙的推定(共役勾配とREINFORCEを用いて)を用いたモデル学習と敵対的タスク探索の交互最適化により、最先端のメタ強化学習手法に比べ、最悪ケース性能、分布外タスクへの一般化、およびサンプル効率の面で優れた性能を達成する。

ABSTRACT

Meta-reinforcement learning (meta-RL) aims to learn from multiple training tasks the ability to adapt efficiently to unseen test tasks. Despite the success, existing meta-RL algorithms are known to be sensitive to the task distribution shift. When the test task distribution is different from the training task distribution, the performance may degrade significantly. To address this issue, this paper proposes Model-based Adversarial Meta-Reinforcement Learning (AdMRL), where we aim to minimize the worst-case sub-optimality gap -- the difference between the optimal return and the return that the algorithm achieves after adaptation -- across all tasks in a family of tasks, with a model-based approach. We propose a minimax objective and optimize it by alternating between learning the dynamics model on a fixed task and finding the adversarial task for the current model -- the task for which the policy induced by the model is maximally suboptimal. Assuming the family of tasks is parameterized, we derive a formula for the gradient of the suboptimality with respect to the task parameters via the implicit function theorem, and show how the gradient estimator can be efficiently implemented by the conjugate gradient method and a novel use of the REINFORCE estimator. We evaluate our approach on several continuous control benchmarks and demonstrate its efficacy in the worst-case performance over all tasks, the generalization power to out-of-distribution tasks, and in training and test time sample efficiency, over existing state-of-the-art meta-RL algorithms.

研究の動機と目的

  • テストタスクが訓練分布と異なる分布シフト問題に対処し、性能の低下を防ぐ。
  • パrameterized task family に属するすべてのタスクにおける最悪ケース下のサブ最適性ギャップを最小化するミニマックス問題としてメタ強化学習を定式化する。
  • 適応段階でのサンプル効率を向上させるために、共有のダイナミクスモデルを学習するモデルベースアプローチを開発する。
  • 暗黙関数定理を用いた効率的な勾配計算により、タスクパラメータの最適化を効果的に行えるようにする。
  • メタトレーニング中にハードなタスクを敵対的に選択することで、分布外タスクへの一般化を向上させる。

提案手法

  • 問題をミニマックス目的関数として定式化:タスクパラメータの関数として最悪ケース下のサブ最適性ギャップを最小化し、モデルパラメータを最小化対象とする。
  • モデルベースアプローチを採用し、固定タスク上で共有のダイナミクスモデルを学習し、テスト時の推論段階でポリシーの適応に活用する。
  • ダイナミクスモデルの更新と、現在のポリシーのサブ最適性ギャップを最大化する敵対的タスクの探索を交互に実行する。
  • 暗黙関数定理を用いて、サブ最適性ギャップのタスクパラメータに関する勾配を導出することで、適応プロセスを介したバックプロパゲーションを可能にする。
  • ヘシアン・ベクトル積に対して共役勾配を用い、ポリシー勾配のための新規REINFORCEベース推定器を組み合わせることで、勾配推定器を効率的に実装する。
  • モデル学習と敵対的タスク生成の交互最適化により、ミニマックス目的関数を最適化する。

実験結果

リサーチクエスチョン

  • RQ1ミニマックス定式化は、タスクの分布シフト下でのメタ強化学習の最悪ケース性能を向上させ得るか?
  • RQ2敵対的タスク生成は、メタ強化学習における分布外タスクへの一般化をどのように向上させるか?
  • RQ3暗黙的勾配推定を用いたモデルベースメタ強化学習は、分布的アプローチに比べ、より優れたサンプル効率とロバスト性を達成できるか?
  • RQ4高次元タスクパラメータ空間では、標準的なメタ強化学習手法と敵対的トレーニングの性能にどのような影響が生じるか?
  • RQ5メタトレーニング中にハードなタスクをカバーする観点から、敵対的タスク選択は一様分布またはガウス分布からのランダムサンプリングと比べてどのように異なるか?

主な発見

  • Ant2DおよびAnt3D環境の境界付近のタスクにおいて、MB-UnifおよびMB-Gaussと比較して、AdMRLは顕著に低い最悪ケースサブ最適性ギャップを達成する。
  • Ant2Dの分布外タスクにおいて、訓練時:[-3,3]²、テスト時:[-5,5]²の分布からタスクを抽出した場合、AdMRLはベースラインと比較して顕著に低いサブ最適性ギャップを示す。
  • 高次元タスクにおいて、AdMRLはハードなタスクを効率的に同定し、タスク空間の中心部への過剰適合を回避することで、MB-UnifおよびMB-Gaussを上回る性能を発揮する。
  • 可視化結果から、AdMRLはタスク空間の境界部に位置するハードなタスクを素早く訪問・学習しているのに対し、ランダムサンプリングベースラインはこれらの領域にほとんど到達しない。
  • AdMRLが学習したモデルは、MB-UnifおよびMB-Gaussと比較して、分布外タスクにおける予測誤差が低く抑えられており、ダイナミクスの一般化性能が向上していることが示唆される。
  • AdMRLは適応ステップの全範囲で強固な性能を維持しており、最悪ケースサブ最適性ギャップがベースラインと比較してより速く低下し、より低い値にまで到達する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。