Skip to main content
QUICK REVIEW

[論文レビュー] Robust Reinforcement Learning using Adversarial Populations

Eugene Vinitsky, Yuqing Du|arXiv (Cornell University)|Aug 4, 2020
Adversarial Robustness in Machine Learning参考文献 30被引用数 13
ひとこと要約

本稿では、各ロールアウトのたびにランダムに初期化された敵対的集団に対して強化学習エージェントを訓練する、ロバストネス・バイ・アドバーシャリ・ポピュレーション(RAP)を提案する。この手法により、動的摂動に対して顕著にロバストネスが向上する。単一の敵対的エージェントに依存する従来手法は、新たな摂動に対して失敗するが、RAPは多様な敵対的ダイナミクスにさらされることで、ポリシーの一般化性能を向上させ、ドメインランダム化を凌駕するロバストネスを達成する。また、エキスパートがチューニングした不確実性集合を必要としない。

ABSTRACT

Reinforcement Learning (RL) is an effective tool for controller design but can struggle with issues of robustness, failing catastrophically when the underlying system dynamics are perturbed. The Robust RL formulation tackles this by adding worst-case adversarial noise to the dynamics and constructing the noise distribution as the solution to a zero-sum minimax game. However, existing work on learning solutions to the Robust RL formulation has primarily focused on training a single RL agent against a single adversary. In this work, we demonstrate that using a single adversary does not consistently yield robustness to dynamics variations under standard parametrizations of the adversary; the resulting policy is highly exploitable by new adversaries. We propose a population-based augmentation to the Robust RL formulation in which we randomly initialize a population of adversaries and sample from the population uniformly during training. We empirically validate across robotics benchmarks that the use of an adversarial population results in a more robust policy that also improves out-of-distribution generalization. Finally, we demonstrate that this approach provides comparable robustness and generalization as domain randomization on these benchmarks while avoiding a ubiquitous domain randomization failure mode.

研究の動機と目的

  • 単一の敵対的エージェントに依存するロバストRLの限界を解消し、標準的なポリシー表現においても、新たな敵対的摂動に対して一般化できない問題を解決すること。
  • 敵対的集団が混合ナッシュ均衡をよりよく近似できるか、連続的制御タスクにおけるロバストネス向上に寄与するかを調査すること。
  • ドメインランダム化と比較して、RAPのロバストネスおよび一般化性能を評価し、ドメインランダム化の一般的な失敗モードを回避できるかを検証すること。
  • 手作業で設計されたドメインランダム化の代替手段として、敵対的集団がよりスケーラブルかつ自動化可能であるかを検討すること。
  • シミュレーテッドロボティクスベンチマークにおいて、敵対的集団のサイズ、訓練の安定性、ポリシーのロバストネスの間のトレードオフを理解すること。

提案手法

  • 本手法は、各訓練ロールアウトごとに独立して初期化され、一様にサンプリングされる確率的敵対的集団を導入する。
  • 訓練中、エージェントは、集団から抽出された最悪の敵対的摂動下での期待報酬を最大化するポリシーを学習する。
  • エージェントと敵対的集団はミニマックスフレームワーク内で同時に訓練され、エージェントはパフォーマンスを最大化しようとするが、各敵対的エージェントはそれを最小化しようとする。
  • 本手法は、SACなどの標準的な深層強化学習アルゴリズムを用い、複数の敵対的ダイナミクスのサンプルを含む共通のバッチを用いる。
  • 敵対的ポリシーは確率的ポリシー(例:ガウス分布)としてパrameter化され、ポリシー勾配法により訓練され、多様で挑戦的な摂動を生成する。
  • 本手法は、敵対的分布を集合ベースの訓練によってエンドツーエンドで学習することで、エキスパートが定義した不確実性集合の必要性を回避する。

実験結果

リサーチクエスチョン

  • RQ1単一の敵対的エージェントを用いることで、異なるダイナミクスの変化に対して一貫してロバストネスが向上するか?
  • RQ2単一の敵対的エージェントと比較して、敵対的集団が混合ナッシュ均衡をよりよく近似できるか?
  • RQ3敵対的集団のサイズがポリシーのロバストネスおよび訓練の安定性に与える影響は?
  • RQ4エキスパートがチューニングした不確実性分布を必要とせず、分布外の設定においてRAPがドメインランダム化を凌駕する一般化性能を示せるか?
  • RQ5RAPのロバストネスは、混合戦略のより良い近似によるものか、それとも敵対的挑戦の多様性の増加によるものか?

主な発見

  • RAPは、すべてのテスト済みMuJoCo環境でロバストネスを向上させ、Hopperでは3体、他のドメインでは5体の敵対的エージェントが最良のパフォーマンスを達成した。
  • 単一の敵対的エージェント手法は、新たな敵対的エージェントに対して一般化に失敗し、未知の摂動パターンにさらされた際にポリシーが狙い撃ち可能であることが示された。
  • 敵対的集団のサイズが3体に達するまでロバストネスは単調増加するが、以降はパフォーマンスが頭打ちまたはわずかに低下する傾向を示し、多様性と訓練効率の間のトレードオフがあることが示唆された。
  • エキスパートがチューニングした不確実性分布を必要とせず、ドメインランダム化と同等またはそれ以上のロバストネスを達成し、ドメインランダム化の一般的な失敗モードを回避した。
  • 本手法は、分布外一般化性能が向上し、RAPで訓練されたポリシーは、訓練中に見られなかった動的摂動に対してもパフォーマンスを維持した。
  • 敵対的集団の使用により、固定パターンに適応する単一の敵対的エージェントとは異なり、持続的かつ方向性のある力(例:北または南からの風)に対して、より攻撃に強い、狙い撃ちされにくいポリシーが得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。