Skip to main content
QUICK REVIEW

[論文レビュー] Risk Averse Robust Adversarial Reinforcement Learning

Xinlei Pan, Daniel Seita|arXiv (Cornell University)|Mar 31, 2019
Adversarial Robustness in Machine Learning参考文献 42被引用数 11
ひとこと要約

本稿では、価値関数の分散を推定するためにQネットワークのアンサンブルを用いるリスク回避的プロトコルとリスク好求的アドバーサリーを併用する、リスク回避的ロバスト強化学習(RARARL)を提案する。この手法により、代理人は極端な悪影響を避けることができ、標準的なDQNやRARLと比較して、自律走行シミュレーションにおける衝突が顕著に減少する。

ABSTRACT

Deep reinforcement learning has recently made significant progress in solving computer games and robotic control tasks. A known problem, though, is that policies overfit to the training environment and may not avoid rare, catastrophic events such as automotive accidents. A classical technique for improving the robustness of reinforcement learning algorithms is to train on a set of randomized environments, but this approach only guards against common situations. Recently, robust adversarial reinforcement learning (RARL) was developed, which allows efficient applications of random and systematic perturbations by a trained adversary. A limitation of RARL is that only the expected control objective is optimized; there is no explicit modeling or optimization of risk. Thus the agents do not consider the probability of catastrophic events (i.e., those inducing abnormally large negative reward), except through their effect on the expected objective. In this paper we introduce risk-averse robust adversarial reinforcement learning (RARARL), using a risk-averse protagonist and a risk-seeking adversary. We test our approach on a self-driving vehicle controller. We use an ensemble of policy networks to model risk as the variance of value functions. We show through experiments that a risk-averse agent is better equipped to handle a risk-seeking adversary, and experiences substantially fewer crashes compared to agents trained without an adversary.

研究の動機と目的

  • 既存のロバスト強化学習手法が、まれな深刻な事象を明示的にモデリングまたは最適化できないという限界を解消すること。
  • 自律走行のような安全が重要な環境において、訓練目的に明示的にリスク回避性を組み込むことで、ポリシーのロバスト性を向上させること。
  • ランダムな摂動に依存するのではなく、深刻な結果を引き起こす高リスクの状態を意図的に探求する、より効果的なアドバーサリーを設計すること。
  • 危険な状態領域を探索するリスク好求的アドバーサリーとの中での相互作用を通じて、プロトコルがロバストなポリシーを学習できることを可能にすること。
  • 敵対的摂動を用いたリスク回避的訓練が、ランダム摂動や摂動なしと比較して、著しく衝突が少ないことを実証すること。

提案手法

  • プロトコルは、期待リターンを最大化するとともに、Q値ネットワークのアンサンブルを用いて推定される価値関数の分散を最小化するリスク回避的目的関数を用いる。
  • アドバーサリーは、プロトコルの長期的リターンを最小化することを目的とし、明示的にリスク好求的であり、深刻な結果を引き起こすことを焦点にしている。
  • フレームワークはターンベースのアクションメカニズムを採用しており、アドバーサリーが定期的に(10ステップに1回)環境状態を摂動することで、危険なダイナミクスの深層的探索が可能になる。
  • 新規の非対称報酬関数が使用されている:成功時には小さな正の報酬、深刻な事象時には大きな負の報酬が与えられ、リスク回避性が強化される。
  • 本手法は、TORCS自律走行シミュレータで評価され、摂動なし、ランダム摂動、訓練済みの敵対的摂動の下での性能を比較している。
  • アンサンブルベースの分散推定により、高次元連続状態空間におけるスケーラブルなリスクモデリングが可能となり、従来の手法が有限状態空間を仮定していたという制限を克服する。

実験結果

リサーチクエスチョン

  • RQ1リスク回避的目的関数は、強化学習におけるまれな深刻な事象に対するロバスト性を向上させ得るか?
  • RQ2リスク好求的アドバーサリーは、ランダム摂動よりもリスク回避的ポリシーの訓練に強力な信号を供給するか?
  • RQ3Qネットワークアンサンブルによる分散ベースのリスクモデリングは、安全が重要な環境におけるポリシー一般化をどのように改善するか?
  • RQ4RARARLは、標準的なDQNやRARLと比較して、自律走行シミュレーションにおける衝突率をどの程度低減するか?
  • RQ5リスク回避性と敵対的訓練の組み合わせは、シミュレーションから実世界への移行シナリオにおいてより信頼性の高いポリシーをもたらすか?

主な発見

  • 訓練済みのアドバーサリーを用いて訓練されたリスク回避的DQNエージェント(BSDQN-adv-riskaverse)は、深刻な事象報酬として-0.08を達成し、標準的DQN(-0.80)やRARLベースのモデルを著しく上回った。
  • 敵対的摂動下において、リスク回避的モデルは最高で-0.10の深刻な事象報酬を達成したのに対し、非リスク回避的BSDQN-advモデルは-1.0であった。これは、著しく少ない衝突を示している。
  • 訓練済みのアドバーサリーは、可視化された軌道でプロトコルを壁衝突に誘導したが、ランダム摂動では、意図的かつ協調的な行動が欠如していたため、同様の衝突を引き起こせなかった。
  • 敵対的摂動を用いて訓練されたモデルは、ランダム摂動のみで訓練されたモデルと比較して、ランダム攻撃および敵対的攻撃の両方に対して優れたロバスト性を示した。
  • リスク項のおかげで、アドバーサリーは分散が高くリスクの高い領域を探索し、プロトコルはそれらを避けるよう学習し、より安全なポリシー学習が可能になった。
  • アンサンブルベースの分散推定により、連続的かつ高次元の状態空間における効果的なリスクモデリングが可能となり、実世界応用に実用的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。