Skip to main content
QUICK REVIEW

[論文レビュー] Robust Deep Reinforcement Learning through Adversarial Loss

Tuomas Oikarinen, Tsui-Wei Weng|arXiv (Cornell University)|Aug 5, 2020
Adversarial Robustness in Machine Learning参考文献 43被引用数 15
ひとこと要約

本稿では、堅牢性検証境界から導出された adversarial loss 関数を用いて、敵対的堅牢性を向上させる、ロバストな深層強化学習フレームワーク RADIAL-RL を提案する。DQN、A3C、PPO エージェントが、従来手法よりも最大 5× 強い摂動に耐えることができるとともに、学習の計算コストが 2–10× 減少する。また、worst-case performance の効率的代理指標を提供する新規評価指標 Greedy Worst-Case Reward (GWC) を導入している。

ABSTRACT

Recent studies have shown that deep reinforcement learning agents are vulnerable to small adversarial perturbations on the agent's inputs, which raises concerns about deploying such agents in the real world. To address this issue, we propose RADIAL-RL, a principled framework to train reinforcement learning agents with improved robustness against $l_p$-norm bounded adversarial attacks. Our framework is compatible with popular deep reinforcement learning algorithms and we demonstrate its performance with deep Q-learning, A3C and PPO. We experiment on three deep RL benchmarks (Atari, MuJoCo and ProcGen) to show the effectiveness of our robust training algorithm. Our RADIAL-RL agents consistently outperform prior methods when tested against attacks of varying strength and are more computationally efficient to train. In addition, we propose a new evaluation method called Greedy Worst-Case Reward (GWC) to measure attack agnostic robustness of deep RL agents. We show that GWC can be evaluated efficiently and is a good estimate of the reward under the worst possible sequence of adversarial attacks. All code used for our experiments is available at https://github.com/tuomaso/radial_rl_v2.

研究の動機と目的

  • 深層強化学習エージェントが観測空間における微小で目に見えない敵対的摂動に対して脆弱であるという問題に取り組む。
  • DQN、A3C、PPO などの一般的な深層強化学習アルゴリズムと互換性を持つ、汎用的で効率的な防御フレームワークを開発する。
  • クリーンな環境でのサンプル効率や性能を損なわずに、ℓp-ノルムで制限された敵対的攻撃に対して堅牢性を向上させる。
  • 敵対的摂動下での最悪性能を効率的に推定する新しい評価指標 Greedy Worst-Case Reward (GWC) を導入する。
  • 堅牢な学習が、ProcGen ベンチマークにおける未観測環境への一般化を向上させることを示す。

提案手法

  • 堅牢性検証境界を損失関数に統合することで、ℓp-ノルムで制限された敵対的摂動に対して耐性を持つエージェントを学習する。
  • 訓練中に最悪のアクションシーケンスの微分可能近似を用いて adversarial loss を計算し、エンド・ツー・エンド最適化を可能にする。
  • ε-制限内での最も強い摂動をシミュレートする二段階最適化プロセスを用いて adversarial loss を計算する。
  • 標準的な深層強化学習アルゴリズムと互換性があり、アーキテクチャの最小限の変更で適用可能である。
  • 最悪性能を線形時間で推定できる新しい評価指標 Greedy Worst-Case Reward (GWC) を提案し、指数的計算量を回避する。
  • 既存の手法 [28] を用いて、明るさや色の変化などの意味的摂動に対応可能に拡張し、より広範な実世界応用性を実現する。

実験結果

リサーチクエスチョン

  • RQ1堅牢性検証境界に基づく adversarial loss が、ℓp-ノルムで制限された攻撃に対して深層強化学習エージェントの堅牢性を顕著に向上させ得るか?
  • RQ2SA-PPO らの最先端手法と比較して、提案された RADIAL-RL フレームワークは、学習効率と堅牢性の両面で優れているか?
  • RQ3堅牢な学習が、ProcGen ベンチマークにおける未観測環境への一般化をどの程度向上させるか?
  • RQ4Greedy Worst-Case Reward (GWC) は、敵対的摂動下での真の最悪報酬を正確かつ効率的に推定できるか?
  • RQ5本フレームワークは、離散的制御(Atari)、連続的制御(MuJoCo)、プロシージャル生成(ProcGen)を含む多様な強化学習ベンチマークで有効性を示すか?

主な発見

  • RADIAL-RL エージェントは、既存の最先端手法よりも最大 5× 強い敵対的摂動に耐える。
  • SA-PPO よりも 2–10× 学習時間を短縮し、著しく高い計算効率を達成しながら、より優れた堅牢性を実現した。
  • MuJoCo 環境では、RADIAL-PPO が Half-Cheetah(ε=0.15)で 4724.3 ± 10.6 の平均報酬を達成し、同じ攻撃強度下で SA-PPO の 4175.0 ± 29.9 を上回った。
  • ProcGen ベンチマークでは、ε=5/255 の PGD 攻撃下でも RADIAL エージェントが高い報酬を達成し、未観測レベルへの強力な一般化を示した。
  • ε ∈ {1.3,1.4} の場合、37/40 のエピソードで Greedy Worst-Case Reward (GWC) が真の Absolute Worst-Case Reward (AWC) に近づき、ε ∈ {1.0,1.2} の場合に完全一致を示した。これにより、GWC が代替指標としての有効性が裏付けられた。
  • 先行研究のアクション認証率(ACR)は AWC との相関が GWC よりも弱く、GWC が堅牢性評価に優れた指標であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。