Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Adversarial Training without Attacking: Worst-Case-Aware Robust Reinforcement Learning

Yongyuan Liang, Yanchao Sun|arXiv (Cornell University)|Oct 12, 2022
Adversarial Robustness in Machine Learning被引用数 8
ひとこと要約

本稿では、分離された攻撃者訓練を必要とせず、有界な ℓp 攻撃下での最悪ケース報酬を直接推定・最適化することで、敵対的ロバストネスを効率的に向上させる、新しいロバスト強化学習フレームワーク WocaR-RL を提案する。この手法は、先行手法と比較して 50% の少ない学習時間とサンプルで最先端のロバスト性能を達成しており、Walker2d などの環境でより解釈可能なロバスト行動を学習する。

ABSTRACT

Recent studies reveal that a well-trained deep reinforcement learning (RL) policy can be particularly vulnerable to adversarial perturbations on input observations. Therefore, it is crucial to train RL agents that are robust against any attacks with a bounded budget. Existing robust training methods in deep RL either treat correlated steps separately, ignoring the robustness of long-term rewards, or train the agents and RL-based attacker together, doubling the computational burden and sample complexity of the training process. In this work, we propose a strong and efficient robust training framework for RL, named Worst-case-aware Robust RL (WocaR-RL) that directly estimates and optimizes the worst-case reward of a policy under bounded l_p attacks without requiring extra samples for learning an attacker. Experiments on multiple environments show that WocaR-RL achieves state-of-the-art performance under various strong attacks, and obtains significantly higher training efficiency than prior state-of-the-art robust training methods. The code of this work is available at https://github.com/umd-huang-lab/WocaR-RL.

研究の動機と目的

  • 実世界の応用における深層強化学習方策の敵対的摂動に対する脆弱性を解消すること。
  • 別個の攻撃者訓練に依存せずに、有界な攻撃下での最悪ケース報酬の脆弱性を特徴づけることで、長期的なロバストネスを向上させること。
  • 既存の敵対的訓練手法が負う二重のサンプルおよび計算コストを回避する効率的な学習フレームワークを開発すること。
  • 単に小さな摂動にのみ頑健でない、本質的に攻撃に対して脆弱性が低い方策を実現すること。
  • PPO や DQN などの既存の DRL アルゴリズムに即座に統合可能なプラグアンドプレイな強化手法を提供すること。

提案手法

  • 既存のオフポリシー・サンプルを用いて、環境とのインタラクションを必要とせず、最悪攻撃下での方策価値の下界を推定する、新しい最悪攻撃ベルマン作用素を導入する。
  • 自然な状況と最悪ケースの期待報酬の重み付き組み合わせを最大化するように方策を最適化し、攻撃なしと攻撃下の両方でのパフォーマンスをバランスさせる。
  • 小さな摂動が報酬の著しい低下を引き起こす状態に、状態重要度重み w(s) を強調することで、重要な意思決定領域におけるロバストネスを向上させる。
  • 特に高影響度の状態で、状態摂動に対する内在的ロバストネスを向上させるために、方策ネットワークに正則化損失 Lreg を組み込む。
  • 追加の環境ロールアウトを必要とせず、オフポリシーのリプレイバッファを用いて最悪ケース価値を推定することで、効率的な学習を実現する。
  • PPO や DQN などの標準的な DRL アルゴリズムと統合可能であり、アーキテクチャの変更なしにそのロバストネスを向上させることができる。

実験結果

リサーチクエスチョン

  • RQ1別個の RL ベースの攻撃者を訓練せずに、有界な ℓp 攻撃下での方策の最悪ケース価値を推定できるか?
  • RQ2最悪ケースパフォーマンスを直接最適化することで、DRL エージェントの長期的ロバストネスをどのように向上させられるか?
  • RQ3状態重要度重みと正則化を組み込むことで、学習済み攻撃者を用いた敵対的訓練よりも、ロバストネスがより効果的に向上するか?
  • RQ4既存の手法と比較して、顕著に少ないサンプルおよび計算コストで SOTA のロバスト性能を達成できるか?
  • RQ5自然なパフォーマンスとロバストネスのトレードオフが、複雑な環境における方策行動にどのように影響を与えるか?

主な発見

  • Walker2d 環境において、最も強い攻撃下で WocaR-RL は PA-ATLA-PPO よりも 20% 高い最悪ケース報酬を達成したが、学習サンプルは 50%、学習時間も 50% にまで削減した。
  • Walker2d 環境における定性的な分析から、WocaR-RL は PA-ATLA-PPO よりもより解釈可能でロバストな行動を学習していることが示された。
  • アブレーションスタディの結果、状態重要度重み w(s) と正則化損失 Lreg の両方がロバストネスを顕著に向上させていることが確認され、特に w(s) は MuJoCo 全環境でパフォーマンスを向上させた。
  • トレードオフハイパーパramータ κwst は自然パフォーマンスとロバストネスのバランスを効果的に制御でき、κwst を高く設定するほど最悪ケース性能が向上するが、自然パフォーマンスが低下する傾向にある。
  • Hopper, Walker2d, Halfcheetah, Ant の全環境で、WocaR-RL はすべてのベースラインを上回る最悪ケースのロバストネスを達成しており、自然パフォーマンスは同等に維持された。
  • 本フレームワークは普遍的に適用可能であり、PPO や DQN などの既存の DRL アルゴリズムのコアアーキテクチャを変更せずに、そのロバストネスを強化できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。