[論文レビュー] Who Is the Strongest Enemy? Towards Optimal and Efficient Evasion Attacks in Deep RL
本稿では、深層強化学習における最強の回避攻撃者を特定するため、ポリシー摂動と状態レベルの敵対的攻撃を同時に最適化する新しい共同フレームワークPA-ADを提案する。ポリシー攻撃者MDP(PAMDP)とディレクター・アクトゥアフレームワークを導入することで、理論的最適性を達成し、従来のRLベースの手法よりも著しく高い効率性を実現。AtariおよびMuJoCo環境において、最先端の攻撃手法を上回り、敵対的訓練によって最先端の耐性を実現する。
Evaluating the worst-case performance of a reinforcement learning (RL) agent under the strongest/optimal adversarial perturbations on state observations (within some constraints) is crucial for understanding the robustness of RL agents. However, finding the optimal adversary is challenging, in terms of both whether we can find the optimal attack and how efficiently we can find it. Existing works on adversarial RL either use heuristics-based methods that may not find the strongest adversary, or directly train an RL-based adversary by treating the agent as a part of the environment, which can find the optimal adversary but may become intractable in a large state space. This paper introduces a novel attacking method to find the optimal attacks through collaboration between a designed function named "actor" and an RL-based learner named "director". The actor crafts state perturbations for a given policy perturbation direction, and the director learns to propose the best policy perturbation directions. Our proposed algorithm, PA-AD, is theoretically optimal and significantly more efficient than prior RL-based works in environments with large state spaces. Empirical results show that our proposed PA-AD universally outperforms state-of-the-art attacking methods in various Atari and MuJoCo environments. By applying PA-AD to adversarial training, we achieve state-of-the-art empirical robustness in multiple tasks under strong adversaries. The codebase is released at https://github.com/umd-huang-lab/paad_adv_rl.
研究の動機と目的
- 有界な制約下でDRLエージェントに対する最強で最適な敵対的摂動を特定する課題に対処すること。
- 高次元状態空間における直接的なRLベースの攻撃者が非効率であるという問題を克服すること。
- 計算負荷を軽減しつつ理論的最適性を達成する手法を開発すること。
- 提案された攻撃を用いた効果的な敵対的訓練により、DRLエージェントの耐性を向上させること。
提案手法
- 最適ポリシーが最も強い状態レベルの攻撃者を誘発する、ポリシー攻撃者MDP(PAMDP)を導入する。
- 共同の2エージェントフレームワークを採用:『ディレクター』は最適なポリシー摂動方向を学習し、『アクトゥア』はそれに対応する状態摂動を生成する。
- PAMDP上でディレクターを訓練するために、市販のRLアルゴリズムを活用し、全状態空間攻撃者と比較して問題のサイズと探索負荷を著しく軽減する。
- アクトゥアはポリシー摂動方向を状態空間摂動にマッピングし、効率的かつ標的的な攻撃生成を可能にする。
- 本手法は、決定論的および確率的ポリシー、ベクトル化およびピクセルベースの観測、離散的および連続的行動空間に一般化可能である。
- 理論的分析により、PAMDPにおける最適ポリシーが、任意の与えられた攻撃予算εにおいて最適な状態攻撃者をもたらすことが証明されている。
実験結果
リサーチクエスチョン
- RQ1制限された摂動予算下で、ヒューリスティックまたは部分最適な手法に依存せず、DRLエージェントの最適な回避攻撃者を特定できるか?
- RQ2直接的なRLベースの攻撃者が非効率になる高次元状態空間において、最強の攻撃者を効率的に探索する方法は何か?
- RQ3最適なポリシー摂動の探索を直接的な状態空間最適化から分離することで、計算複雑性を低減できるか?
- RQ4共同のディレクター・アクトゥアフレームワークは、既存の手法と比較して、より優れた攻撃性能と耐性向上を実現できるか?
主な発見
- PA-ADは、多様なAtariおよびMuJoCo環境において、最先端の攻撃手法を普遍的に上回り、より小さな攻撃予算で優れた攻撃成功率を達成する。
- Pong や LunarLander などの環境では、l∞摂動半径 0.005 で100%の標的攻撃成功率を達成し、CIFAR-10で訓練された画像分類器を著しく上回る。
- 従来の研究と比較して、攻撃者のRL問題のサイズを軽減し、高次元状態空間でも効率的な学習を可能にする。
- PA-ADを用いた敵対的訓練により、複数のDRLタスクで最先端の実験的耐性が達成され、本手法の有効性が実証された。
- PA-ADは、特に大規模な状態空間において、従来のRLベースの攻撃者よりも著しく効率的でありながら、理論的最適性を維持する。
- 本フレームワークは一般化可能であり、離散的および連続的行動空間、およびベクトル化およびピクセルベースの観測に適用可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。