Skip to main content
QUICK REVIEW

[論文レビュー] Optimal Attacks on Reinforcement Learning Policies

Alessio Russo, Alexandre Proutière|arXiv (Cornell University)|Jul 31, 2019
Adversarial Robustness in Machine Learning参考文献 21被引用数 18
ひとこと要約

本稿では、エージェントの累積報酬を最小化するために攻撃をマルコフ決定過程(MDP)として定式化することにより、深層強化学習方策に対する最適なブラックボックス攻撃を提案する。DDPGを用い、行動空間の正則化を施すことで、特に離散的行動空間において勾配ベースの攻撃(例:FGSM)を上回る性能を発揮し、滑らかさ(リプシッツ連続性)を持つ方策は本質的に攻撃に対してより頑健であることを示している。

ABSTRACT

Control policies, trained using the Deep Reinforcement Learning, have been recently shown to be vulnerable to adversarial attacks introducing even very small perturbations to the policy input. The attacks proposed so far have been designed using heuristics, and build on existing adversarial example crafting techniques used to dupe classifiers in supervised learning. In contrast, this paper investigates the problem of devising optimal attacks, depending on a well-defined attacker's objective, e.g., to minimize the main agent average reward. When the policy and the system dynamics, as well as rewards, are known to the attacker, a scenario referred to as a white-box attack, designing optimal attacks amounts to solving a Markov Decision Process. For what we call black-box attacks, where neither the policy nor the system is known, optimal attacks can be trained using Reinforcement Learning techniques. Through numerical experiments, we demonstrate the efficiency of our attacks compared to existing attacks (usually based on Gradient methods). We further quantify the potential impact of attacks and establish its connection to the smoothness of the policy under attack. Smooth policies are naturally less prone to attacks (this explains why Lipschitz policies, with respect to the state, are more resilient). Finally, we show that from the main agent perspective, the system uncertainties and the attacker can be modeled as a Partially Observable Markov Decision Process. We actually demonstrate that using Reinforcement Learning techniques tailored to POMDP (e.g. using Recurrent Neural Networks) leads to more resilient policies.

研究の動機と目的

  • エージェントの平均報酬を明示的に最小化する最適な敵対的攻撃を、ヒューリスティックな勾配手法に依存せずに開発すること。
  • 攻撃者が方策や環境ダイナミクスにアクセスできないブラックボックス攻撃の課題に対処すること。この状況では、観測可能な状態と報酬のみが利用可能である。
  • 特にリプシッツ連続性によって測定される方策の滑らかさが、敵対的摂動に対する脆弱性に与える影響を調査すること。
  • 部分的に観測可能なMDP(POMDP)に適した手法(例:再帰的ネットワーク)を用いてエージェントを訓練することで、敵対的攻撃に対する耐性が向上するかを検討すること。
  • 提案された攻撃フレームワークが、離散的および連続的行動空間を有する多様なOpenAI Gym環境において、どのように有効であるかを検証すること。

提案手法

  • 攻撃の最適性を、エージェントの累積リターンを最小化する目的関数として定式化したMDPとして定式化する。
  • ホワイトボックス攻撃では、探索を改善するために勾配ベースの最適化を用い、FGSMのようなヒューリスティック手法に依存しない。
  • ブラックボックス攻撃では、入力摂動を表す大規模な連続的行動空間を扱えるように適合させたDeep Deterministic Policy Gradient(DDPG)を用いて攻撃者の方策を訓練する。
  • 摂動が有界な$ε$-ボール内に収まるように、DDPGにおける行動空間の正則化を適用することで、現実的で標的を絞った攻撃を実現する。
  • Pongのような画像ベースの環境では、ボールおよびパドルの位置を含む4次元の特徴ベクトルを抽出し、計算コストを低減するとともに解釈可能性を向上させるために、特徴空間に直接攻撃を適用する。
  • エージェントの視点から、攻撃者の影響をPOMDPとしてモデル化し、記憶拡張型方策(例:DRQN)の使用が耐性向上に寄与することを正当化する。

実験結果

リサーチクエスチョン

  • RQ1方策および環境ダイナミクスが既知である(ホワイトボックス状況)場合、最適な敵対的攻撃をMDPとして定式化できるか?
  • RQ2方策やダイナミクスにアクセスできない状況(ブラックボックス設定)において、状態と報酬のみが観測可能である場合、最適な攻撃をどのように訓練できるか?
  • RQ3リプシッツ連続性によって測定される方策の滑らかさは、敵対的摂動に対する耐性にどの程度影響を与えるか?
  • RQ4POMDPに適した手法(例:再帰的ネットワーク)を用いてエージェントを訓練することで、敵対的攻撃下での耐性が向上するか?
  • RQ5最適攻撃の性能向上は、FGSMのような標準的な勾配ベースの手法と比較して、異なる環境や行動空間タイプにおいてどの程度顕著か?

主な発見

  • DDPGを用いて訓練された本稿の最適攻撃は、FGSMのような勾配ベースの攻撃を一貫して上回り、$ε=0.07$の条件下で離散的MountainCarではエージェント性能を最大30%まで低下させた。
  • 連続的MountainCarでは、$ε=0.07$の条件下で13%の性能低下を達成しており、小さな摂動に対して連続的行動空間が本質的により頑健であることが示された。
  • Pongにおける攻撃は4次元の特徴空間に適用され、500回の訓練エピソード以内にエージェントの平均報酬を最大値からほぼ最小値(-20)まで低下させた。これは、極めて小さな摂動(ピクセル空間での$ε=0.013$)で高い効果を発揮したことを示している。
  • 理論的分析により、攻撃が与える最大損傷は方策のリプシッツ定数によって上界で制限されることを示し、滑らかな方策がより頑健である理由を説明した。
  • 記憶機構を備えた方策(例:DRQN)は、より高い耐性を示し、POMDPモデル化が敵対的不確実性下での耐性向上に寄与することを確認した。
  • 本研究は、標準的な勾配ベースの攻撃が最適でないことを確認した。これは、それらがトレーリング全体のエージェントの累積報酬を明示的に最小化しないのに対し、提案されたMDPベースのアプローチはそのように設計されているためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。