[論文レビュー] Adversarial Attacks on Neural Network Policies
この論文は、深層強化学習におけるニューラルネットワークポリシーが白箱・黒箱の両設定で、複数のアルゴリズムとAtariタスクに渡って対抗的例に脆弱であることを示している。
Machine learning classifiers are known to be vulnerable to inputs maliciously constructed by adversaries to force misclassification. Such adversarial examples have been extensively studied in the context of computer vision applications. In this work, we show adversarial attacks are also effective when targeting neural network policies in reinforcement learning. Specifically, we show existing adversarial example crafting techniques can be used to significantly degrade test-time performance of trained policies. Our threat model considers adversaries capable of introducing small perturbations to the raw input of the policy. We characterize the degree of vulnerability across tasks and training algorithms, for a subclass of adversarial-example attacks in white-box and black-box settings. Regardless of the learned task or training algorithm, we observe a significant drop in performance, even with small adversarial perturbations that do not interfere with human perception. Videos are available at http://rll.berkeley.edu/adversarial.
研究の動機と目的
- 深層強化学習で訓練されたニューラルネットワークポリシーが、異なる学習アルゴリズムに渡って、敵対的サンプルがどのように影響するかを特徴づける。
- DQN、TRPO、および A3C で訓練されたポリシーに対する白箱および黒箱攻撃シナリオを調査する。
- ポリシー間および訓練アルゴリズム間で、敵対的サンプルの転送可能性を評価する。
提案手法
- Fast Gradient Sign Method (FGSM) を適用して、l_infty、l_2、および l_1 ノルムの下で敵対的摂動を生成する。
- ポリシー出力を確率分布として扱い、最も高い重みを持つ行動に合わせたクロスエントロピー損失を用いて摂動を計算する。
- 3つのアルゴリズム(DQN、TRPO、A3C)で訓練した4つのAtariゲーム(Chopper Command、Pong、Seaquest、Space Invaders)に対して攻撃を評価する。
- 白箱攻撃(ターゲットポリシーへの完全アクセス)と、ポリシー間およびアルゴリズム間の転移性を通じた黒箱攻撃を比較する。
実験結果
リサーチクエスチョン
- RQ1異なる深層RLアルゴリズムにわたって、敵対的サンプルがニューラルネットワークポリシーのテスト時の性能低下をどれだけ効果的に引き起こすか?
- RQ2同じタスクのために訓練された、異なるアーキテクチャや訓練手法を用いたポリシー間で、敵対的摂動は転移するのか?
- RQ3深層RLポリシーにおける白箱脅威モデルと黒箱脅威モデルで、敵対的有効性はどのように異なるか?
- RQ4敵対的攻撃の強さに対する異なるノルム制約(l_infty、l_2、l_1)を使用することの影響は何か?
主な発見
- DQN、TRPO、A3C にまたがるニューラルネットワークポリシーは、敵対的入力に対して脆弱であり、顕著な性能低下を示す。
- 敵対的摂動下で、TRPOおよびA3CポリシーはDQNと比較して相対的な頑健性を示す。
- 小さな epsilon の l_infty FGSM は、いくつかのタスクで性能を50%以上低下させる可能性があり、一方で l_1 摂動は数ピクセルを変えるだけで大きな性能低下を引き起こすことがある。
- 1つのポリシーに対して訓練された敵対的摂動は、同じタスクを解く他のポリシーにも転移する可能性があることを示し、転移性を示す。
- 転移性は同じアルゴリズムのポリシー間でより強く、異なるアルゴリズム間では弱いが、より大きな摂動量では依然として影響力がある。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。