[論文レビュー] Adversarial Example Games
本稿では、与えられた仮説クラス内の任意の分類器に対して効果的な転送可能な adversarial examples を生成するように訓練するジェネレータを備えた min-max ゲームフレームワークである Adversarial Example Games (AEG) を提案する。理論的に均衡に収束し、最適で最悪ケースの adversarial examples を生成することを保証しており、非インタラクティブなブラックボックス設定下で MNIST と CIFAR-10 において、SOTA の性能を達成している — それぞれ平均 29.9% および 47.2% の改善を達成している。
The existence of adversarial examples capable of fooling trained neural network classifiers calls for a much better understanding of possible attacks to guide the development of safeguards against them. This includes attack methods in the challenging non-interactive blackbox setting, where adversarial attacks are generated without any access, including queries, to the target model. Prior attacks in this setting have relied mainly on algorithmic innovations derived from empirical observations (e.g., that momentum helps), lacking principled transferability guarantees. In this work, we provide a theoretical foundation for crafting transferable adversarial examples to entire hypothesis classes. We introduce Adversarial Example Games (AEG), a framework that models the crafting of adversarial examples as a min-max game between a generator of attacks and a classifier. AEG provides a new way to design adversarial examples by adversarially training a generator and a classifier from a given hypothesis class (e.g., architecture). We prove that this game has an equilibrium, and that the optimal generator is able to craft adversarial examples that can attack any classifier from the corresponding hypothesis class. We demonstrate the efficacy of AEG on the MNIST and CIFAR-10 datasets, outperforming prior state-of-the-art approaches with an average relative improvement of $29.9\%$ and $47.2\%$ against undefended and robust models (Table 2 & 3) respectively.
研究の動機と目的
- 攻撃者がターゲットモデルにアクセスできない非インタラクティブなブラックボックス(NoBox)攻撃に対して理論的基盤が欠如している問題に対処する。
- 分類器の仮説クラス全体にわたって転送可能な adversarial examples を生成する原理的フレームワークを開発する。
- ゲームの最適 adversarial 分布が、そのクラス内で最も攻撃に強い分類器に対しても効果的であるという理論的保証を提供する。
- 攻撃者と分類器の両方を adversarial ゲームのダイナミクスを通じて同時に強化する訓練手順を設計する。
- 標準的およびロバストなモデルの両方を攻撃する際、ヒューリスティックな NoBox 法よりも経験的に優れた性能を示す。
提案手法
- ジェネレータ(adversarial examples を生成)と分類器(adversarial 入力のラベルを検出)の間の min-max ゲームとして adversarial attack 生成を定式化する。
- GAN スタイルの識別タスクではなく、adversarial examples における標準的な多クラス分類損失を用いてゲームを定義する。
- AEG フレームワークにおいてナッシュ均衡が存在することを証明し、最適ジェネレータが与えられた仮説クラス内の任意の分類器に対して効果的な adversarial examples を生成することを保証する。
- 最適 adversarial 分布が、ターゲットデータセット上で制限付き条件付きエントロピーを最大化することを示し、理論的特徴付けを提供する。
- ジェネレータと分類器の両方をニューラルネットワークで実装し、勾配ベース最適化によりエンドツーエンドで訓練する。
- 均衡に達したジェネレータを用いて、未観測のアーキテクチャやロバストモデルへと転送可能な adversarial examples を生成し、評価する。
実験結果
リサーチクエスチョン
- RQ1ゲーム理論的フレームワークは、非インタラクティブなブラックボックス設定において、転送可能な adversarial examples を原理的かつ理論的裏付け付きで生成するための方法を提供できるか?
- RQ2このようなゲームのナッシュ均衡は、仮説クラス内で最もロバストな分類器に対しても効果的な adversarial examples を生み出すか?
- RQ3最適 adversarial 分布は、条件付きエントロピーなどの情報理論的量とどのように関係しているか?
- RQ4このゲームフレームワークにおける adversarial 訓練は、ヒューリスティックな NoBox 法よりも攻撃性能を向上させることができるか?
- RQ5AEG フレームワークは、ロバストに訓練されたモデルや未観測のアーキテクチャへと転送可能な adversarial examples をどれほど効果的に生成できるか?
主な発見
- AEG フレームワークには保証されたナッシュ均衡があり、最適 adversarial example 分布の存在を保証する。
- AEG の最適ジェネレータは、与えられた仮説クラス内の任意の分類器に対して効果的な adversarial examples を生成し、最悪ケース攻撃の保証を提供する。
- MNIST では、非インタラクティブなブラックボックス攻撃において、先行する SOTA 方法よりも平均 29.9% の改善を達成している。
- CIFAR-10 では、防御なしおよびロバストなモデルの両方の攻撃において、先行する SOTA 方法よりも平均 47.2% の改善を達成している。
- フレームワークは、異なるアーキテクチャやロバストモデルへと一般化可能な転送可能な adversarial examples を効果的に生成した。
- 最適 adversarial 分布が制限付き条件付きエントロピーの一種を最大化することを示し、ゲームの解が情報理論的原則と結びついていることを明らかにした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。