[論文レビュー] Playing the Game of Universal Adversarial Perturbations
本稿では、分類器と敵対的攻撃者との間の相互作用を2人零和ゲームとしてモデル化することで、普遍的敵対的摂動に対する耐性を持つ画像分類器の訓練にゲーム理論的手法を提案する。虚仮のプレイの拡張を用い、以前に生成された普遍的摂動を組み込むことで反復的に耐性を向上させる手法であり、CIFAR10、CIFAR100、ImageNetにおいて標準的な敵対的訓練を上回り、特に普遍的摂動および敵対的パッチに対して優れた性能を示す。
We study the problem of learning classifiers robust to universal adversarial perturbations. While prior work approaches this problem via robust optimization, adversarial training, or input transformation, we instead phrase it as a two-player zero-sum game. In this new formulation, both players simultaneously play the same game, where one player chooses a classifier that minimizes a classification loss whilst the other player creates an adversarial perturbation that increases the same loss when applied to every sample in the training set. By observing that performing a classification (respectively creating adversarial samples) is the best response to the other player, we propose a novel extension of a game-theoretic algorithm, namely fictitious play, to the domain of training robust classifiers. Finally, we empirically show the robustness and versatility of our approach in two defence scenarios where universal attacks are performed on several image classification datasets -- CIFAR10, CIFAR100 and ImageNet.
研究の動機と目的
- 実世界の応用において転送可能で現実的である普遍的敵対的摂動に対する耐性の欠如を是正すること。
- 標準的な敵対的訓練では、特に摂動の大きさが大きい場合に普遍的摂動への一般化が失敗するという限界を克服すること。
- 高い標準的精度を維持しながら、普遍的摂動および敵対的パッチの両方に対して強い耐性を示すスケーラブルな防御フレームワークを開発すること。
- 空間的に局所化された敵対的パッチを特に扱う最初の防御メカニズムを提供すること。これは、従来の耐性研究において未解決の脅威であった。
- 計算コストが高く、過去の耐性学習手法が困難であった大規模データセット、たとえばImageNetへの本手法のスケーラビリティを実証すること。
提案手法
- 分類器(分類損失を最小化)と敵対的攻撃者(普遍的摂動を用いて同じ損失を最大化)の間の2人零和ゲームとして、敵対的耐性学習を定式化する。
- 深層学習の文脈に合わせて、虚仮のプレイアルゴリズムを拡張し、両プレイヤーが相手の歴史的な最適反応に基づいて戦略を更新する。
- 各学習ステップにおいて、分類器はクリーンデータと以前に生成された普遍的摂動の混合データで学習され、敵対的攻撃者は現在の分類器に対して誤分類を最大化する新しい摂動を生成する。
- 反復的最適化を用いて、固定されたL∞-ノルム制約のもとで普遍的摂動を生成し、データセット内のすべての画像に効果的に作用するようにする。
- 本手法を、画像全体に適用する普遍的摂動および、ランダムな位置に配置される局所的で円形のパッチである普遍的敵対的パッチの両方の防御に適用する。
- 確率的勾配降下法と効率的な摂動生成を用いて学習プロセスをスケーリングし、計算コストが非常に高いにもかかわらずImageNetへの適用を可能にする。
実験結果
リサーチクエスチョン
- RQ1虚仮のプレイに基づくゲーム理論的フレームワークは、標準的な敵対的訓練と比較して、普遍的敵対的摂動に対する耐性を向上させることができるか?
- RQ2標準的な敵対的訓練が失敗するような大きな普遍的摂動に対しても、本手法は高い標準的精度を維持しながら強い耐性を達成できるか?
- RQ3本手法は、従来の耐性研究において未解決であった空間的に局所化された敵対的パッチに対しても防御を拡張できるか?
- RQ4計算コストが高く、過去の耐性学習手法が困難であった大規模データセット、たとえばImageNetへの本手法のスケーリングは可能か?
- RQ5虚仮のプレイによって過去に生成された摂動を組み込むことは、標準的な敵対的訓練が最新の摂動のみに依存するのと比較して、より効果的か?
主な発見
- 16ピクセルの普遍的摂動を伴うCIFAR10では、虚仮のプレイ手法が標準的な敵対的訓練(20%未満)およびSGD(約60%)を大きく上回り、70%を超える高い耐性精度(70%以上)を達成した。これは優れた耐性を示している。
- 8ピクセルの摂動を伴うCIFAR100では、虚仮のプレイ手法が標準的精度に近い高い敵対的精度(80%以上)を維持し、SGDおよび敵対的訓練を上回った。
- CIFAR100およびImageNetにおいて、敵対的パッチに対する最先端の耐性を達成した。この攻撃タイプに対しては、本研究以前に防御手法が存在しなかった。
- ImageNetにおいても、本手法は大規模データにスケーリングに成功し、普遍的摂動および敵対的パッチの両方に対して耐性を向上させつつ、高い標準的精度を維持した。
- 特に大きな摂動バジェットを用いた場合でも、標準的な敵対的訓練よりも普遍的摂動に対する耐性が優れていた。
- 結果から、虚仮のプレイによる歴史的摂動の組み込みは、最新の摂動のみに依存する手法よりも、より安定的かつ一般化可能な耐性をもたらすことが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。