[論文レビュー] Universal Adversarial Attack on Attention and the Resulting Dataset DAmageNet
本稿では、交差エントロピー損失の代わりに注目マップの歪みを最適化することにより、一般化性を向上させる、新たなブラックボックス敵対的攻撃である「注目への攻撃」(AoA)を提案する。ImageNetから50,000個のユニバーサル敵対的サンプルを生成することで、13のwell-trainedなモデルに対して85%を超えるtop-1誤差率を達成し、敵対的訓練や複数の防御機構に対しても有効である、最初のユニバーサル敵対的データセット「DAmageNet」を構築した。
Adversarial attacks on deep neural networks (DNNs) have been found for several years. However, the existing adversarial attacks have high success rates only when the information of the victim DNN is well-known or could be estimated by the structure similarity or massive queries. In this paper, we propose to Attack on Attention (AoA), a semantic property commonly shared by DNNs. AoA enjoys a significant increase in transferability when the traditional cross entropy loss is replaced with the attention loss. Since AoA alters the loss function only, it could be easily combined with other transferability-enhancement techniques and then achieve SOTA performance. We apply AoA to generate 50000 adversarial samples from ImageNet validation set to defeat many neural networks, and thus name the dataset as DAmageNet. 13 well-trained DNNs are tested on DAmageNet, and all of them have an error rate over 85%. Even with defenses or adversarial training, most models still maintain an error rate over 70% on DAmageNet. DAmageNet is the first universal adversarial dataset. It could be downloaded freely and serve as a benchmark for robustness testing and adversarial training.
研究の動機と目的
- 構造的または勾配の類似性に依存する既存のブラックボックス敵対的攻撃の一般化性の限界を解消すること。
- DNNに共通する意味的脆弱性である注目マップの一貫性を同定し、それを利用すること。
- 分類損失の代わりに注目を標的とする損失関数を開発し、一般化性を向上させること。
- 耐性評価および敵対的訓練のためのスケーラブルなユニバーサル敵対的データセット(DAmageNet)を構築すること。
- 注目に基づく攻撃が、強力な防御機構に対しても、従来の手法を上回る一般化性を示すことを実証すること。
提案手法
- 標準の交差エントロピー損失の代わりに、元の注目マップ分布からの逸脱をペナルティとする注目に基づく損失を採用する。
- 注目マップを散らすが、画像の見えにくさを維持する摂動を生成する敵対的攻撃ネットワークを訓練する。
- 訓練済みの攻撃モデルを用いて、ImageNet検証セット上でユニバーサル敵対的サンプルを生成する。
- 50,000枚のImageNet検証画像に攻撃を適用し、DAmageNet—ユニバーサル敵対的サンプルのデータセット—を生成する。
- 既存の一般化性向上技術(例:SI)とAoAを組み合わせて、さらなる性能向上を図る。
- 得られた敵対的サンプルを、敵対的訓練や防御機構を備えた多様なモデルで評価する。
実験結果
リサーチクエスチョン
- RQ1注目マップは、多様なDNNにおいてブラックボックス攻撃のためのユニバーサルな意味的脆弱性として機能するか?
- RQ2交差エントロピー損失を注目損失に置き換えることで、攻撃の一般化性が顕著に向上するか?
- RQ31つの敵対的摂動セットが、アーキテクチャが異なる多数の事前学習済みモデルに一般化可能か?
- RQ4敵対的訓練や入力前処理によって強化されたモデルに対し、AoA生成サンプルの有効性はいかが?
- RQ5注目に基づく攻撃を用いて、耐性評価のベンチマークとして使用可能な大規模なユニバーサル敵対的データセットを構築可能か?
主な発見
- AoAは、標準の交差エントロピーに基づく攻撃と比較して、一般化性を10%〜15%向上させ、特に一般化性向上技術と組み合わせると顕著な向上が得られる。
- AoAを用いて生成されたDAmageNetは、防御機構を備えない13のwell-trainedなDNNに対して、top-1誤差率が85%を超える。
- DAmageNetに敵対的訓練されたモデルですら70%を超える誤差率を示し、AoAに対して強い耐性の欠如を示している。
- JPEG圧縮、ピクセル化、ランダマイズ処理などの防御機構は、DAmageNetでは誤差率の低下が最小限に抑えられ、有効性が限定的である。
- 特徴ノイズ除去モデルは耐性が向上するが、前処理ベースの防御機構はAoA攻撃を効果的に緩和できない。
- DAmageNetは、耐性評価および敵対的訓練のためのベンチマークとして利用可能な、最初のユニバーサル敵対的データセットである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。