Skip to main content
QUICK REVIEW

[論文レビュー] Universal, transferable and targeted adversarial attacks

Junde Wu, Rao Fu|arXiv (Cornell University)|Aug 29, 2019
Adversarial Robustness in Machine Learning参考文献 13被引用数 8
ひとこと要約

本稿では、自然画像から特定のターゲットクラスに誤分類させるように深層ネットワークをだます、普遍的で転送可能かつ標的指向の敵対的攻撃を学習する、最初の手法を提案する。高次特徴表現を周波数が低い敵対的画像(低周波数の偽装画像)に類似させる制約を課すことで、そのような画像は本質的に転送性が高いため、多様なモデル、ブラックボックスサーバーを含め、最小限の摂動で高い成功率を達成する。

ABSTRACT

Deep Neural Networks have been found vulnerable re-cently. A kind of well-designed inputs, which called adver-sarial examples, can lead the networks to make incorrectpredictions. Depending on the different scenarios, goalsand capabilities, the difficulties of the attacks are different.For example, a targeted attack is more difficult than a non-targeted attack, a universal attack is more difficult than anon-universal attack, a transferable attack is more difficultthan a nontransferable one. The question is: Is there existan attack that can meet all these requirements? In this pa-per, we answer this question by producing a kind of attacksunder these conditions. We learn a universal mapping tomap the sources to the adversarial examples. These exam-ples can fool classification networks to classify all of theminto one targeted class, and also have strong transferability.Our code is released at: xxxxx.

研究の動機と目的

  • 最も厳しい脅威モデル(白ボックス、普遍的、標的指向、転送可能)の下で、普遍的で転送可能かつ標的指向の敵対的攻撃が同時に実現可能かどうかという未解決の問いに答えること。
  • 被害者モデルのアーキテクチャや勾配情報が入手できない状況下でも、多様なモデル、特にブラックボックスシステムに対しても効果的な敵対的例を生成する手法を開発すること。
  • モデル固有の境界の湾曲に敏感でない低周波数の偽装画像を活用することで、転送性を向上させること。
  • すべての入力画像に対して一様な摂動を一般化することができる普遍的マッピングネットワーク(FTN)を設計し、標的誤分類を維持すること。

提案手法

  • 低周波数の偽装画像(LFIs)を、視覚的構造が欠如しても特定クラスに高い信頼度で分類されるように最適化して生成することで、頑健で転送性の高い敵対的パターンの代理として導入する。
  • VGG19のReLU 5-2、5-3、5-4層の特徴レベル制約を用い、生成された敵対的例の高次特徴表現をLFIsのそれと一致させる。これにより、転送性が保証される。
  • ターゲット誤分類とLFI表現との類似性を両立させる損失関数を用いて、クリアな画像から敵対的例への普遍的マッピングを学習するニューラルネットワーク(FTN)を訓練する。
  • 高周波数ノイズ正則化を伴う勾配ベース最適化を適用し、摂動が小さく人間が認識できない状態を維持しながらも、頑健性を確保する。
  • 特徴の多様体構造に着目し、低周波数パターンがモデル間の境界湾曲の違いに対してより頑健であることを議論し、転送性の向上を裏付ける。
  • 白ボックスおよびブラックボックスモデル、実世界のAPIを含むテストを通じて、実用的制約下での転送性と有効性を検証する。

実験結果

リサーチクエスチョン

  • RQ1最も厳しい脅威モデル(白ボックス、普遍的、標的指向、転送可能)の下で、普遍的で転送可能かつ標的指向の敵対的攻撃を同時に達成できるか?
  • RQ2なぜ低周波数の偽装画像は高周波数のものよりも強い転送性を示すのか?
  • RQ3高次特徴表現を低周波数の偽装画像のものに一致させる制約を課すことで、普遍的敵対的攻撃の転送性が向上するか?
  • RQ4モデルへのアクセスが一切ない状況で、本手法はブラックボックスモデルに対してどのように動作するか?
  • RQ5特徴多様体構造と境界湾曲が、敵対的攻撃の転送性を決定づける役割を果たすか?

主な発見

  • 提案手法は、白ボックスおよびブラックボックスモデルを高信頼度で誤分類させる、普遍的で標的指向かつ転送可能な敵対的例を成功裏に生成した。
  • 低周波数の偽装画像の高次特徴表現に一致させる制約を課した敵対的例は、標準的な勾配ベース手法に比べて顕著に高い転送性を示した。
  • 本手法は、ResNet、DenseNet、Inceptionなどの多様なモデルにおいても、モデルへのアクセスが一切ないブラックボックスAPIを攻撃する際も、高い攻撃成功率を達成した。
  • 実験により、低周波数の偽装画像は異なるモデル間で類似した高次特徴表現を持つことが確認され、自然画像多様体に近いことからその頑健性が説明された。
  • 特徴空間の制約により、攻撃がモデル固有の境界湾曲から分離され、境界に沿った方法に比べて転送性が向上したことが明らかになった。
  • アブレーションスタディの結果、LFI表現制約を削除すると転送性が著しく低下することが判明し、本手法の成功においてその制約が中心的な役割を果たしていることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。