Skip to main content
QUICK REVIEW

[論文レビュー] A Little Robustness Goes a Long Way: Leveraging Robust Features for Targeted Transfer Attacks

Jacob M. Springer, Melanie Mitchell|arXiv (Cornell University)|Jun 3, 2021
Adversarial Robustness in Machine Learning被引用数 7
ひとこと要約

この論文は、小さな adversarial な摂動に対してわずかに頑健であるように訓練されたソース分類器が、畳み込みニューラルネットワークやビジョン変換器を含む多様なアーキテクチャにわたって、標的付き adversarial 攻撃の転送性を顕著に向上させることを示している。主な洞察は、わずかに頑健なモデルが、非頑健なモデルと一致する転送可能な特徴を学習することであり、これによりブラックボックスでの標的付き攻撃が極めて効果的に行えるようになる。

ABSTRACT

Adversarial examples for neural network image classifiers are known to be transferable: examples optimized to be misclassified by a source classifier are often misclassified as well by classifiers with different architectures. However, targeted adversarial examples -- optimized to be classified as a chosen target class -- tend to be less transferable between architectures. While prior research on constructing transferable targeted attacks has focused on improving the optimization procedure, in this work we examine the role of the source classifier. Here, we show that training the source classifier to be "slightly robust" -- that is, robust to small-magnitude adversarial examples -- substantially improves the transferability of class-targeted and representation-targeted adversarial attacks, even between architectures as different as convolutional neural networks and transformers. The results we present provide insight into the nature of adversarial examples as well as the mechanisms underlying so-called "robust" classifiers.

研究の動機と目的

  • ソース分類器の頑健性が、標的付き adversarial 例の転送性に与える影響を調査すること。
  • 特に異なるアーキテクチャ間で、標的付き adversarial 例が非標的付き例よりも転送性が低い理由を理解すること。
  • わずかに頑健なモデルが、非頑健なモデルと重複する特徴を学習するかどうかを調査すること。
  • adversarial 損失関数とネットワークアーキテクチャが adversarial 転送性に果たす役割を評価すること。
  • 頑健なネットワークと非頑健なネットワークの間の特徴の重なりが、転送学習やモデルの解釈可能性に与える影響を検討すること。

提案手法

  • FGSM や PGD を用いた標準的な adversarial 訓練により、小さな adversarial 摂動(ε = 2–4)に対してわずかに頑健な挙動を示すようにソース分類器を訓練した。
  • 特定の誤分類を狙った最適化により、わずかに頑健なソースネットワークを用いて標的付き adversarial 例を生成した。
  • 異なるアーキテクチャ(例:ResNets、ViT、CLIP)を持つブラックボックスのターゲットネットワークに同じ adversarial 例を適用することで、転送性を評価した。
  • 多様なアーキテクチャ、特にビジョン変換器や CLIP を含む、標的付き攻撃の成功率を測定することで、転送性を測定した。
  • 非頑健、わずかに頑健、高度に頑健なモデルを含む、さまざまな頑健性レベルのソースネットワークを比較し、頑健性の影響を隔離した。
  • 表現指向の攻撃を用いて、ソースネットワークとターゲットネットワーク間の特徴類似度を評価し、adversarial 摂動が特徴空間でどれほどうまく転送されるかを測定した。

実験結果

リサーチクエスチョン

  • RQ1わずかに頑健なソース分類器を訓練することで、他のアーキテクチャへの標的付き adversarial 例の転送性が顕著に向上するか?
  • RQ2ソースネットワークの頑健性レベルが、非頑健および adversarial に防御されたモデルに対する標的付き転送攻撃の成功率にどのように影響するか?
  • RQ3わずかに頑健なネットワークが、目的やアーキテクチャが異なる非頑健なネットワークと、特徴の重なりを学習するのか?
  • RQ4わずかに頑健なモデルから生成された表現指向の adversarial 攻撃が、ビジョン変換器を含む多様なターゲットネットワークに効果的に転送されるか?
  • RQ5わずかに頑健なソースモデルを用いる際、adversarial 損失関数が転送可能な標的付き例を生成する上で果たす役割は何か?

主な発見

  • わずかに頑健な CNN から生成された adversarial 例は、他の CNN に加え、驚くべきことに ViT や LeViT、CCT といったビジョン変換器アーキテクチャに対しても高い転送性を示した。
  • ソースネットワークがわずかに頑健である場合、非頑健または高度に頑健なモデルと比較して、標的付き adversarial 例の転送性が顕著に向上した。
  • わずかに頑健なネットワークは、強い表現指向の adversarial 転送性を示しており、非頑健なモデルと顕著な特徴の重なりがあることを示している。
  • 非頑健なネットワーク同士では、顕著な特徴転送性が見られず、学習された特徴が一貫して一致していないことが示唆された。
  • この手法により、ViT や CLIP といったビジョン変換器ベースのモデルに対する、初めての知られている標的付き転送攻撃が可能になった。これは、広範なアーキテクチャへの適用可能性を示している。
  • 攻撃の成功は、類似したアーキテクチャや目的を持つモデルに限らない。たとえば、ResNet をソースとして CLIP に攻撃を実行するなど、異なる目的で事前学習されたモデルに対しても転送が成立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。