Skip to main content
QUICK REVIEW

[論文レビュー] Reveal of Vision Transformers Robustness against Adversarial Attacks

Ahmed Aldahdooh, Wassim Hamidouche|arXiv (Cornell University)|Jun 7, 2021
Adversarial Robustness in Machine Learning参考文献 55被引用数 7
ひとこと要約

本稿は、Vision Transformers (ViTs) 及びその変種が、さまざまな $L_p$-ノルムおよび色チャンネル摂動 (CCP) 攻撃に対して、それらのロバストネスを調査している。ImageNet-1k を用いた実験により、白ボックスおよび適応的攻撃の両方において、ベーシックなViTおよびハイブリッドViTが、CNN よりもより高いロバストネスを示すことが判明した。特に $L_p$-ベースおよび RayS 攻撃において顕著であり、一方で ViT は高周波成分を低減する前処理防御に対しては限られた反応を示す。

ABSTRACT

The major part of the vanilla vision transformer (ViT) is the attention block that brings the power of mimicking the global context of the input image. For better performance, ViT needs large-scale training data. To overcome this data hunger limitation, many ViT-based networks, or hybrid-ViT, have been proposed to include local context during the training. The robustness of ViTs and its variants against adversarial attacks has not been widely investigated in the literature like CNNs. This work studies the robustness of ViT variants 1) against different Lp-based adversarial attacks in comparison with CNNs, 2) under adversarial examples (AEs) after applying preprocessing defense methods and 3) under the adaptive attacks using expectation over transformation (EOT) framework. To that end, we run a set of experiments on 1000 images from ImageNet-1k and then provide an analysis that reveals that vanilla ViT or hybrid-ViT are more robust than CNNs. For instance, we found that 1) Vanilla ViTs or hybrid-ViTs are more robust than CNNs under Lp-based attacks and under adaptive attacks. 2) Unlike hybrid-ViTs, Vanilla ViTs are not responding to preprocessing defenses that mainly reduce the high frequency components. Furthermore, feature maps, attention maps, and Grad-CAM visualization jointly with image quality measures, and perturbations' energy spectrum are provided for an insight understanding of attention-based models.

研究の動機と目的

  • Vision Transformers (ViTs) 及びその変種が、$L_p$-ノルムおよび色チャンネル摂動 (CCP) 敵対的攻撃に対して、どの程度ロバストであるかを評価すること。
  • 高周波成分を低減する前処理防御手法を用いた場合、ViTs と CNN のロバストネスを比較すること。
  • モデルアーキテクチャの深さ(アテンションブロックの数)およびトークン化手法が、敵対的ロバストネスに与える影響を調査すること。
  • ブラックボックスおよび適応的攻撃設定下で、ViT および CNN モデル間での敵対的例の転送性を分析すること。

提案手法

  • 敵対的ロバストネスの評価に、ImageNet-1k の検証セットから 1,000 枚の画像を用いた。
  • 敵対的例は、$\epsilon = 4/255$ の PGD-$L_\infty$ を用いて生成され、局所的空間平滑化 (SS)、非局所平均 (NLM)、全変動最小化 (TVM)、JPEG 圧縮 (JPEG)、クロッピングと再スケーリング (CR)、色チャンネル摂動 (CCP) の前処理防御を含む環境でテストされた。
  • 適応的敵対的例を生成するために、変換の分布全体にわたるロバスト性を持つ期待値の変換 (EOT) フレームワークが適用された。
  • モデルの挙動を分析するために、特徴マップ、アテンションマップ、Grad-CAM 視覚化、および摂動の DCT を用いたスペクトル分解が用いられた。
  • ロバストネスは、前処理を施した敵対的例における攻撃成功確率 (ASR) およびトップ-1 誤差によって測定された。

実験結果

リサーチクエスチョン

  • RQ1ViT の変種は、$L_0$、$L_1$、$L_2$、$L_\infty$-ベースの攻撃および CCP 攻撃に対して、CNN よりもよりロバストであるか?
  • RQ2前処理を施した敵対的例において、ViT の変種は CNN よりもよりロバストであるか?
  • RQ3アテンションブロックの数を増加させることで、敵対的例および前処理防御に対するロバストネスが向上するか?
  • RQ4ViT のトークン化手法を強化することで、敵対的例および前処理防御に対するロバストネスが向上するか?

主な発見

  • ベーシックな ViT およびハイブリッド ViT は、$L_p$-ベースの攻撃および CCP 攻撃において、ImageNet-1k で攻撃成功確率が低く、CNN よりもより高いロバストネスを示した。
  • ベーシックな ViT は、局所的空間平滑化 (SS) や JPEG 圧縮 (JPEG) など、高周波成分を低減する前処理防御に対して反応を示さなかったが、ハイブリッド ViT や CNN とは対照的であった。
  • 特に T2T-ViT や TNT を含むハイブリッド ViT モデルは、EOT フレームワーク下で、ベーシックな ViT や ResNets よりも優れたロバストネスを示した。特に SS および JPEG 前処理下で顕著であった。
  • アテンションブロックの数を増加させることで、転送攻撃に対するロバストネスは向上するが、白ボックス攻撃に対しては向上しない。
  • トークン化の強化(例:T2T-ViT や TNT を用いる)により、前処理防御下でのロバストネスは向上するが、元の敵対的例に対するロバストネスが向上するとは限らない。
  • 敵対的例の転送性は、ViT から CNN へのほうが、逆方向よりも高いことが示され、ViT がより転送性の高い攻撃を生成していることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。