Skip to main content
QUICK REVIEW

[論文レビュー] Are Vision Transformers Robust to Patch Perturbations?

Jindong Gu, Volker Tresp|arXiv (Cornell University)|Nov 20, 2021
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

本稿では、ビジョントランスフォーマー(ViT)のパッチ単位の摂動に対するロバストネスを調査し、自然な劣化に対してはよりロバストである一方で、ResNetと比較して顕著に adversarial パッチに対して脆弱であることが明らかになった。著者らは、自己注意機構が自然な劣化を無視できる一方で、adversarial パッチによって簡単にだまされてしまうことに起因すると考察し、温度スケーリングを用いた Smoothed Attention を提案することで、注目が単一のパッチに集中するのを防ぎ、ロバストネスを向上させた。

ABSTRACT

Recent advances in Vision Transformer (ViT) have demonstrated its impressive performance in image classification, which makes it a promising alternative to Convolutional Neural Network (CNN). Unlike CNNs, ViT represents an input image as a sequence of image patches. The patch-based input image representation makes the following question interesting: How does ViT perform when individual input image patches are perturbed with natural corruptions or adversarial perturbations, compared to CNNs? In this work, we study the robustness of ViT to patch-wise perturbations. Surprisingly, we find that ViTs are more robust to naturally corrupted patches than CNNs, whereas they are more vulnerable to adversarial patches. Furthermore, we discover that the attention mechanism greatly affects the robustness of vision transformers. Specifically, the attention module can help improve the robustness of ViT by effectively ignoring natural corrupted patches. However, when ViTs are attacked by an adversary, the attention mechanism can be easily fooled to focus more on the adversarially perturbed patches and cause a mistake. Based on our analysis, we propose a simple temperature-scaling based method to improve the robustness of ViT against adversarial patches. Extensive qualitative and quantitative experiments are performed to support our findings, understanding, and improvement of ViT robustness to patch-wise perturbations across a set of transformer-based architectures.

研究の動機と目的

  • ビジョントランスフォーマー(ViT)と畳み込みニューラルネットワーク(CNNs)の間で、パッチ単位の摂動に対する性能を比較して調査すること。
  • 自己注意機構がViTの自然およびadversarialパッチ劣化に対するロバストネスに果たす役割を理解すること。
  • 注意行動の洞察に基づいて、ViTのadversarialパッチ攻撃に対するロバストネスを向上させる手法を開発すること。
  • さまざまなパッチ攻撃設定下での、さまざまなViTバリアント、CNNs、ハイブリッドアーキテクチャのロバストネスを比較すること。

提案手法

  • 標準ベンチマークを用いて、ViTとResNetのパッチ単位の自然劣化およびadversarial摂動下での公平な比較を実施する。
  • ロールアウト注意を用いて注意マップを可視化し、異なる摂動タイプ下でのViTのパッチへの注目具合を分析する。
  • 自己注意機構のソフトマックスに温度スケーリングを適用することで、注意重みをより均等に分散させる、Smoothed Attentionを提案する。
  • 温度スケーリングを適用して、以降のレイヤーでの注目計算において、特定の1つのパッチが優位に注目されることを防ぐ。
  • DeiT、Swin Transformers、LeViT、MLP-Mixerを含む複数のアーキテクチャを、さまざまな攻撃設定下で評価する。
  • 知覚不能な攻撃、標的攻撃、およびViTに特化しない攻撃設定下で、手法の汎化性とロバストネス向上を検証する。

実験結果

リサーチクエスチョン

  • RQ1ViTのパッチ単位の自然劣化に対するロバストネスは、ResNetと比べてどうか?
  • RQ2自然劣化に対してはロバストであるにもかかわらず、なぜViTはadversarialパッチ攻撃に対してより脆弱なのか?
  • RQ3自己注意機構は、パッチ摂動下でのViTのロバストネスまたは脆弱性に、どの程度寄与しているのか?
  • RQ4注意メカニズムにおける温度スケーリングは、adversarialパッチ攻撃に対するViTのロバストネスを効果的に向上させることができるのか?
  • RQ5Swin や MLP-Mixer などの異なるViTバリアントのアーキテクチャ設計は、パッチ攻撃に対するロバストネスにどのように影響するか?

主な発見

  • ViTは自然に劣化したパッチに対してResNetよりもよりロバストであり、注意機構が劣化領域を効果的に無視している。
  • ViTはResNetと比較して顕著にadversarialパッチ攻撃に対して脆弱であり、標準的なパッチ攻撃下でDeiT-smallでは61.5%のだまし率を示した。
  • ViTの自己注意機構は、adversarialパッチに注目を向けさせやすく、注意マップの可視化から誤分類を引き起こすことが示された。
  • 温度スケーリングを用いたSmoothed Attentionは、adversarialパッチに対するViTのロバストネスを向上させ、DeiTおよびLeViTでは顕著な向上が得られたが、階層的設計を持つSwin Transformersでは最小限の向上にとどまった。
  • 知覚不能なパッチ攻撃(8/225の制限下)では、DeiT-tinyの脆弱性(11.2%のだまし率)はResNet18(2.9%)よりも顕著に高い。
  • DeiT-tinyをだますために必要な最小イテレーション数(65)は、ResNet18(342)と比べて顕著に低いことから、ViTでは攻撃がはるかに速く成功することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。