Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Token Attacks on Vision Transformers

Ameya Joshi, Gauri Jagatap|arXiv (Cornell University)|Oct 8, 2021
Adversarial Robustness in Machine Learning参考文献 51被引用数 9
ひとこと要約

この論文は、特定の画像パッチを摂動することで、ビジョントランスフォーマー(ViTs)を標的とするブロックスパースでパッチベースの敵対的攻撃を提案する。その結果、ViTsはResNetsよりも顕著にこのようなトークンレベルの攻撃に対して脆弱であることが判明し、わずか1%の画素を用いるだけでロバスト精度がほぼゼロに低下する。本手法は、ViTsが現実的でスパースかつ構造的な攻撃において、ResNets や MLP-Mixer よりも劣っていることを示し、$ε$-有界攻撃下でのViTのロバスト性に関する先行研究の主張に疑問を呈する。

ABSTRACT

Vision transformers rely on a patch token based self attention mechanism, in contrast to convolutional networks. We investigate fundamental differences between these two families of models, by designing a block sparsity based adversarial token attack. We probe and analyze transformer as well as convolutional models with token attacks of varying patch sizes. We infer that transformer models are more sensitive to token attacks than convolutional models, with ResNets outperforming Transformer models by up to $\sim30\%$ in robust accuracy for single token attacks.

研究の動機と目的

  • ビジョントランスフォーマー(ViTs)および他のアーキテクチャが、トークンレベルでの標的的で構造的な摂動に対してどれほどロバストであるかを調査すること。
  • 物理的パッチ攻撃を模倣する現実的で実用的なブロックスパース攻撃を設計することで、現実世界の敵対的脅威に関する理解のギャップを埋めること。
  • 自己注意機構がスパースかつ局所的なトークン操作に対して感受性であることを示すことにより、ViTのロバスト性に関する先行研究の主張に反論すること。
  • さまざまなパッチサイズと予算を想定した条件下で、ViT、DeIT、ResNets、WideResNet、MLP-Mixer が同一のトークン攻撃条件下でどのように性能を発揮するかを比較すること。

提案手法

  • 攻撃者が勾配の大きさに基づいて非重複な画像パッチ(トークン)を摂動することで、誤分類を最大化するブロックスパースな敵対的攻撃を提案する。
  • トークン予算制約を課し、スパースな攻撃を模倣する。
  • 勾配に基づく感度マップを用いて、摂動に最も影響を与えるパッチを特定し、標的的かつ効率的な攻撃成功を実現する。
  • 固定された $ε$-有界の $Ø∞$ ノルム(画素ごと)を用いた混合ノルム設定に攻撃を拡張し、見えにくさとロバスト性を評価する。
  • 複数のアーキテクチャ(ViT、DeIT、ResNet、WideResNet、MLP-Mixer)に対して、さまざまなパッチサイズとトークン予算を想定して攻撃を適用する。
  • スパース(1×1画素)およびブロックスパース(16×16パッチ)の制約下でロバスト精度を評価し、攻撃の強度と現実性を比較する。

実験結果

リサーチクエスチョン

  • RQ1現実的で脅威モデルを想定した場合、ビジョントランスフォーマーは畳み込みネットワーク(例:ResNets)よりも構造的でパッチベースの攻撃に対して脆弱であるか?
  • RQ2ブロックスパース攻撃において、パッチサイズとトークン予算の増加に伴い、ViTs や他のアーキテクチャのロバスト性はどのように変化するか?
  • RQ3先行研究では、$ε$-有界攻撃下でViTsはResNetsよりもロバストであると主張しているが、これはトークンレベルの攻撃下でも成り立つか?
  • RQ4ViTsは小さな局所的摂動を補償できるか、その脆弱性はどのスケールで顕著に現れるか?
  • RQ5蒸留やアーキテクチャ設計(例:MLP-Mixer)は、トークンベースの攻撃下でのロバスト性にどのように影響を与えるか?

主な発見

  • 1つのトークン攻撃では、ResNets が ViTs より最大約30%高いロバスト精度を示し、ViTs が個々のトークン操作に対して顕著に感受性であることが示された。
  • わずか1%の画素(ImageNetで256画素)を摂動した場合、ViT-224のロバスト精度は16×16パッチ攻撃下で13.62%に低下するが、同じ条件下でResNet-101は49.50%を維持した。
  • パッチサイズがモデルのトークンサイズと一致する場合、ViTs と DeIT はほぼゼロのロバスト精度(例:ViT-384で4.98%)を示すが、ResNets は32.89%のロバスト精度を維持した。
  • MLP-Mixer は、より大きなパッチ攻撃下で ViT よりもロバスト性に優れており、注意機構そのものがロバスト性を保証するわけではないことが示唆された。
  • 先行研究が $ε$-有界攻撃下でViTのロバスト性を主張していたが、本研究は、現実的で構造的なトークン攻撃下ではその主張が誤解であることを明らかにした。
  • スパース攻撃(1×1画素)は、同じスパarsity予算下ではパッチ攻撃よりも強力であるが、パッチ攻撃はより実用的であり、ViTsにおけるアーキテクチャ的脆弱性をより深く露呈した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。