Skip to main content
QUICK REVIEW

[論文レビュー] Backdoor Attacks on Vision Transformers

Akshayvarun Subramanya, Aniruddha Saha|arXiv (Cornell University)|Jun 16, 2022
Adversarial Robustness in Machine Learning被引用数 7
ひとこと要約

この論文は、ビジョントランスフォーマー(ViTs)がバックドア攻撃(BadNets や Hidden Trigger Backdoor Attacks)に対して脆弱であることを示しており、CNNs とは顕著な相違点を明らかにしている。具体的には、推論時における解釈手法(例:GradRollout)がViTsではバックドアのトリガーを効果的に局所化できる。この知見に基づき、本研究では注意マップの活性度が高い領域をマスクするテスト時画像ブロッキング防御を提案。この防御は、訓練時正則化と組み合わせることで、攻撃成功確率を著しく低下させつつ、クリーンな精度を維持する。

ABSTRACT

Vision Transformers (ViT) have recently demonstrated exemplary performance on a variety of vision tasks and are being used as an alternative to CNNs. Their design is based on a self-attention mechanism that processes images as a sequence of patches, which is quite different compared to CNNs. Hence it is interesting to study if ViTs are vulnerable to backdoor attacks. Backdoor attacks happen when an attacker poisons a small part of the training data for malicious purposes. The model performance is good on clean test images, but the attacker can manipulate the decision of the model by showing the trigger at test time. To the best of our knowledge, we are the first to show that ViTs are vulnerable to backdoor attacks. We also find an intriguing difference between ViTs and CNNs - interpretation algorithms effectively highlight the trigger on test images for ViTs but not for CNNs. Based on this observation, we propose a test-time image blocking defense for ViTs which reduces the attack success rate by a large margin. Code is available here: https://github.com/UCDvision/backdoor_transformer.git

研究の動機と目的

  • ビジョントランスフォーマーがCNNとは異なるアーキテクチャを持つにもかかわらず、バックドア攻撃に対して脆弱であるかどうかを調査すること。
  • ViTsとCNNsにおける解釈手法のトリガーローカライゼーション効果を比較すること。
  • 注意マップガイドドの画像ブロッキングを用いた、ViTs向けの新しいテスト時防御を開発すること。
  • トリガーサイズの不確実性を考慮した場合の防御のロバストネスを、さまざまなトリガーサイズとモデルアーキテクチャで評価すること。
  • クリーン精度と防御性能のトレードオフを検討し、精度損失の回復を目的とした訓練時正則化を提案すること。

提案手法

  • 著者らは、ImageNet上でViTモデルを微調整するために、2つの標準的なバックドア攻撃手法(BadNets および Hidden Trigger Backdoor Attacks: HTBA)を適用した。
  • トリガ付きテスト画像の注意マップを生成するために、勾配ベースの解釈手法であるGradRolloutを用い、バックドアトリガーの局所化を実施した。
  • テスト時防御として、GradRolloutの注意マップで最も高い活性度を示す領域をブロッキングすることで、トリガーを効果的に無効化する手法を提案した。
  • テスト時ブロッキングによるクリーン精度の低下を軽減するため、同じ高活性度領域をマスクするデータオーグメンテーション戦略として、訓練時にもこの防御を適用した。
  • 同じ脅威モデル下で、複数のViTバリアント(ViT-Base, CaiT, PatchConv)とCNN(VGG16, ResNet18, ResNet50)を比較評価した。
  • トリガーのサイズが不明な状況を想定し、ブロッキング領域サイズ(10x10 から 70x70)を変化させながら、防御のロバストネスを評価した。

実験結果

リサーチクエスチョン

  • RQ1ビジョントランスフォーマーは、CNNに影響を与えるのと同様のバックドア攻撃に対して脆弱であるか?
  • RQ2なぜGradRolloutのような解釈手法はViTsではトリガーを効果的に局所化できるが、CNNではできないのか?
  • RQ3注意マップの解釈を活用することで、ViTsにおけるバックドア攻撃に対する効果的なテスト時防御を設計できるか?
  • RQ4トリガーのサイズが不明な場合、ブロッキング領域サイズの変化に伴い防御の性能はどのように変化するか?
  • RQ5同じ防御機構を訓練時にも適用することで、テスト時ブロッキングによって生じたクリーン精度の損失を回復できるか?

主な発見

  • ViTsはバックドア攻撃に対して脆弱であり、HTBAおよびBadNetsの脅威モデル下で攻撃成功確率(ASR)が最大98%に達した。
  • GradRolloutによる解釈マップはViTsではトリガーを効果的に強調しており、CaiTモデルでは実際のトリガーと比較してIoUが0.66を達成した。一方、全テストCNNでは0.04未満にとどまった。
  • テスト時画像ブロッキング防御により、攻撃成功確率が著しく低下した。特にブロッキングサイズがトリガーと一致する(30x30)場合に、最小のASRが観測された。
  • トリガーのサイズが限られた情報しか得られない状況でも、全ブロッキングサイズでベースライン(防御なし)を上回る性能を示し、不確実性に対してもロバストであることが確認された。
  • 訓練時における防御の適用により、テスト時ブロッキングによって生じたクリーン精度の損失の大部分が回復された。これは、防御が正則化として有効であることを示している。
  • CNNでは、いかなる解釈手法(GradCAM, Score-CAM, FullGrad)を用いても、この防御は効果を示さず、トリガー局所化におけるアーキテクチャ的差異を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。