Skip to main content
QUICK REVIEW

[논문 리뷰] Backdoor Attacks on Vision Transformers

Akshayvarun Subramanya, Aniruddha Saha|arXiv (Cornell University)|2022. 06. 16.
Adversarial Robustness in Machine Learning인용 수 7
한 줄 요약

이 논문은 비전 트랜스포머(ViTs)가 BadNets 및 히든 트리거 백도어 공격와 같은 백도어 공격에 취약하다는 것을 보여주며, CNNs와의 핵심 차이점을 드러낸다: 해석 방법 중 하나인 GradRollout이 추론 중 ViTs에서 트리거를 효과적으로 국소화한다. 이에 기반해 저자들은 테스트 시점 이미지 차단 방어 기법을 제안한다. 이 기법은 주의 맵에서 고활성 영역을 마스킹하여 공격 성공률을 크게 감소시키지만, 학습 시점 정규화와 결합할 경우 깨끗한 정확도를 유지한다.

ABSTRACT

Vision Transformers (ViT) have recently demonstrated exemplary performance on a variety of vision tasks and are being used as an alternative to CNNs. Their design is based on a self-attention mechanism that processes images as a sequence of patches, which is quite different compared to CNNs. Hence it is interesting to study if ViTs are vulnerable to backdoor attacks. Backdoor attacks happen when an attacker poisons a small part of the training data for malicious purposes. The model performance is good on clean test images, but the attacker can manipulate the decision of the model by showing the trigger at test time. To the best of our knowledge, we are the first to show that ViTs are vulnerable to backdoor attacks. We also find an intriguing difference between ViTs and CNNs - interpretation algorithms effectively highlight the trigger on test images for ViTs but not for CNNs. Based on this observation, we propose a test-time image blocking defense for ViTs which reduces the attack success rate by a large margin. Code is available here: https://github.com/UCDvision/backdoor_transformer.git

연구 동기 및 목표

  • 비전 트랜스포머가 CNNs와 다른 아키텍처를 지니고 있음에도 불구하고 백도어 공격에 취약한지 조사하기 위해.
  • ViTs와 CNNs 간에 백도어 트리거를 국소화하는 데 있어 해석 방법의 효과성을 비교하기 위해.
  • 주의 맵 가이드드 이미지 차단을 기반으로 한 새로운 테스트 시점 방어 기법을 개발하기 위해.
  • 다양한 트리거 크기와 모델 아키텍처에서 방어의 강건성 평가하기 위해.
  • 깨끗한 정확도와 방어 성능 간의 트레이드오프를 탐색하고, 정확도 손실을 복구하기 위한 학습 시점 정규화를 제안하기 위해.

제안 방법

  • 저자들은 ImageNet에서 ViT 모델을 테스트하기 위해 두 가지 표준 백도어 공격 방법—BadNets와 히든 트리거 백도어 공격(HTBA)—를 적용한다.
  • 유도 기반 해석 방법인 GradRollout을 사용하여 트리거가 삽입된 테스트 이미지의 주의 히트맵을 생성하여 백도어 트리거를 국소화한다.
  • 테스트 시점 방어 기법으로, GradRollout 히트맵에서 가장 높은 활성도를 보이는 영역을 차단하여 트리거를 효과적으로 무력화한다.
  • 테스트 시점 차단으로 인한 깨끗한 정확도 저하를 완화하기 위해, 동일한 고활성 영역을 마스킹하는 방식으로 학습 시점에서 방어 기법을 데이터 증강 전략으로 적용한다.
  • 동일한 위협 모델 하에서 ViT 변종(ViT-Base, CaiT, PatchConv)과 CNNs(VGG16, ResNet18, ResNet50)를 대상으로 다수의 모델에서 평가한다.
  • 트리거 크기의 불확실성에 대비해 블로킹 영역 크기를 10x10에서 70x70까지 다양하게 설정하여 방어의 강건성 평가

실험 결과

연구 질문

  • RQ1비전 트랜스포머는 CNNs에 영향을 주는 것과 유사한 백도어 공격에 취약한가?
  • RQ2왜 GradRollout과 같은 해석 방법은 ViTs에서는 트리거를 효과적으로 국소화하지만 CNNs에서는 그렇지 않은가?
  • RQ3주의 맵 해석을 활용해 ViTs에서 백도어 공격에 효과적인 테스트 시점 방어 기법을 설계할 수 있는가?
  • RQ4트리거 크기를 알 수 없는 상황에서, 다양한 블로킹 영역 크기로 방어 성능이 어떻게 달라지는가?
  • RQ5테스트 시점 블로킹으로 인한 정확도 손실을 복구하기 위해 동일한 방어 기법을 학습 시점에 적용할 수 있는가?

주요 결과

  • ViTs는 백도어 공격에 취약하며, HTBA 및 BadNets 위협 모델 하에서 공격 성공률이 최대 98%까지 도달한다.
  • GradRollout 해석 맵은 ViTs에서 트리거를 효과적으로 강조하며, CaiT 모델의 경우 실제 트리거와의 IoU가 0.66를 기록하지만, 모든 테스트된 CNNs의 경우 0.04 이하에 머문다.
  • 테스트 시점 이미지 차단 방어 기법은 공격 성공률을 크게 감소시키며, 블로킹 크기가 트리거 크기와 일치할 경우(30x30) 가장 낮은 ASR를 기록한다.
  • 트리거 크기의 지식이 제한된 상태에서도, 모든 테스트된 블로킹 크기에서 베이스라인(방어 없음)보다 우수한 성능을 보이며 불확실성에 대한 강건성을 입증한다.
  • 테스트 시점 블로킹으로 인한 정확도 손실을 복구하기 위해 방어 기법을 학습 시점에 적용함으로써 대부분의 정확도 손실을 회복할 수 있으며, 이는 정규화 기법으로서의 효과를 입증한다.
  • 다른 설명 방법(GradCAM, Score-CAM, FullGrad)을 사용하더라도 CNNs에서는 방어 기법이 효과가 없음을 확인하여, 트리거 국소화에서 아키텍처 차이가 핵심임을 재확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.