Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Transferable Adversarial Attacks on Vision Transformers

Zhipeng Wei, Jingjing Chen|arXiv (Cornell University)|2021. 09. 09.
Adversarial Robustness in Machine Learning인용 수 7
한 줄 요약

이 논문은 시각 Transformer(ViTs)를 위해 특별히 설계된 이중 공격 프레임워크인 Pay No Attention(PNA)와 PatchOut을 제안하여 적대적 전이성(transferability)을 향상시킨다. 주의 메커니즘을 통해 기울기를 회피하고 각 반복에서 일부 페치만 최적화함으로써, 이 방법은 최신 기술 수준의 전이성을 달성하며, 기존 기법과 조합할 경우 ViTs에서 공격 성공률를 59.15%로, 강화된 훈련된 CNNs에서 36.23%로 높인다.

ABSTRACT

Vision transformers (ViTs) have demonstrated impressive performance on a series of computer vision tasks, yet they still suffer from adversarial examples. % crafted in a similar fashion as CNNs. In this paper, we posit that adversarial attacks on transformers should be specially tailored for their architecture, jointly considering both patches and self-attention, in order to achieve high transferability. More specifically, we introduce a dual attack framework, which contains a Pay No Attention (PNA) attack and a PatchOut attack, to improve the transferability of adversarial samples across different ViTs. We show that skipping the gradients of attention during backpropagation can generate adversarial examples with high transferability. In addition, adversarial perturbations generated by optimizing randomly sampled subsets of patches at each iteration achieve higher attack success rates than attacks using all patches. We evaluate the transferability of attacks on state-of-the-art ViTs, CNNs and robustly trained CNNs. The results of these experiments demonstrate that the proposed dual attack can greatly boost transferability between ViTs and from ViTs to CNNs. In addition, the proposed method can easily be combined with existing transfer methods to boost performance. Code is available at https://github.com/zhipeng-wei/PNA-PatchOut.

연구 동기 및 목표

  • 시각 Transformer(ViTs)에 대한 적대적 공격의 전이성 제한 문제를 해결하기 위해, CNNs와의 아키텍처 차이로 인한 영향을 다루기 위해.
  • ViTs의 주의 메커니즘과 페치 수준의 특징이 적대적 전이성에 미치는 영향을 조사하기 위해.
  • 자기주의 주의와 페치 표현을 동시에 공격하여 다양한 모델 간 일반화를 향상시키기 위한 이중 공격 프레임워크를 개발하기 위해.
  • 아키텍처 인식 기반 공격가 표준 방법보다 ViTs와 CNNs, 특히 강화된 훈련된 모델에서도 우수한 성능을 보임을 검증하기 위해.

제안 방법

  • 자기주의 주의 메커니즘을 통해 기울기 역전파를 회피하기 위해 주의 가중치를 최적화 중 상수로 간주하는 Pay No Attention(PNA) 공격을 도입한다.
  • 각 반복에서 무작위로 일부 페치를 선택하여 업데이트하는 PatchOut 공격을 활용하며, 드롭아웃을 모방하여 과적합을 줄인다.
  • PNA와 PatchOut을 $L_2$ 정규화 항과 조합하여 원본 이미지에서 더 멀리 떨어진 편향을 유도하면서도 높은 공격 성공률를 유지하도록 한다.
  • 백색 상자 기반 ViT을 서rogate 모델로 사용하여, 검은 상자 기반 ViTs, 표준 CNNs, 강화된 훈련된 CNNs로 효과적으로 전이되는 적대적 예제를 생성한다.
  • $L_{\text{\infty}}$-노름 제약 조건 하에서 기울기 흐름을 수정한 BIM 공격을 적용하여 적대적 예제를 제작한다.
  • 전이성을 최적화하기 위해 $T$(각 반복당 페치 수)와 $\lambda$(손실과 정규화 간 균형)와 같은 초모수를 조정한다.

실험 결과

연구 질문

  • RQ1주의 메커니즘을 통해 기울기를 회피하면 시각 Transformer에서 적대적 전이성에 어떤 영향을 미치는가?
  • RQ2전체 이미지 최적화 대비 페치의 무작위 부분집합 최적화가 전이성 향상에 기여하는가?
  • RQ3PNA와 PatchOut의 조합이 다양한 모델 아키텍처, 특히 강화된 훈련된 CNNs에서 전이성에 미치는 통합적 영향은 무엇인가?
  • RQ4T와 $\lambda$와 같은 초모수들이 이중 공격 프레임워크의 성능에 미치는 영향은 어떠한가?
  • RQ5이 방법을 기존의 전이 공격 기법과 조합하여 성능 향상을 더욱 높일 수 있는가?

주요 결과

  • 주의 메커니즘을 통해 기울기를 회피하는 방식(PNA)은 ViT-B/16에서 블랙박스 공격 성공률를 29.92%에서 42.47%로 높여, 주의 기울기가 전이성에 악영향을 준다는 것을 입증한다.
  • 각 반복당 130개의 무작위로 선택된 페치를 사용하는 PatchOut은 전체 이미지 최적화 및 더 작은 페치 부분집합보다 최적의 성능을 기록한다.
  • PNA, PatchOut, $L_2$ 정규화의 조합은 ViTs에서 59.15%의 공격 성공률를 기록했으며, 강화된 훈련된 CNNs에서는 36.23%를 달성하여 기준 방법보다 뚜렷이 뛰어나다.
  • 제거 분석 결과 모든 구성 요소가 상호 보완적으로 기여하며, 특히 PNA가 전이성 향상에 가장 큰 기여를 한다.
  • 이 방법은 아키텍처 간 격차가 있는 환경에서도 잘 일반화되며, ViTs에서 표준 및 강화된 훈련된 CNNs로의 전이성이 뛰어나다.
  • 이 방법은 존재하는 전이 공격 기법과 원활하게 통합되며, 일관되게 성능을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.