Skip to main content
QUICK REVIEW

[논문 리뷰] Reveal of Vision Transformers Robustness against Adversarial Attacks

Ahmed Aldahdooh, Wassim Hamidouche|arXiv (Cornell University)|2021. 06. 07.
Adversarial Robustness in Machine Learning참고 문헌 55인용 수 7
한 줄 요약

이 논문은 다양한 $L_p$-노름 및 색상 채널 변형(CCp) 적대적 공격에 대해 비전 트랜스포머(ViTs)와 그 변종이 얼마나 견고한지 조사하며, 이를 컨volutional 네트워크(CNNs)와 비교한다. ImageNet-1k에서의 실험을 통해 순수 및 하이브리드 ViTs가 흰 상자 및 적응형 공격 모두에서 CNNs보다 더 견고함을 발견한다. 특히 $L_p$ 기반 및 RayS 공격에서 그러한 경향이 두드러지며, 고주파 성분을 감소시키는 전처리 방어 조치에 대해 ViTs는 반응이 제한됨을 보였다.

ABSTRACT

The major part of the vanilla vision transformer (ViT) is the attention block that brings the power of mimicking the global context of the input image. For better performance, ViT needs large-scale training data. To overcome this data hunger limitation, many ViT-based networks, or hybrid-ViT, have been proposed to include local context during the training. The robustness of ViTs and its variants against adversarial attacks has not been widely investigated in the literature like CNNs. This work studies the robustness of ViT variants 1) against different Lp-based adversarial attacks in comparison with CNNs, 2) under adversarial examples (AEs) after applying preprocessing defense methods and 3) under the adaptive attacks using expectation over transformation (EOT) framework. To that end, we run a set of experiments on 1000 images from ImageNet-1k and then provide an analysis that reveals that vanilla ViT or hybrid-ViT are more robust than CNNs. For instance, we found that 1) Vanilla ViTs or hybrid-ViTs are more robust than CNNs under Lp-based attacks and under adaptive attacks. 2) Unlike hybrid-ViTs, Vanilla ViTs are not responding to preprocessing defenses that mainly reduce the high frequency components. Furthermore, feature maps, attention maps, and Grad-CAM visualization jointly with image quality measures, and perturbations' energy spectrum are provided for an insight understanding of attention-based models.

연구 동기 및 목표

  • 비전 트랜스포머(ViTs)와 그 변종이 $L_p$-노름 및 색상 채널 변형(CCP) 적대적 공격에 대해 얼마나 견고한지 평가하기.
  • 고주파 성분을 감소시키는 전처리 방어 방법을 적용했을 때 ViTs와 CNNs의 견고성 비교하기.
  • 모델 아키텍처의 깊이(어텐션 블록 수)와 토큰화 방법이 적대적 견고성에 미치는 영향 조사하기.
  • 블랙박스 및 적응형 공격 설정에서 ViT와 CNN 모델 간 적대적 예제의 이동 가능성 분석하기.

제안 방법

  • 적대적 견고성 평가를 위해 ImageNet-1k 검증 세트의 1,000개 이미지를 사용한다.
  • 적대적 예제는 $\epsilon = 4/255$ 인 PGD-$L_\infty$를 사용해 생성하며, 국소 공간 스무딩(SS), 비국소 평균(NLM), 총 변동 최소화(TVM), JPEG 압축(JPEG), 자르기 및 재스케일링(CR), 색상 채널 변형(CCP) 등의 전처리 방어 조치를 적용해 테스트한다.
  • 변환 분포 전역에서 견고한 적응형 적대적 예제를 생성하기 위해 기대치 기반 전환(EOT) 프레임워크를 적용한다.
  • 모델 동작 분석을 위해 특징 맵, 어텐션 맵, Grad-CAM 시각화 및 편열 기반 스펙트럼 분해를 사용한다.
  • 견고성은 전처리된 적대적 예제에서의 공격 성공률(ASR)과 상위-1 오차를 통해 측정한다.

실험 결과

연구 질문

  • RQ1ViT 변종은 $L_0$, $L_1$, $L_2$, $L_\infty$ 기반 공격 및 CCP 공격에 대해 CNNs보다 더 견고한가?
  • RQ2전처리된 적대적 예제 상황에서 ViT 변종은 CNNs보다 더 견고한가?
  • RQ3어 attention 블록 수를 늘리면 적대적 예제에 대한 견고성과 전처리 방어 조치에 대한 견고성이 향상되는가?
  • RQ4ViT 토큰화 방법을 개선하면 적대적 예제에 대한 견고성과 전처리 방어 조치에 대한 견고성이 향상되는가?

주요 결과

  • 순수 ViTs와 하이브리드 ViTs는 $L_p$ 기반 공격 및 CCP 공격에서 CNNs보다 더 견고하며, ImageNet-1k에서 공격 성공률이 낮게 나타난다.
  • 순수 ViTs에서는 국소 공간 스무딩(SS) 및 JPEG 압축(JPEG)과 같은 고주파 성분을 감소시키는 전처리 방어 조치에 반응하지 않지만, 하이브리드 ViTs와 CNNs와는 다르게 그러한 반응이 없다.
  • 특히 T2T-ViT와 TNT를 포함한 하이브리드 ViT 모델은 EOT 프레임워크 하에서 순수 ViTs와 ResNets보다 더 높은 견고성을 보이며, SS 및 JPEG 전처리 조건에서 특히 두드러진다.
  • 어 attention 블록 수를 늘리면 이동 공격에 대한 견고성은 향상되지만, 흰 상자 공격에는 영향을 주지 않는다.
  • 예를 들어 T2T-ViT나 TNT를 통해 ViT 토큰화를 개선하면 전처리 방어 조치에 대한 견고성은 향상되지만, 원본 적대적 예제에 대한 견고성은 반드시 향상되지는 않는다.
  • 적대적 예제의 이동 가능성은 ViT에서 CNN으로의 이동이 CNN에서 ViT로의 이동보다 더 높은 편이며, 이는 ViT가 더 이동 가능한 공격을 생성함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.