Skip to main content
QUICK REVIEW

[논문 리뷰] Patch-Fool: Are Vision Transformers Always Robust Against Adversarial Perturbations?

Yonggan Fu, Shunyao Zhang|arXiv (Cornell University)|2022. 03. 16.
Adversarial Robustness in Machine Learning인용 수 11
한 줄 요약

이 논문은 비디오 트랜스포머(ViTs)의 자기주의 주의 메커니즘을 공격하기 위해 개별 패치 수준에서 노이즈를 최적화하는 새로운 적대적 공격 프레임워크인 Patch-Fool을 소개한다. 기존의 공격들과 달리, Patch-Fool은 주의에 기반한 패치 선택 및 손실 설계를 활용하며, ViTs가 이 공격 하에서 항상 CNN보다 덜 견고함을 드러내어 ViTs의 본질적 견고성에 대한 가정을 도전하고, 노이즈의 농도와 강도가 견고성 순위에 핵심적인 요소임을 강조한다.

ABSTRACT

Vision transformers (ViTs) have recently set off a new wave in neural architecture design thanks to their record-breaking performance in various vision tasks. In parallel, to fulfill the goal of deploying ViTs into real-world vision applications, their robustness against potential malicious attacks has gained increasing attention. In particular, recent works show that ViTs are more robust against adversarial attacks as compared with convolutional neural networks (CNNs), and conjecture that this is because ViTs focus more on capturing global interactions among different input/feature patches, leading to their improved robustness to local perturbations imposed by adversarial attacks. In this work, we ask an intriguing question: "Under what kinds of perturbations do ViTs become more vulnerable learners compared to CNNs?" Driven by this question, we first conduct a comprehensive experiment regarding the robustness of both ViTs and CNNs under various existing adversarial attacks to understand the underlying reason favoring their robustness. Based on the drawn insights, we then propose a dedicated attack framework, dubbed Patch-Fool, that fools the self-attention mechanism by attacking its basic component (i.e., a single patch) with a series of attention-aware optimization techniques. Interestingly, our Patch-Fool framework shows for the first time that ViTs are not necessarily more robust than CNNs against adversarial perturbations. In particular, we find that ViTs are more vulnerable learners compared with CNNs against our Patch-Fool attack which is consistent across extensive experiments, and the observations from Sparse/Mild Patch-Fool, two variants of Patch-Fool, indicate an intriguing insight that the perturbation density and strength on each patch seem to be the key factors that influence the robustness ranking between ViTs and CNNs.

연구 동기 및 목표

  • 비디오 트랜스포머(ViTs)가 모든 적대적 노이즈에 대해 진정으로 견고한지 조사하여, 그들의 전역 주의 메커니즘이 우월한 견고성을 보장한다는 일반적인 믿음을 도전한다.
  • ViTs가 컨volution 신경망(CNNs)보다 더 취약해지는 특정 유형의 노이즈를 특정화하며, 특히 ViTs의 기본 구성 요소인 개별 이미지 패치를 공격하는 데 초점을 맞춘다.
  • ViTs의 자기주의 주의 메커니즘을 패치 수준 최적화를 통해 악용함으로써 체계적으로 ViTs를 약화시키는 새로운 공격 프레임워크를 개발한다.
  • 노이즈의 농도와 강도가 ViTs와 CNNs 간의 견고성 순위에 어떻게 영향을 미치는지 분석하여 향후 방어 및 아키텍처 설계에 통찰을 제공한다.

제안 방법

  • ViTs의 기본 단위인 개별 패치를 공격하기 위해 패치 수준에서 노이즈를 최적화함으로써 자기주의 주의 계산을 방해하는 공격 프레임워크인 Patch-Fool을 제안한다.
  • 모델의 출력에 기여도가 높은 패치를 주의 가중치 기반으로 식별하는 주의에 기반한 패치 선택 전략을 도입한다.
  • 자기주의 주의 메커니즘에서 높은 주의를 받는 패치에 집중함으로써 모델의 예측 오차를 최대화하는 주의에 기반한 손실 함수를 설계한다.
  • $L_2$ 및 $L_∞$ 제약 조건 하에서 반복 최적화 기법을 활용하여 눈에 띄지 않지만 효과적인 노이즈를 선택된 패치에 생성한다.
  • 다양한 노이즈 설정 하에서 표준 ImageNet 벤치마크에서 여러 ViT 및 CNN 아키텍처(예: DeiT, ResNet-50)에 대해 공격을 평가한다.
  • 노이즈의 농도와 강도가 ViTs와 CNNs 간의 견고성 순위에 미치는 영향을 연구하기 위해 두 가지 변형인 Sparse Patch-Fool과 Mild Patch-Fool을 도입한다.

실험 결과

연구 질문

  • RQ1비디오 트랜스포머가 어떤 종류의 노이즈에 대해 컨volution 신경망보다 더 취약해지는가?
  • RQ2자기주의 주의 메커니즘의 특성을 악용하여 패치 수준의 공격이 ViTs의 전역 특징 표현을 효과적으로 우회할 수 있는가?
  • RQ3노이즈의 농도와 강도는 ViTs와 CNNs 간의 견고성 순위에 어떻게 영향을 미치는가?
  • RQ4자기주의 주의 메커니즘이 전역 상호작용에 의존한다는 점이 진정으로 견고성을 제공하는가, 아니면 ViTs가 국소적·고강도 패치 노이즈에 더 민감한가?
  • RQ5제안된 Patch-Fool 공격이 ViTs를 속이는데 기존의 적대적 공격보다 효과적이면서도 눈에 띄지 않게 유지할 수 있는가?

주요 결과

  • 모든 평가 설정에서 Patch-Fool 공격 하에서 ViTs는 항상 CNN보다 덜 견고하며, DeiT-S는 $L_∞$ 공격에서 4개 패치에 대해 $͑ = 128/255$일 때 견고성 정확도가 단 6.25%에 불과하다.
  • $L_∞$ 제약 조건 하에서 DeiT-S는 낮은 노이즈 강도($͑ = 8/255$)일 땐 ResNet-50보다 더 견고했으나, 높은 강도($͑ = 128/255$)일 땐 상당히 덜 견고해지며, 이는 강도에 따라 견고성 순위가 변화함을 시사한다.
  • Sparse Patch-Fool은 소수의 패치만 노이즈를 입히지만도 높은 공격 성공률를 기록하여, ViTs가 낮은 농도의 공격에도 취약함을 보여준다.
  • Mild Patch-Fool 실험 결과, $L_∞$ 제약 조건 하에서 노이즈 강도($͑$)가 $8/255$에서 $128/255$로 증가함에 따라 DeiT-S의 견고성 정확도는 67.23%에서 6.25%로 감소하는 반면, ResNet-50는 상대적으로 안정을 유지한다.
  • ViTs와 CNNs 간의 견고성 순위는 고정되어 있지 않으며, 노이즈의 농도와 강도에 따라 결정되며, 이 요소들이 증가할수록 ViTs가 더 취약해진다.
  • 심지어 적대적 훈련을 거친 ViTs와 CNNs 역시 Patch-Fool에 의해 성공적으로 속임을 입증하여, 기존의 적대적 훈련이 이 패치 수준의 취약성을 완전히 보완하지 못한다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.