[논문 리뷰] Understanding Adversarial Robustness of Vision Transformers via Cauchy Problem
이 논문은 시각 Transformer(ViT)의 강건성과 상수 문제를 통한 상미분방정식(ODE) 근사화를 통해 연결하는 새로운 이론적 프레임워크를 제안한다. 이 프레임워크는 ViT가 리프시츠 연속임을 증명하며, 첫 번째 및 마지막 레이어가 강건성에 결정적인 영향을 미친다는 것을 드러낸다. 놀랍게도, 다중 헤드 어텐션(MSA)은 약한 공격(예: FGSM)에서는 강건성을 향상시키지만, 강한 공격(예: PGD)에서는 오히려 약화시킨다.
Recent research on the robustness of deep learning has shown that Vision Transformers (ViTs) surpass the Convolutional Neural Networks (CNNs) under some perturbations, e.g., natural corruption, adversarial attacks, etc. Some papers argue that the superior robustness of ViT comes from the segmentation of its input images; others say that the Multi-head Self-Attention (MSA) is the key to preserving the robustness. In this paper, we aim to introduce a principled and unified theoretical framework to investigate such an argument on ViT's robustness. We first theoretically prove that, unlike Transformers in Natural Language Processing, ViTs are Lipschitz continuous. Then we theoretically analyze the adversarial robustness of ViTs from the perspective of the Cauchy Problem, via which we can quantify how the robustness propagates through layers. We demonstrate that the first and last layers are the critical factors to affect the robustness of ViTs. Furthermore, based on our theory, we empirically show that unlike the claims from existing research, MSA only contributes to the adversarial robustness of ViTs under weak adversarial attacks, e.g., FGSM, and surprisingly, MSA actually comprises the model's adversarial robustness under stronger attacks, e.g., PGD attacks.
연구 동기 및 목표
- 시각 Transformer(ViT)의 적대적 강건성 분석을 위한 원리적이고 통합된 이론적 프레임워크를 구축함으로써, 경험적 관찰을 넘어서는 데 목적이 있다.
- 다중 헤드 어텐션(MSA)이 ViT 강건성에서 수행하는 역할을 조사하여, MSA가 본질적으로 강건성을 향상시킨다는 일반적인 주장에 도전하는 데 목적이 있다.
- 상수 문제 설정을 통해 강건성이 ViT 레이어를 통해 어떻게 전파되는지를 정량화하는 데 목적이 있다.
- 특히 첫 번째 및 마지막 레이어와 같은 구조적 구성 요소가 ViT 강건성에 가장 크게 기여하는지 규명하는 데 목적이 있다.
제안 방법
- 모든 트랜스포머 블록이 ODE의 비선형 함수 F(x)에 해당하는 dx/dt = F(x, t)로 표현되는 ODE 시스템의 전진 오일러 근사로 ViT를 모델링한다.
- 입력 주변에서 F(x)의 일阶 테일러 전개를 활용하여 국소 강건성을 자코비안의 최대 특이값과 연결하며, 이는 상수 문제 프레임워크에서 유도된다.
- 일부 가정 하에 ViT가 리프시츠 연속임을 증명함으로써, 강건성 분석을 위한 이론적 분석의 기초를 확립한다.
- 각 블록의 자코비안 최대 특이값을 국소 강건성의 대체 측정치로 사용하여, 레이어 간 강건성 전파를 정량화한다.
- 제어된 ε 및 스텝 크기를 가진 FGSM, PGD-7, CW 공격 하에서 강건성을 실증적으로 평가하며, 모델 깊이 및 패치 크기의 영향을 ViT와 CoViT 간 비교한다.
- 계산상의 비가능성으로 인해 큰 입력에 대해 자코비안의 특이값에 상한을 둔다. 이는 주요 근사화로 간주된다.
실험 결과
연구 질문
- RQ1어떻게 원리적인 이론적 프레임워크를 사용하여 시각 Transformer의 적대적 강건성을 공식적으로 정량화할 수 있는가?
- RQ2다중 헤드 어텐션(MSA)은 공격 강도가 다양할 때 ViT 강건성에서 어떤 역할을 하는가?
- RQ3ViT 인코더의 어떤 레이어가 전체 적대적 강건성에 가장 크게 기여하는가?
- RQ4일부 이전 연구에서 제안한 바와 같이, 입력 토큰화나 패치 임베딩 메커니즘이 MSA보다 더 강건성에 기여하는가?
- RQ5강한 적대적 공격 하에서 ViT의 강건성은 CoViT와 비교해 어떻게 다른가? 이는 MSA의 방어 능력에 대해 어떤 시사점을 제공하는가?
주요 결과
- ODE 근사의 가정 하에 ViT가 이론적으로 리프시츠 연속임을 증명함으로써, 강건성 분석을 위한 엄밀한 기초를 확립하였다.
- ViT 인코더의 첫 번째 및 마지막 레이어가 적대적 강건성에 가장 중요한 영향을 미치는 구성 요소로 규명되었으며, 이는 자코비안의 최대 특이값을 제약하는 데 기여한다.
- MSA는 FGSM과 같은 약한 공격에서는 강건성을 향상시키지만, 큰 모델이라도 방어적 이득이 미미하다.
- PGD-7 및 CW와 같은 강한 공격 하에서는 MSA가 오히려 적대적 강건성을 약화시키며, 이는 이전 연구에서 MSA가 강력한 방어력을 지닌다고 주장한 바와 정반대된다.
- CoViT 모델은 강한 공격 하에서 항상 ViT를 앞서며, 특히 패치 크기가 클수록 두드러진 성능 향상을 보이며, 이는 MSA의 동적 수신장이 고강도 흐름에 대해 효과적이지 않음을 시사한다.
- 강건성 정확도는 자코비안 최대 특이값의 상한과 상관관계가 있으며, 이는 이론적 프레임워크의 예측 능력을 검증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.