[논문 리뷰] Towards Robust Vision Transformer
이 논문은 표준 비전 트랜스포머(Vision Transformers, ViTs)에서 유해한 구성 요소를 식별하고 두 가지 플러그 앤 플레이 기법인 위치 인식 주의 스케일링(PAAS)과 패치 단위 증강을 도입하여 적대적 예제, 분포 이탈, 이미지 손상에 대한 모델의 강건성을 향상시키는 강건한 비전 트랜스포머(Robust Vision Transformer, RVT)와 그 향상된 버전인 RVT∗을 제안한다. RVT∗는 ImageNet-C, ImageNet-Sketch, ImageNet-R를 포함한 여러 강건성 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, ImageNet에서의 상위-1 정확도도 기록한다.
Recent advances on Vision Transformer (ViT) and its improved variants have shown that self-attention-based networks surpass traditional Convolutional Neural Networks (CNNs) in most vision tasks. However, existing ViTs focus on the standard accuracy and computation cost, lacking the investigation of the intrinsic influence on model robustness and generalization. In this work, we conduct systematic evaluation on components of ViTs in terms of their impact on robustness to adversarial examples, common corruptions and distribution shifts. We find some components can be harmful to robustness. By using and combining robust components as building blocks of ViTs, we propose Robust Vision Transformer (RVT), which is a new vision transformer and has superior performance with strong robustness. We further propose two new plug-and-play techniques called position-aware attention scaling and patch-wise augmentation to augment our RVT, which we abbreviate as RVT*. The experimental results on ImageNet and six robustness benchmarks show the advanced robustness and generalization ability of RVT compared with previous ViTs and state-of-the-art CNNs. Furthermore, RVT-S* also achieves Top-1 rank on multiple robustness leaderboards including ImageNet-C and ImageNet-Sketch. The code will be available at \url{https://github.com/alibaba/easyrobust}.
연구 동기 및 목표
- 비전 트랜스포머(ViTs)의 핵심 구성 요소가 적대적 예제, 일반적인 손상, 분포 이탈에 미치는 영향을 체계적으로 평가하는 것.
- 표준 정확도를 향상시키는 데 기여함에도 불구하고 강건성을 떨어뜨리는 기존 ViT 아키텍처의 구성 요소를 특정하는 것.
- 일반화 및 강건성을 향상시키기 위해 유일하게 강건한 구성 요소만을 사용하여 새로운 비전 트랜스포머 아키텍처인 RVT를 설계하는 것.
- 표준 정확도와 강건성을 향상시키기 위해 플러그 앤 플레이 기법인 위치 인식 주의 스케일링(PAAS)과 패치 단위 증강을 개발하는 것.
- RVT와 RVT∗를 ImageNet과 여섯 개의 강건성 벤치마크에서 검증하여 표준 정확도와 강건성 간의 우월한 트레이드오���을 입증하는 것.
제안 방법
- 표준 ViT에서 유해한 구성 요소를 강건한 대체품으로 교체하여 강건한 비전 트랜스포머(RVT)를 제안하며, 패치 임bedding, 위치 인코딩, 트랜스포머 블록, 분류 헤드에 중점을 둔다.
- 위치 인식 주의 스케일링(PAAS)을 도입하여 위치 기반 상관 강도에 기반해 주의 맵을 스케일링하는 방법을 통해 자기 주의에서 노이즈가 많은 위치 상관관계를 걸러내는 기법을 개발한다.
- 패치 시퀀스에 직접 데이터 증강(예: 랜덤 크롭, 노이즈, 플립)을 적용하는 패치 단위 증강 기법을 개발하여 훈련 다양성을 높이고 과적합을 줄인다.
- PAAS를 여러 트랜스포머 블록에 적용하며, 아블레이션 실험을 통해 5~10개 블록에 적용했을 때 최적의 성능 향상이 이루어지고 성능 향상이 포화 상태에 도달함을 확인한다.
- PAAS와 패치 단위 증강을 결합하여 어떤 ViT 백본에도 적용 가능한 플러그 앤 플레이 향상 기법인 RVT∗를 구성한다.
- 다양한 ViT 변종(예: DeiT-Ti, ConViT-Ti, PiT-Ti)에서 구성 요소 기여도를 검증하기 위해 ImageNet에서 표준 훈련 프로토콜과 아블레이션 연구를 활용한다.
실험 결과
연구 질문
- RQ1비전 트랜스포머에서 표준 정확도를 향상시키는 데 기여함에도 불구하고 강건성을 떨어뜨리는 구성 요소는 무엇인가?
- RQ2위치 인코딩과 주의 메커니즘의 선택이 적대적 예제와 분포 이탈에 대한 강건성에 미치는 영향은 어떠한가?
- RQ3표준 정확도를 훼손하지 않으면서 유일하게 강건한 구성 요소만을 사용해 비전 트랜스포머를 체계적으로 재설계할 수 있는가?
- RQ4PAAS와 패치 단위 증강과 같은 플러그 앤 플레이 기법이 다양한 ViT 아키텍처에서 표준 정확도와 강건 정확도를 얼마나 향상시킬 수 있는가?
- RQ5제안된 RVT는 ImageNet-C, ImageNet-Sketch, ImageNet-R를 포함한 여러 강건성 벤치마크에서 최신 기술 수준의 CNN 및 ViT와 비교해 어떻게 성능을 내는가?
주요 결과
- RVT-S∗는 ImageNet-Sketch에서 상위-1 정확도 46.9%와 ImageNet-R에서 35.0%를 기록하여 각각 새로운 최신 기술 수준 성능을 달성한다.
- ImageNet-C에서 RVT-S∗는 이전 최신 기술 수준(SOTA) 모델을 능가하는 상위-1 강건 정확도를 확보한다.
- PAAS와 패치 단위 증강의 조합은 다양한 ViT 아키텍처에서 평균적으로 표준 정확도를 1% 이상, 강건 정확도를 5% 이상 향상시킨다.
- PAAS를 5~10개의 트랜스포머 블록에 적용했을 때 성능 향상이 최적화되며, 더 많은 블록에 적용할수록 수익 감소 현상이 나타난다.
- 랜덤 가우시안 노이즈를 사용한 패치 단위 증강이 테스트된 증강 기법들 중에서 가장 뚜렷한 강건성 향상 효과를 보였다.
- RVT와 RVT∗는 ViT뿐 아니라 최신 기술 수준의 CNN과 비교해도 FLOPs, 표준 정확도, 강건성 간의 열등한 트레이드오프를 보이며 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.