Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking the Design Principles of Robust Vision Transformer

Xiaofeng Mao, Gege Qi|arXiv (Cornell University)|2021. 05. 17.
Advanced Neural Network Applications참고 문헌 50인용 수 18
한 줄 요약

이 논문은 복잡한 분포 이탈 상황에서도 뛰어난 내성과 일반화 성능을 보이도록 설계된 새로운 비전 트랜스포머 아키텍처인 RVT(Robust Vision Transformer)를 제안한다. 복잡한 분포 이탈 상황을 고려한 설계 원칙을 재고함으로써 아키텍처 구성 요소를 재구성하고, 내성 설계 요소를 통합하며, 위치 인식 주의 재스케일링과 패치 단위 증강과 같은 즉장 적용 기법을 도입함으로써, ImageNet 및 여러 내성 기준 평가 지표에서 최고 성능을 기록한다. 특히 ImageNet-C와 ImageNet-Sketch 리더보드에서 상위-1 정확도를 확보하였다.

ABSTRACT

Recent advances on Vision Transformers (ViT) have shown that self-attention-based networks, which take advantage of long-range dependencies modeling ability, surpassed traditional convolution neural networks (CNNs) in most vision tasks. To further expand the applicability for computer vision, many improved variants are proposed to re-design the Transformer architecture by considering the superiority of CNNs, i.e., locality, translation invariance, for better performance. However, these methods only consider the standard accuracy or computation cost of the model. In this paper, we rethink the design principles of ViTs based on the robustness. We found some design components greatly harm the robustness and generalization ability of ViTs while some others are beneficial. By combining the robust design components, we propose Robust Vision Transformer (RVT). RVT is a new vision transformer, which has superior performance and strong robustness. We further propose two new plug-and-play techniques called position-aware attention rescaling and patch-wise augmentation to train our RVT. The experimental results on ImageNet and six robustness benchmarks show the advanced robustness and generalization ability of RVT compared with previous Transformers and state-of-the-art CNNs. Our RVT-S* also achieves Top-1 rank on multiple robustness leaderboards including ImageNet-C and ImageNet-Sketch. The code will be available at https://github.com/vtddggg/Robust-Vision-Transformer.

연구 동기 및 목표

  • 기존의 비전 트랜스포머 구성 요소가 표준 정확도와 계산 비용을 넘어서 분포 이탈 상황에서 모델의 내성과 일반화에 어떤 영향을 미치는지 조사하기 위해.
  • 비전 트랜스포머에서 내성을 해치거나 향상시키는 아키텍처 구성 요소를 특정하기 위해.
  • 성능을 유지하면서 내성을 최적화한 새로운 비전 트랜스포머 아키텍처인 RVT를 설계하기 위해.
  • 아키텍처 변경 없이도 내성을 향상시키는 즉장 적용 가능한 훈련 기법을 개발하기 위해.
  • RVT의 우수성을 표준 및 내성 기준 평가 지표에서 검증하기 위해, 특히 ImageNet-C와 ImageNet-Sketch를 포함하여.

제안 방법

  • 각 구성 요소가 분포 이탈 상황에서 내성에 어떤 영향을 미치는지 평가함으로써 비전 트랜스포머 설계 원칙을 재고하고, 성능 저하 또는 향상을 유도하는 요소를 식별하기 위해.
  • 내성에 유리한 구성 요소들만 조합하여 일반화와 내성을 향상시키는 RVT(Robust Vision Transformer)를 제안하기 위해.
  • 공간적 위치에 따라 주의 맵 스케일링을 적응적으로 조정함으로써 안정성을 향상시키는 즉장 적용 가능한 기법인 위치 인식 주의 재스케일링을 도입하기 위해.
  • 각 패치에 대해 무작위 증강을 적용하는 데이터 증강 전략인 패치 단위 증강을 개발하여 훈련 중 내성을 향상시키기 위해.
  • 표준 ImageNet과 내성 기준 평가 지표를 사용하여 RVT를 훈련하고, 제안된 기법들을 활용하여 분포 이탈 상황에서의 일반화 능력을 향상시키기 위해.
  • 각 구성 요소와 기법이 내성과 정확도에 기여하는 정도를 검증하기 위해 분석 실험(Ablation study)을 수행하기 위해.

실험 결과

연구 질문

  • RQ1분포 이탈 상황에서 어떤 비전 트랜스포머 구성 요소가 내성을 저하시키거나 향상시키는가?
  • RQ2성능 손실 없이 기존의 설계 원칙을 기반으로 내성을 우선시하는 비전 트랜스포머를 다시 설계할 수 있는가?
  • RQ3위치 인식 주의 재스케일링과 패치 단위 증강 기법이 훈련 중 모델의 내성을 어떻게 향상시키는가?
  • RQ4RVT는 기존의 비전 트랜스포머와 최첨단 CNN보다 얼마나 뛰어난 성능을 보일 수 있는가? 특히 내성 기준 평가 지표에서.
  • RQ5RVT는 ImageNet-C와 ImageNet-Sketch와 같은 내성 리더보드에서 최상위 성능을 달성할 수 있는가?

주요 결과

  • RVT는 ImageNet-C와 ImageNet-Sketch를 포함한 여러 내성 리더보드에서 상위-1 정확도를 확보하여 최첨단 내성 성능을 입증하였다.
  • 제안된 위치 인식 주의 재스케일링과 패치 단위 증강 기법은 아키텍처 변경 없이도 내성을 크게 향상시켰다.
  • 이전에는 유리하다고 여겨졌던 일부 ViT 구성 요소들이 내성에 악영향을 미치는 것으로 밝혀져 설계 원칙의 재고가 필요함을 시사한다.
  • RVT는 여섯 개의 내성 기준 평가 지표에서 표준 비전 트랜스포머와 최첨단 CNN을 모두 압도하여 뛰어난 일반화 능력을 입증하였다.
  • 분석 실험 결과, 유일하게 내성에 유리한 구성 요소들만 조합하는 것이 분포 이탈 상황에서 성능 향상에 크게 기여함을 확인하였으며, 이는 설계 철학의 타당성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.