[논문 리뷰] Exploring Corruption Robustness: Inductive Biases in Vision Transformers and MLP-Mixers
이 논문은 ImageNet-C와 텍스처 신호 갈등 데이터셋에서 사전 훈련된 모델을 사용하여 비전 트랜스포머, MLP-Mixer, CNN의 부패 내성과 형태 편향을 조사한다. 결과적으로 비전 트랜스포머는 부패에 더 내성적이며 CNN과 MLP-Mixer보다 더 강한 형태 편향을 보이며, 파라미터 수가 5배 적은 DeiT-tiny 모델조차도 ResNet-50를 능가한다.
Recently, vision transformers and MLP-based models have been developed in order to address some of the prevalent weaknesses in convolutional neural networks. Due to the novelty of transformers being used in this domain along with the self-attention mechanism, it remains unclear to what degree these architectures are robust to corruptions. Despite some works proposing that data augmentation remains essential for a model to be robust against corruptions, we propose to explore the impact that the architecture has on corruption robustness. We find that vision transformer architectures are inherently more robust to corruptions than the ResNet-50 and MLP-Mixers. We also find that vision transformers with 5 times fewer parameters than a ResNet-50 have more shape bias. Our code is available to reproduce.
연구 동기 및 목표
- 비전 트랜스포머, MLP-Mixer, CNN 간의 부패 내성을 평가하고 비교하기.
- 이미지 부패에 대한 내성성과 형태 편향 간의 관계를 조사하기.
- 특히 자기주의(attention) 메커니즘을 포함한 아키텍처 인덕티브 바이어스가 데이터 증강과 독립적으로 내성성에 기여하는지 확인하기.
- 더 작은 비전 트랜스포머 모델이 더 큰 CNN보다 내성성과 형태 편향 측면에서 동등하거나 뛰어나게 성능을 낼 수 있는지 평가하기.
제안 방법
- ResNet-50, 비전 트랜스포머(ViT, DeiT, Swin, CaiT), MLP-Mixer(Base, Large)의 3개 아키텍처에서 20개의 사전 훈련된 모델 평가.
- ImageNet-C에서 평균 부패 오차(mCE) 측정을 통해 부패 내성 수량화.
- 형태와 텍스처가 갈리는 텍스처 신호 갈등 데이터셋을 사용해 형태 편향 평가.
- 모델 간 형태 편향과 mCE 간 상관관계 분석을 통해 부패 내성에 영향을 주는 아키텍처적 요인 규명.
- 모델 크기(파라미터 수)가 다른 모델들을 비교해 내성성과 편향에 미치는 영향 평가.
- 정상 이미지와 부패한 이미지에서의 성능 평가를 위해 표준 ImageNet top-1 정확도와 mCE 사용.
실험 결과
연구 질문
- RQ1비전 트랜스포머는 CNN과 MLP-Mixer보다 일반적인 이미지 부패에 더 강건한가?
- RQ2다양한 아키텍처 간에 형태 편향과 부패 내성 간에 상관관계가 있는가?
- RQ3더 작은 비전 트랜스포머 모델이 더 큰 CNN보다 더 뛰어난 부패 내성과 형태 편향을 달성할 수 있는가?
- RQ4자기주의 같은 아키텍처 인덕티브 바이어스가 데이터 증강과 독립적으로 내성성에 기여하는 정도는 어느 정도인가?
- RQ5Swin, DeiT, ViT와 같은 다양한 비전 트랜스포머 변종 간 형태 편향과 mCE 측면에서의 성능 비교는 어떻게 되는가?
주요 결과
- 비전 트랜스포머는 CNN과 MLP-Mixer를 일관되게 능가하는 부패 내성 보이며, Swin-T_large 모델은 최저 mCE 34.63%를 기록했다.
- 500만 파라미터만을 가진 DeiT_tiny 비전 트랜스포머는 형태 편향 29.37%를 기록해 파라미터 수가 5배 많은 ResNet-50(26.17%)를 뛰어넘었다.
- 형태 편향과 mCE 사이에 강한 역상관관계 존재: 높은 형태 편향을 가진 모델일수록 부패에 더 강건하며, 이는 형태 편향이 내성성을 향상시킨다는 가설을 지지한다.
- MLP-Mixers는 중간 수준의 형태 편향(36.90–38.64%)을 보이며 ImageNet-C에서 CNN과 유사한 성능을 보였지만, 비전 트랜스포머만큼 내성적이지는 않았다.
- Swin-T_large 모델은 최고의 top-1 정확도(85.92%)와 최저의 mCE(34.63%)를 기록해 계층적 윈도우 기반 자기주의가 전반적인 표현력과 내성성을 향상시킨다는 것을 시사한다.
- 모델 크기(파라미터 수)와 형태 편향 또는 mCE 간에 명확한 상관관계를 발견하지 못했으며, 이는 내성성의 주요 원인이 스케일이 아니라 아키텍처 설계임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.