Skip to main content
QUICK REVIEW

[논문 리뷰] Can CNNs Be More Robust Than Transformers?

Zeyu Wang, Yutong Bai|arXiv (Cornell University)|2022. 06. 07.
Advanced Neural Network Applications인용 수 14
한 줄 요약

이 논문은 세 가지 단순한 아키텍처 수정을 통해 컨볼루션 신경망(CNNs)이 자기주도주의자 주의 메커니즘을 사용하지 않더라도 비전 트랜스포머(Vision Transformers)와 동등하거나 이를 초월하는 강건성을 달성할 수 있음을 보여준다: 입력 이미지를 패치로 분할하고, 큰 커널 크기(예: 11×11)를 사용하며, 정규화 및 활성화 레이어를 줄이는 것. 이러한 조치를 통해 유도된 Robust-ResNet은 여러 분포 외부 벤치마크에서 DeiT-S를 능가하며, ImageNet-R에서 4.0% 높은 정확도와 ImageNet-Sketch에서 3.9% 높은 정확도를 기록한다.

ABSTRACT

The recent success of Vision Transformers is shaking the long dominance of Convolutional Neural Networks (CNNs) in image recognition for a decade. Specifically, in terms of robustness on out-of-distribution samples, recent research finds that Transformers are inherently more robust than CNNs, regardless of different training setups. Moreover, it is believed that such superiority of Transformers should largely be credited to their self-attention-like architectures per se. In this paper, we question that belief by closely examining the design of Transformers. Our findings lead to three highly effective architecture designs for boosting robustness, yet simple enough to be implemented in several lines of code, namely a) patchifying input images, b) enlarging kernel size, and c) reducing activation layers and normalization layers. Bringing these components together, we are able to build pure CNN architectures without any attention-like operations that are as robust as, or even more robust than, Transformers. We hope this work can help the community better understand the design of robust neural architectures. The code is publicly available at https://github.com/UCSC-VLAA/RobustCNN.

연구 동기 및 목표

  • 자기주도주의자 주의 메커니즘이 있기 때문에 비전 트랜스포머가 CNN보다 본질적으로 더 강건하다는 일반적인 믿음을 도전하기 위해.
  • 자기주도주의자 주의와 무관하게 강건성 향상에 기여하는 트랜스포머 내 특정 아키텍처 구성 요소를 규명하기 위해.
  • 자기주도주의자 주의 메커니즘을 사용하지 않고도 트랜스포머 수준의 강건성을 달성하는 단순하고 효과적인 CNN 기반 아키텍처를 개발하기 위해.
  • 강건성 향상이 훈련 레시피나 데이터 증강 외에도 아키텍처 설계만으로도 달성될 수 있음을 입증하기 위해.

제안 방법

  • 입력 이미지를 겹치지 않는 패치로 분할하며, 더 큰 패치 크기가 강건성 향상에 기여함을 보여준다.
  • 표준 소형 커널(예: 3×3)을 대체로 큰 커널(예: 7×7 또는 11×11)으로 교체하여 전역 수용장과 강건성을 향상시킨다.
  • 정규화 레이어(예: 배치 정규화)와 활성화 함수(예: GELU)의 수를 줄여 분포 이탈을 최소화하고 일반화 성능을 향상시킨다.
  • 이 세 가지 요소를 조합하여 수정된 ResNet 아키텍처인 Robust-ResNet을 구성하여 그 상호작용의 영향을 평가한다.
  • 성능 향상의 원인이 훈련 동역학이 아니라 아키텍처에 기인한 것임을 확인하기 위해 DeiT-S를 교사 모델로 사용한 지식 증착을 실시한다.
  • 설계 원칙의 일반화 및 확장 가능성을 테스트하기 위해 아키텍처를 더 큰 모델(예: DeiT-Base 수준)으로 확장한다.

실험 결과

연구 질문

  • RQ1비전 트랜스포머에서 분포 외부 강건성 향상에 가장 기여하는 아키텍처 구성 요소는 무엇인가?
  • RQ2자기주도주의자 주의 메커니즘을 사용하지 않고도 순수한 CNN 아키텍처가 비전 트랜스포머 수준의 강건성을 달성할 수 있는가?
  • RQ3큰 커널 크기, 패치 분할, 정규화/활성화 레이어 감소 등의 강건성 향상 효과가 다양한 모델 규모와 데이터셋 간에도 유지되는가?
  • RQ4지식 증착을 통해 비전 트랜스포머의 강건성이 CNN으로 전이될 수 있는가, 아니면 강건성이 아키텍처 자체에 기인한 것인가?
  • RQ5CNN과 트랜스포머 간의 강건성 성능 격차는 아키텍처 설계 때문인가, 훈련 레시피 때문인가?

주요 결과

  • 큰 커널(11×11), 패치 분할된 입력, 정규화/활성화 레이어 감소를 적용한 Robust-ResNet은 Stylized-ImageNet에서 DeiT-S보다 2.4% 높은 정확도(16.2% 대 18.6%)를 기록한다.
  • ImageNet-R에서 Robust-ResNet은 41.9%의 정확도를 기록하여 DeiT-S의 45.9%보다 4.0% 높게 나타나 스타일 및 분포 이탈에 대한 우월한 강건성을 입증한다.
  • ImageNet-Sketch에서 Robust-ResNet은 33.0%의 정확도를 기록하여 DeiT-S의 29.1%를 3.9% 높게 기록하며, 다양한 분포 외부 벤치마크에서의 일관된 성과를 확인한다.
  • 유사한 아키텍처 개선으로 인해 정규화 레이어 수가 줄어들어 훈련 속도가 23% 향상되어 강건성 외에도 효율성 향상 효과를 보였다.
  • DeiT-S에서의 지식 증착은 표준 ResNet에선 강건성을 전이하지 못했지만, 제안된 Robust-ResNet에선 성공적으로 전이되어 강건성이 아키텍처 자체에 기인함을 확인한다.
  • DeiT-Base FLOPs 수준으로 확장했을 때, Robust-ResNet 변종(예: Robust-ResNet-Up-Inverted-DW-B)은 ImageNet-R에서 50.5%의 정확도를 기록하여 DeiT-B(44.7%)를 능가하며 설계 원칙의 확장 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.