Skip to main content
QUICK REVIEW

[논문 리뷰] A Battle of Network Structures: An Empirical Study of CNN, Transformer, and MLP

Yucheng Zhao, Guangting Wang|arXiv (Cornell University)|2021. 08. 30.
Advanced Neural Network Applications참고 문헌 42인용 수 57
한 줄 요약

이 논문은 이미지 분류를 위해 CNN, Transformer, MLP 아키텍처를 공정하게 비교하는 통합 SPACH 프레임워크를 제시하고, 세 가지 모두 경쟁적으로 수행할 수 있음을 발견하며, 다단계 설계와 지역적 모델링의 이점을 강조하고, 강력한 ImageNet-1K 성능을 달성하는 하이브리드 합성 컨볼루션-Transformer 모델을 제안한다.

ABSTRACT

Convolutional neural networks (CNN) are the dominant deep neural network (DNN) architecture for computer vision. Recently, Transformer and multi-layer perceptron (MLP)-based models, such as Vision Transformer and MLP-Mixer, started to lead new trends as they showed promising results in the ImageNet classification task. In this paper, we conduct empirical studies on these DNN structures and try to understand their respective pros and cons. To ensure a fair comparison, we first develop a unified framework called SPACH which adopts separate modules for spatial and channel processing. Our experiments under the SPACH framework reveal that all structures can achieve competitive performance at a moderate scale. However, they demonstrate distinctive behaviors when the network size scales up. Based on our findings, we propose two hybrid models using convolution and Transformer modules. The resulting Hybrid-MS-S+ model achieves 83.9% top-1 accuracy with 63M parameters and 12.3G FLOPS. It is already on par with the SOTA models with sophisticated designs. The code and models are publicly available at https://github.com/microsoft/SPACH.

연구 동기 및 목표

  • CNN, Transformer, and MLP 아키텍처가 비전 작업에 대한 공정하고 통합된 프레임워크에서 어떻게 수행되는지 명확히 하다.
  • 성능에 영향을 미치는 설계 선택(다단계 설계, 지역 모델링)을 아키텍처 간에 분리하여 분석한다?
  • 합성 컨볼루션과 Transformer 블록을 결합한 하이브리드 모델이 ImageNet-1K에서 단일 구조 모델을 능가할 수 있는지 탐구한다.

제안 방법

  • CNN, Transformer, MLP를 동일 설정에서 비교하기 위해 공간 혼합과 채널 혼합 블록을 포함하는 플러그-앤-플레이 프레임워크인 SPACH를 도입한다.
  • 공간 혼합을 컨볼루션, 셀프 어텐션, 또는 MLP로 구현하여 SPACH 내에서 세 가지 변형을 형성한다.
  • 고정된 학습 파이프라인(AdamW, 300 에포크, 데이터 증강)을 사용하여 ImageNet-1K에서 단일 스테이지 및 다단계 SPACH 변형을 평가한다.
  • MLP와 Transformer 블록에 경로를 우회하는 경량 3x3 깊이-방향 컨볼루션을 삽입하여 지역 모델링의 영향을 분석한다.
  • 컨볼루션 기반 백본에서 선택된 층을 Transformer 블록으로 대체하여 Hybrid-MS-S 및 Hybrid-MS-XS 모델을 제안하고, 깊은 패치 임베딩으로 강화한다.

실험 결과

연구 질문

  • RQ1통합 SPACH 프레임워크에서 CNN, Transformer, MLP 아키텍처가 정확도–지연(또는 FLOPs) 간의 trade-off를 비교적으로 제공하는가?
  • RQ2다단계 설계와 지역 모델링이 세 아키텍처 계열의 성능에 어떤 영향을 미치는가?
  • RQ3합성 컨볼루션과 Transformer 구성요소를 결합한 하이브리드 모델이 복잡한 트릭 없이 ImageNet-1K에서 최첨단과 같은 성능을 낼 수 있는가?

주요 결과

  • 세 가지 아키텍처 모두 SPACH 내에서 ImageNet-1K의 중간 규모에서 경쟁력 있는 정확도를 달성할 수 있다.
  • 다단계 설계는 CNN, Transformer, MLP에서 크기에 상관없이 단일 스테이지 대비 일관되게 더 좋은 성능을 보인다.
  • 경량 3x3 깊이 방향 컨볼루션을 통한 지역 모델링은 파라미터/ FLOP 비용을 거의 증가시키지 않으면서 Transformer 및 MLP의 성능을 크게 향상시킨다.
  • MLP 모델은 더 큰 규모에서 과적합 문제를 겪지만 다단계 설계와 가중치 공유가 이를 완화하여 Transformer/CNN 수준에 가까운 성능을 낸다.
  • 컨볼루션과 Transformer는 보완적이다: 컨볼루션은 일반화 능력이 더 좋고, Transformer는 더 높은 용량을 제공한다; 하이브리드 Conv-Transformer 모델은 elaborate tricks 없이도 강력한 결과를 달성할 수 있다.
  • Hybrid-MS-S+ (63M 파라미터, 12.3G FLOPs)는 ImageNet-1K에서 83.9% top-1를 달성하여 여러 SOTA 베이스라인을 FLOPs가 적은 수준으로 능가한다; Hybrid-MS-XS+는 28M 파라미터로 82.8%를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.