[논문 리뷰] ResMLP: Feedforward networks for image classification with data-efficient training
ResMLP는 자기주의를 제거하고 선형 패치 상호작용을 사용하는 단순한 순전파 신경망 아키텍처로, 데이터 효율적인 훈련을 통해 ImageNet-1k에서 최고 성능을 달성한다. 오직 선형층과 GELU 활성화 함수만을 사용하여 ViT 성능을 맞추거나 초월하며, 현대적 훈련 전략이 아키텍처에 대한 사전 지식(예: 합성곱 또는 자기주의)이 없이도 MLP 전용 모델이 매우 효과적으로 작동할 수 있음을 보여준다.
We present ResMLP, an architecture built entirely upon multi-layer perceptrons for image classification. It is a simple residual network that alternates (i) a linear layer in which image patches interact, independently and identically across channels, and (ii) a two-layer feed-forward network in which channels interact independently per patch. When trained with a modern training strategy using heavy data-augmentation and optionally distillation, it attains surprisingly good accuracy/complexity trade-offs on ImageNet. We also train ResMLP models in a self-supervised setup, to further remove priors from employing a labelled dataset. Finally, by adapting our model to machine translation we achieve surprisingly good results. We share pre-trained models and our code based on the Timm library.
연구 동기 및 목표
- 자기주의나 합성곱과 같은 유도적 편향이 없는 순수 다층퍼셉트론(MLP) 아키텍처가 이미지 분류에서 뛰어난 성능을 낼 수 있는지 탐색한다.
- 무거운 데이터 증강과 지식 정복과 같은 데이터 효율적 훈련 전략이 단순한 MLP가 비전 트랜스포머 성능을 맞추거나 초월할 수 있는지 조사한다.
- 이러한 모델이 이미지 외의 분야, 특히 기계 번역과 같은 시퀀스-투-시퀀스 작업에서 일반화 가능한지 평가한다.
- 모델의 내부 표현을 분석하여 최소한의 아키텍처에서 훈련을 통해 어떤 유도적 편향이 유도되는지 이해한다.
제안 방법
- ResMLP는 비중첩 이미지 패치를 선형 투영을 통해 d차원 임베딩으로 처리한다.
- 네트워크는 두 가지 잔차 블록을 번갈아가며 적용한다: (1) 공유 가중치를 사용해 패치 간 상호작용을 허용하는 패치 간 선형층, (2) 각 패치 내에서 채널별 상호작용을 가능하게 하는 이중층 피드포워드 네트워크.
- 각 블록은 ResNet과 DeiT와 유사하게 잔차 연결과 사전 정규화를 사용하지만 배치 정규화나 레이어 정규화를 생략한다.
- 최종 패치 표현은 평균화되고 선형 분류기로 전달되어 이미지 수준의 예측을 수행한다.
- 모델는 데이터 증강과 선택적 교사 모델로부터의 지식 정복을 포함한 교차 엔트로피 손실을 사용해 훈련된다.
- 기계 번역을 위해 적응된 시퀀스-투-시퀀스 버전의 ResMLP는 인코더와 디코더 간의 교차 어텐션을 유지하면서 트랜스포머 레이어를 ResMLP 블록으로 대체한다.
실험 결과
연구 질문
- RQ1자기주의나 합성곱 유도 편향이 없는 순수 순전파 네트워크가 데이터 효율적 훈련을 통해 ImageNet-1k에서 경쟁적인 성능을 낼 수 있는가?
- RQ2동일한 현대적 훈련 제약 조건에서 최소한의 MLP 아키텍처 성능이 비전 트랜스포머와 비교해 어떻게 되는가?
- RQ3자기주도 사전 훈련 또는 지식 정복이 단순한 MLP 기반 모델의 정확도를 얼마나 향상시킬 수 있는가?
- RQ4ResMLP 기반 아키텍처는 기계 번역과 같은 시퀀스-투-시퀀스 작업과 같은 다른 도메인으로 일반화될 수 있는가?
- RQ5최소한의 MLP 아키텍처에서 학습된 필터에서 어떤 종류의 유도적 편향이 유도되며, 이는 합성곱이나 자기주의와 어떻게 비교되는가?
주요 결과
- ResMLP는 오직 선형층과 피드포워드 네트워크로 구성된 단순한 아키텍처를 기반으로 하여 동일한 훈련 제약 조건에서 ImageNet-1k에서 최고 성능을 기록하며, ViT를 능가하거나 맞추는 성능을 보였다.
- 동일한 데이터 증강 및 정복 전략을 사용할 때 비전 트랜스포머보다 더 안정적으로 훈련되며, 배치 정규화나 레이어 정규화를 생략할 수 있었다.
- 선형층의 시각화 결과는 초기 레이어에서 합성곱과 유사한 필터 패턴과 깊이가 깊어질수록 장거리 상호작용을 보여주는 패턴을 발견하여, 임의의 공간적 유도적 편향이 유도된다는 것을 시사한다.
- ResMLP는 지식 정복에서 크게 이점을 얻었으며, 레이블이 제한된 데이터로도 높은 정확도를 달성했다.
- DINO와 같은 자기주도 사전 훈련 방법과도 호환되어 레이블이 전혀 없는 상태에서도 강력한 성능을 발휘할 수 있었다.
- 시퀀스-투-시퀀스 버전의 ResMLP는 WMT 기계 번역 벤치마크에서 경쟁적인 성능을 기록하여 컴퓨터 비전 외부로의 전이 가능성도 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.