[논문 리뷰] CycleMLP: A MLP-like Architecture for Dense Prediction
CycleMLP는 Cycle Fully-Connected Layers (Cycle FC)를 도입하여 이미지 크기에 선형 복잡도로 계층적 ML P 유사 백본을 구축하고 밀집 예측을 효과적으로 수행하며 CNN과 Transformer 대비 탐지, 분할, 분류 작업에서 경쟁력 있는 성능을 발휘합니다.
This paper presents a simple MLP-like architecture, CycleMLP, which is a versatile backbone for visual recognition and dense predictions. As compared to modern MLP architectures, e.g., MLP-Mixer, ResMLP, and gMLP, whose architectures are correlated to image size and thus are infeasible in object detection and segmentation, CycleMLP has two advantages compared to modern approaches. (1) It can cope with various image sizes. (2) It achieves linear computational complexity to image size by using local windows. In contrast, previous MLPs have $O(N^2)$ computations due to fully spatial connections. We build a family of models which surpass existing MLPs and even state-of-the-art Transformer-based models, e.g., Swin Transformer, while using fewer parameters and FLOPs. We expand the MLP-like models' applicability, making them a versatile backbone for dense prediction tasks. CycleMLP achieves competitive results on object detection, instance segmentation, and semantic segmentation. In particular, CycleMLP-Tiny outperforms Swin-Tiny by 1.3% mIoU on ADE20K dataset with fewer FLOPs. Moreover, CycleMLP also shows excellent zero-shot robustness on ImageNet-C dataset. Code is available at https://github.com/ShoufaChen/CycleMLP.
연구 동기 및 목표
- 가변 입력 스케일을 처리하는 밀집 예측 작업(탐지, 분할)을 위한 MLP-유사 백본을 동기 부여하고 가능하게 한다.
- 이전 MLP 모델의 한계인 비계층적 블록, 고정 입력 스케일, 그리고 제곱 규모의 비용을 해결한다.
- 입력 스케일 유연성과 선형 복잡도를 유지하면서 수용 영역을 확장하기 위해 Cycle FC를 제안한다.
- 인식 및 밀집 예측을 위한 계층적 아키텍처를 갖는 CycleMLP 계열 모델을 구축한다.
- 표준 벤치마크에서 CNN, Transformer 및 최첨단 MLP 대비 경쟁력 있는 성능을 시연한다.
제안 방법
- 채널 차원을 따라 샘플링하여 오프셋 delta_i(c), delta_j(c) 및 스텝 사이즈 SH, SW를 갖는 수용 영역을 생성하는 Cycle Fully-Connected Layer (Cycle FC)를 도입한다.
- Cycle FC는 이미지 크기에 비례하는 선형 파라미터 및 FLOP 복잡도를 가지며 임의의 입력 해상도를 가능하게 한다.
- 채널-MLP와 함께 LayerNorm 및 잔차 연결을 갖춘 세 개의 병렬 Cycle FC 분기(1x7, 7x1, 1x1)를 구성하는 CycleMLP 블록을 구성한다.
- 밀집 예측 작업을 지원하기 위해 점진적 토큰 감소와 채널 확장을 갖춘 네 단계의 계층적 백본을 구축한다.
- 스트라이드, 채널 차원, 깊이 및 확장 비율을 조정하여 두 개의 모델 저장소를 만든다(PVT 스타일 CycleMLP-B1..B5와 Swin 스타일 CycleMLP-T/S/B).
- 해상도 적응성을 시연하고 Cycle FC를 Channel FC 및 MHSA와 비교하며 희소성 및 수용 영역의 이점을 강조한다.
실험 결과
연구 질문
- RQ1Cycle FC가 자체 주의력 없이도 밀집 예측 작업을 위한 확장 가능하고 입력 스케일과 무관한 연산자를 제공할 수 있는가?
- RQ2Cycle FC 블록을 갖춘 계층적 CycleMLP 백본이 기존의 MLP 유사 모델을 능가하고 탐지, 분할 및 분류에서 CNN/Transformer 백본과 경쟁력 있는 성능을 발휘하는가?
- RQ3밀집 예측 작업에 일반적인 다양한 입력 해상도 및 다중 스케일 학습 전략에서 CycleMLP의 성능은 어떠한가?
주요 결과
- CycleMLP-B2는 ImageNet-1K에서 27M 파라미터와 3.9G FLOPs로 81.6% top-1 정확도를 달성하여 여러 MLP 유사 모델보다 우수하다.
- CycleMLP-B3/B4/B5 변형은 추가 데이터 없이 ImageNet-1K에서 Transformer 백본과 경쟁력 있거나 우수한 결과를 달성하며, FLOPs 및 파라미터 수가 유리하다.
- CycleMLP 기반 백본은 유사 예산에서 ResNet 및 PVT 기준선에 비해 객체 탐지 및 인스턴스 분할 지표를 개선한다.
- ADE20K의 의미 분할에서 CycleMLP-B2 및 CycleMLP-B3은 ResNet/PVT 기준선보다 더 높은 mIoU를 보이고 일부 설정에서 Swin에 접근하거나 이를 능가하며, 시각적으로 Swin보다 더 큰 유효 수용 영역을 갖는다.
- CycleMLP는 ImageNet-C의 다양한 오염 유형에서 강한 견고성을 보여주며 평균 오염 오차(mean corruption error)에서 여러 Transformer 및 다른 MLP 기반 모델을 능가한다.
- 절삭 연구는 최적 성능을 위해 세 개의 병렬 Cycle FC 분기의 필요성을 확인하고 Cycle FC가 다수의 작업에서 Channel FC 및 Spatial FC를 능가한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.