[논문 리뷰] Hire-MLP: Vision MLP via Hierarchical Rearrangement
Hire-MLP는 계층적 재배열을 사용하여 국소적이고 전역적인 공간 정보를 모두 포착하는 시각적 MLP 아키텍처를 제안하며, 유연한 입력 해상도와 뛰어난 성능을 가능하게 한다. 내부 영역 및 영역 간 토큰 재배열을 채널 혼합 MLP와 조합함으로써 ImageNet(83.8% top-1 정확도), COCO(51.7% 박스 AP), ADE20K(49.9% mIoU)에서 최신 기술을 초월하며, 더 나은 정확도-처리량 트레이드오프를 달성한다.
Previous vision MLPs such as MLP-Mixer and ResMLP accept linearly flattened image patches as input, making them inflexible for different input sizes and hard to capture spatial information. Such approach withholds MLPs from getting comparable performance with their transformer-based counterparts and prevents them from becoming a general backbone for computer vision. This paper presents Hire-MLP, a simple yet competitive vision MLP architecture via extbf{Hi}erarchical extbf{re}arrangement, which contains two levels of rearrangements. Specifically, the inner-region rearrangement is proposed to capture local information inside a spatial region, and the cross-region rearrangement is proposed to enable information communication between different regions and capture global context by circularly shifting all tokens along spatial directions. Extensive experiments demonstrate the effectiveness of Hire-MLP as a versatile backbone for various vision tasks. In particular, Hire-MLP achieves competitive results on image classification, object detection and semantic segmentation tasks, e.g., 83.8% top-1 accuracy on ImageNet, 51.7% box AP and 44.8% mask AP on COCO val2017, and 49.9% mIoU on ADE20K, surpassing previous transformer-based and MLP-based models with better trade-off for accuracy and throughput. Code is available at https://github.com/ggjy/Hire-Wave-MLP.pytorch.
연구 동기 및 목표
- 기존의 MLP-Mixer와 같은 시각적 MLP가 선형적으로 평탄화된 패치로 인해 다양한 입력 해상도에 유연하지 못한 점을 해결하기 위해.
- 자기주의 어텐션 메커니즘에 의존하지 않고도 시각적 MLP가 국소적 인덕티브 바이어스와 전역적 맥락을 효과적으로 포착할 수 있도록 하기 위해.
- 분류, 검출, 세그멘테이션과 같은 다양한 컴퓨터 비전 작업을 위한 일반적인 목적의 효율적이고 정확한 백본을 설계하기 위해.
제안 방법
- 두 수준의 계층적 재배열 메커니즘을 도입: 국소적 특징 혼합을 위한 내부 영역 재배열과 원형 이동을 통한 영역 간 통신을 위한 영역 간 재배열.
- 재배열 이후 채널 혼합 MLP를 적용하여 채널 간 기능 상호작용을 모델링하고, 복원 레이어를 통해 공간적 구조를 유지.
- Hire-MLP 블록에서 다중 브랜치 아키텍처를 활용: 높이 및 너비 방향 처리를 위한 재배열 및 복원을 수행하는 두 브랜치와 직접 채널 혼합을 위한 하나의 브랜치.
- 정확도와 FLOPs의 균형을 맞추기 위해 채널 혼합 헤드에 두 개의 완전 연결 레이어를 사용하는 봉쇄 설계.
- 영역 기반 재배열을 통해 공간 처리를 토큰 시퀀스 길이에서 분리함으로써 다양한 입력 해상도를 지원.
- CNN과 Swin Transformer와 유사한 피라미드 특징 계층을 활용하여 다중 해상도 후행 작업을 지원.
실험 결과
연구 질문
- RQ1자기주의 어텐션 메커니즘 없이도 시각적 MLP 아키텍처가 국소적 및 전역적 공간 의존성을 효과적으로 포착할 수 있는가?
- RQ2성능을 유지하면서 다양한 입력 해상도에 대해 강건한 시각적 MLP는 어떻게 설계할 수 있는가?
- RQ3표준 MLP-Mixer나 순환 완전 연결 연산에 비해 토큰의 계층적 재배열이 특징 표현을 향상시키는가?
- RQ4순수한 MLP 기반 모델이 다양한 비전 벤치마크에서 최신 기술의 트랜스포머 모델과 경쟁 가능한 성능을 달성할 수 있는가?
- RQ5정확도, FLOPs, 추론 속도를 균형 잡기 위해 재배열 및 채널 혼합 구성 요소의 최적 설계는 무엇인가?
주요 결과
- Hire-MLP는 ImageNet-1K에서 83.8%의 top-1 정확도를 달성하여 이전의 MLP 및 트랜스포머 기반 모델을 뛰어넘으며, 더 나은 정확도-처리량 트레이드오프를 확보한다.
- COCO val2017에서 Hire-MLP 기반 RetinaNet은 51.7%의 박스 AP와 44.8%의 마스크 AP를 기록하여 유사한 FLOPs 조건에서 ResNet, PVT, CycleMLP를 모두 초월한다.
- ADE20K에서의 세그멘테이션 작업에서 Hire-MLP는 다중 해상도 테스트 조건에서 49.9%의 mIoU를 달성하여 Swin-T를 1.6 mIoU 초과하며 PVT와 CycleMLP를 모두 압도한다.
- 이동된 영역 간 통신 전략은 ShuffleNet 방식의 섞기보다 더 많은 상대적 위치 정보를 유지하여 더 뛰어난 성능을 내는 데 기여한다.
- 채널 혼합 헤드에 이중 레이어 봉쇄 설계가 정확도와 계산 비용 간 최적의 균형을 이룹니다. 두 레이어를 초과하면 수익 감소 현상이 발생한다.
- 제거 실험 결과 성능 향상 요인이 단순히 네트워크 깊이나 레이어 수 증가가 아니라 계층적 재배열에 기인한다는 것이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.