[논문 리뷰] Mixing and Shifting: Exploiting Global and Local Dependencies in Vision MLPs
이 논문은 공간 이동을 통해 수신 영역 크기를 동적으로 증가시켜 국소적이고 전역적 종속성을 동시에 모델링하는 비전 MLP 아키텍처인 Mix-Shift-MLP(MS-MLP)를 제안한다. 이는 세밀한 영역과 거친 영역 간의 효율적 토큰 혼합을 가능하게 한다. MS-MLP는 85M 파라미터로 ImageNet-1K에서 83.8%의 top-1 정확도를 달성하며, 객체 검출 및 세분화 작업에서 Swin 및 Focal Transformers보다 0.5–0.7% 향상된다.
Token-mixing multi-layer perceptron (MLP) models have shown competitive performance in computer vision tasks with a simple architecture and relatively small computational cost. Their success in maintaining computation efficiency is mainly attributed to avoiding the use of self-attention that is often computationally heavy, yet this is at the expense of not being able to mix tokens both globally and locally. In this paper, to exploit both global and local dependencies without self-attention, we present Mix-Shift-MLP (MS-MLP) which makes the size of the local receptive field used for mixing increase with respect to the amount of spatial shifting. In addition to conventional mixing and shifting techniques, MS-MLP mixes both neighboring and distant tokens from fine- to coarse-grained levels and then gathers them via a shifting operation. This directly contributes to the interactions between global and local tokens. Being simple to implement, MS-MLP achieves competitive performance in multiple vision benchmarks. For example, an MS-MLP with 85 million parameters achieves 83.8% top-1 classification accuracy on ImageNet-1K. Moreover, by combining MS-MLP with state-of-the-art Vision Transformers such as the Swin Transformer, we show MS-MLP achieves further improvements on three different model scales, e.g., by 0.5% on ImageNet-1K classification with Swin-B. The code is available at: https://github.com/JegZheng/MS-MLP.
연구 동기 및 목표
- 기존의 자기주의 주의를 사용하지 않는 MLP 기반 모델이 동시에 국소적 및 전역적 시각 종속성을 포착하는 데에 한계가 있다는 문제를 해결하기 위해.
- 비전 MLP에서 다각도의 토큰 혼합을 가능하게 하는 단순하면서도 효과적인 메커니즘을 설계하기 위해.
- 낮은 계산 비용을 유지하면서 ImageNet-1K, COCO, ADE20K와 같은 비전 벤치마크에서 성능을 향상시키기 위해.
- MS-MLP가 최신 비전 트랜스포머의 강력한 백본 또는 모듈로 기능할 수 있음을 보여주기 위해.
제안 방법
- MS-MLP는 토큰 혼합을 위한 수신 영역 크기가 쿼리 토큰에서 상대적인 공간 거리에 따라 증가하는 다중 척도 영역 혼합 메커니즘을 도입한다.
- 공간 이동을 적용하여 근처 및 먼 영역의 정보를 집계함으로써 국소적 및 전역적 특징 간의 상호작용을 가능하게 한다.
- 특징 맵을 재구성하여 다양한 척도 간의 영역 간 통신을 허용하는 학습 가능한 이동 연산을 사용한다.
- 표준 MLP 블록에 영역 혼합을 통합함으로써 단순성과 계산 효율성을 유지한다.
- 다양한 군집도에서 종속성을 점진적으로 포착하기 위해 여러 단계로 구성된 계층적 설계를 사용한다.
- 표준 비전 벤치마크에서 표준 최적화 프rotocol을 사용해 엔드 투 엔드로 모델을 훈련시킨다.
실험 결과
연구 질문
- RQ1자기주의 주의 없이도 MLP 아키텍처가 동시에 국소적 및 전역적 시각 종속성을 효과적으로 모델링할 수 있는가?
- RQ2공간 거리에 따라 수신 영역 크기를 동적으로 조정하면 비전 작업 성능에 어떤 영향을 미치는가?
- RQ3이동을 통한 영역 혼합이 순수하게 국소적 또는 전역적 혼합보다 비전 MLP에서 더 우수한 성능을 내는가?
- RQ4MS-MLP를 백본 또는 모듈로 사용할 경우 기존의 비전 트랜스포머 성능을 어느 정도 향상시킬 수 있는가?
- RQ5제안된 방법은 대규모 비전 벤치마크에서 경쟁적인 정확도를 달성하면서도 높은 처리량을 유지하는가?
주요 결과
- 8500만 파라미터를 가진 MS-MLP는 ImageNet-1K에서 83.8%의 top-1 정확도를 달성하며, 더 높은 처리량을 보이는 Focal-Attention-B와 동일한 성능을 기록한다.
- RetinaNet 객체 검출에서 MS-MLP는 최신의 MLP인 Hire-MLP-L과 WaveMLP-B보다 각각 0.6% 및 1.5% 높은 성능을 기록한다.
- Swin 트랜스포머와 결합했을 때, MS-MLP는 여러 척도에서 분류 정확도를 0.5–0.7% 향상시키고, 객체 검출 성능을 0.2–0.5% 향상시킨다.
- 절단 분석 결과, 점차 증가하는 수신 영역을 가진 영역 혼합이 고립된 국소적 또는 전역적 혼합보다 우수하며, 특히 작은 패치 크기에서 두드러진다.
- MS-MLP를 사용할 경우 다양한 패치 크기에서 우수한 성능 유지를 보이며, Swin-T에서 패치 크기가 2와 4일 때 각각 0.5% 및 0.3% 향상된다.
- MS-MLP는 인스턴스 세분화 및 세분화 작업에서 Swin 및 Focal 트랜스포머를 일관되게 향상시키며, COCO에서는 0.1–0.3%, ADE20K에서는 0.2–0.5%의 성능 향상을 기록한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.