[논문 리뷰] MAFormer: A Transformer Network with Multi-scale Attention Fusion for Visual Recognition
MAFormer는 다중 해상도 주의 병합(MAF)을 갖춘 이중 스트림 트랜스포머 아키텍처를 제안하며, 창 주의를 통한 국소적인 세밀한 특징과 새로운 다운샘플링을 통한 글로벌 학습(GLD) 모듈을 통한 전반적인 거시적 특징을 동시에 학습하고, 주의 기반으로 동적으로 융합한다. 이는 이미지 분류, 객체 검출, 인스턴스 세그멘테이션에서 유사한 파라미터 수를 가진 기존 모델들인 CSWin 및 LV-ViT를 뛰어넘는 최신 기술 성능을 달성하며, ImageNet에서 Top-1 정확도 85.9%를 기록한다.
Vision Transformer and its variants have demonstrated great potential in various computer vision tasks. But conventional vision transformers often focus on global dependency at a coarse level, which suffer from a learning challenge on global relationships and fine-grained representation at a token level. In this paper, we introduce Multi-scale Attention Fusion into transformer (MAFormer), which explores local aggregation and global feature extraction in a dual-stream framework for visual recognition. We develop a simple but effective module to explore the full potential of transformers for visual representation by learning fine-grained and coarse-grained features at a token level and dynamically fusing them. Our Multi-scale Attention Fusion (MAF) block consists of: i) a local window attention branch that learns short-range interactions within windows, aggregating fine-grained local features; ii) global feature extraction through a novel Global Learning with Down-sampling (GLD) operation to efficiently capture long-range context information within the whole image; iii) a fusion module that self-explores the integration of both features via attention. Our MAFormer achieves state-of-the-art performance on common vision tasks. In particular, MAFormer-L achieves 85.9$\%$ Top-1 accuracy on ImageNet, surpassing CSWin-B and LV-ViT-L by 1.7$\%$ and 0.6$\%$ respectively. On MSCOCO, MAFormer outperforms the prior art CSWin by 1.7$\%$ mAPs on object detection and 1.4$\%$ on instance segmentation with similar-sized parameters, demonstrating the potential to be a general backbone network.
연구 동기 및 목표
- 기존의 비전 트랜스포머가 동시에 세밀한 국소적 의존성과 장거리 전반적 의존성을 포착하는 데에 한계가 있음을 해결하기 위해.
- 하이브리드 모델에서 컨볼루션과 자기주의 간의 호환성 문제와 학습 모호성을 해결하기 위해.
- 국소적 및 전반적 특징을 토큰 수준에서 효과적으로 융합할 수 있는 통합형 엔드 투 엔드 학습 가능한 프레임워크를 설계하기 위해.
- 기존의 비전 트랜스포머와 CNN보다 뛰어난 성능을 보이는 일반적인 목적의 백본을 개발하기 위해.
- 표준 자기주의의 제곱 복잡도 없이 효율적인 장거리 컨텍스트 모델링을 가능하게 하기 위해.
제안 방법
- 단일 창 주의 브랜치를 통해 단기적 특징 집약을 수행하는 두 개의 병렬 스트림을 갖춘 다중 해상도 주의 병합(MAF) 블록을 도입한다.
- 전체 입력 이미지에서 다운샘플링과 자기주의를 통해 장거리 컨텍스트를 캡처하는 다운샘플링을 통한 글로벌 학습(GLD) 모듈을 제안한다.
- 글로벌 스트림에서 토큰 수준의 공간적 위치 정보를 인코딩하기 위해 위치 임베딩을 사용한다.
- 양쪽 표현의 상호 적응적 학습을 가능하게 하는 학습 가능한 주의 기반 융합 모듈을 통해 국소적 및 전반적 특징을 융합한다.
- MAF 블록을 초기 레이어에서 사용하고, 더 깊은 레이어에서는 표준 주의를 사용하는 이중 스트림 아키텍처를 채택한다.
- 추가 모듈이나 복잡한 연산 없이도 주의 기반 융합을 통해 특징 통합을 수행하는 단순하고 파라미터 효율적인 설계를 사용한다.

실험 결과
연구 질문
- RQ1이중 스트림 트랜스포머 아키텍처는 토큰 수준에서 국소적 및 전반적 표현을 효과적으로 학습하고 융합하여 시각 인식 성능을 향상시킬 수 있는가?
- RQ2제안된 다운샘플링을 통한 글로벌 학습(GLD) 모듈은 계산 효율성을 유지하면서도 효율적인 장거리 컨텍스트 모델링을 가능하게 하는가?
- RQ3다중 해상도 주의 병합(MAF) 메커니즘은 표준 자기주의나 후기 융합 전략에 비해 특징 표현을 어떻게 향상시키는가?
- RQ4MAFormer은 객체 검출 및 인스턴스 세그멘테이션과 같은 밀집 예측 작업에서 기존의 비전 트랜스포머와 CNN보다 얼마나 뛰어나게 성능을 냈는가?
- RQ5MAFormer는 시각 작업에서 자기지도 학습을 위한 강력한 일반 목적의 백본으로 활용될 수 있는가?
주요 결과
- MAFormer-L은 ImageNet에서 85.9%의 Top-1 정확도를 기록하여 CSWin-B를 1.7% 뛰어나고, LV-ViT-L을 0.6% 뛰어나다.
- MSCOCO 객체 검출에서 MAFormer-B는 49.6%의 박스 mAP를 기록하여 유사한 파라미터 수로 CSWin을 1.7% 뛰어나다.
- MSCOCO 인스턴스 세그멘테이션에서 MAFormer-B는 49.6%의 마스크 mAP를 기록하여 동일한 설정에서 CSWin을 1.4% 뛰어나다.
- UPerNet를 사용한 ADE20K 세그멘테이션에서 MAFormer-B는 51.1%의 mIoU와 51.6%의 MS mIoU를 기록하여 Swin-Base를 각각 3.0점과 2.5점 뛰어나다.
- Semantic FPN를 사용한 ADE20K에서 MAFormer-S는 47.9%의 mIoU를 기록하여 Swin-T보다 6.4% 높다.
- 1x 학습 스케줄조차도 모든 벤치마크에서 기존 최신 기술 모델들을 일관되게 뛰어넘으며, 강력한 일반화 및 확장성 잠재력을 입증한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.