[논문 리뷰] An Image Patch is a Wave: Phase-Aware Vision MLP
이 논문은 이미지 토큰 간의 정보 집약을 향상시키기 위해 동적 단상 조절을 통해 각 이미지 패치를 파동으로 표현하는 새로운 비전 MLP 아키텍처인 Wave-MLP를 제안한다. 입력의 의미적 특성에 적응하는 학습 가능한 단상 항목을 도입함으로써, Wave-MLP는 동일한 FLOPs 수준에서 기존의 SOTA MLP 및 트랜스포머를 능가하는 이미지 분류, 객체 검출, 세분화 작업에서 최고 성능을 달성한다.
In the field of computer vision, recent works show that a pure MLP architecture mainly stacked by fully-connected layers can achieve competing performance with CNN and transformer. An input image of vision MLP is usually split into multiple tokens (patches), while the existing MLP models directly aggregate them with fixed weights, neglecting the varying semantic information of tokens from different images. To dynamically aggregate tokens, we propose to represent each token as a wave function with two parts, amplitude and phase. Amplitude is the original feature and the phase term is a complex value changing according to the semantic contents of input images. Introducing the phase term can dynamically modulate the relationship between tokens and fixed weights in MLP. Based on the wave-like token representation, we establish a novel Wave-MLP architecture for vision tasks. Extensive experiments demonstrate that the proposed Wave-MLP is superior to the state-of-the-art MLP architectures on various vision tasks such as image classification, object detection and semantic segmentation. The source code is available at https://github.com/huawei-noah/CV-Backbones/tree/master/wavemlp_pytorch and https://gitee.com/mindspore/models/tree/master/research/cv/wave_mlp.
연구 동기 및 목표
- 입력의 다양성에 따라 적응하지 못하는 고정된 가중치를 사용하는 비전 MLP의 토큰 혼합 방식의 한계를 해결하기 위해.
- 파동 역학에서 영감을 얻은 단상 조절을 도입하여 이미지 토큰 간의 동적 정보 집약을 향상시키기 위해.
- 다양한 비전 작업에서 기존의 MLP 및 트랜스포머 기반 모델을 능가하는 경량이고 효율적인 아키텍처를 설계하기 위해.
- 객체 검출 및 세분화와 같은 조밀한 예측 작업에서 효과적으로 MLP를 활용할 수 있도록 단상 인식 기반의 집약 방식을 제공하기 위해.
제안 방법
- 각 이미지 패치는 실수부의 진폭(원본 특징)과 단위 복소수 단상으로 구성된 복소수 파동으로 표현된다.
- 학습 가능한 단상 추정 모듈은 깊이 지향 컨벌루션 또는 채널 지향 완전 연결 레이어와 같은 단순한 연산을 사용하여 입력 의미에 기반해 각 토큰별로 동적으로 단상 값을 생성한다.
- 단상 인식 토큰 혼합 모듈(PATM)은 토큰 간 단상 차이가 상호 작용 강도를 조절하도록 가중치 집약을 계산한다.
- 단상 조절 덕분에 유사한 의미적 내용을 가진 토큰들이 집약 과정에서 상호 강화되며, 이는 특징 표현을 향상시킨다.
- 계층적 특징 학습을 위해 단상 인식 토큰 혼합 블록과 채널 혼합 MLP 블록을 번갈아가며 적용한다.
- 조밀한 예측 작업과의 호환성을 확보하기 위해 국소 윈도우 기반 집약에 국한하여, 전역 연결을 피한다.
실험 결과
연구 질문
- RQ1고정된 가중치 집약을 넘어서 동적 단상 조절이 비전 MLP의 토큰 상호작용을 향상시킬 수 있는가?
- RQ2단상 기반 조절은 이미지 분류, 객체 검출, 세분화 작업에서 성능에 어떤 영향을 미치는가?
- RQ3정확도와 효율성 측면에서 최적의 단상 추정 공식은 무엇인가?
- RQ4조밀한 예측 작업에서 국소 윈도우 기반 집약과 전역 집약 간의 성능 차이는 어떻게 되는가?
주요 결과
- Wave-MLP-S는 4.5G FLOPs로 ImageNet에서 82.6%의 top-1 정확도를 달성하여 동일한 계산량에서 Swin-T(81.3%)를 능가한다.
- 세분화 작업에서 Wave-MLP-S는 44.4%의 mIoU를 기록하여 PVT-Tiny(39.8%)를 4.6%포인트 이상 앞서며 성능을 뛰어넘었다.
- 제거 실험 결과 단상 정보를 제거하면 top-1 정확도가 78.8%로 떨어지며, 이는 단상 정보의 핵심적 역할을 입증한다.
- 채널-FC를 사용한 단상 추정 방식은 기준 모델 대비 1.8% 정확도 향상을 기록하며, 깊이 지향 컨벌루션 및 항등 프로젝션보다 뛰어난 성능을 보였다.
- 윈도우 크기 7은 전역 집약과 유사한 성능을 달성하지만, 파rameter 수를 크게 줄여 조밀한 예측 작업에서의 활용 가능성을 높였다.
- 시각화 결과 유사한 의미적 내용을 가진 토큰들(예: 집)은 더 작은 단상 차이를 보이며 상호 강화 효과가 뚜렷하게 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.