[논문 리뷰] Rethinking Token-Mixing MLP for MLP-based Vision Backbone
이 논문은 순수-MLP 비전 백본에서 표준 토큰 믹싱 MLP의 공간 불변성과 채널 특화된 대안으로, 순환 가중치 구조와 그룹 기반 채널 특화 연산을 활용한 순환 채널 특화(CCS) 토큰 믹싱 MLP를 제안한다. CCS는 최대 90%까지 파라미터를 감소시키면서도, MLP-Mixer에서 ImageNet1K top-1 정확도를 77.2%에서 79.8%로, ResMLP에서 79.8%에서 80.6%로 향상시킨다. 이는 더 적은 파라미터와 FLOPs로도 달성된다.
In the past decade, we have witnessed rapid progress in the machine vision backbone. By introducing the inductive bias from the image processing, convolution neural network (CNN) has achieved excellent performance in numerous computer vision tasks and has been established as \emph{de facto} backbone. In recent years, inspired by the great success achieved by Transformer in NLP tasks, vision Transformer models emerge. Using much less inductive bias, they have achieved promising performance in computer vision tasks compared with their CNN counterparts. More recently, researchers investigate using the pure-MLP architecture to build the vision backbone to further reduce the inductive bias, achieving good performance. The pure-MLP backbone is built upon channel-mixing MLPs to fuse the channels and token-mixing MLPs for communications between patches. In this paper, we re-think the design of the token-mixing MLP. We discover that token-mixing MLPs in existing MLP-based backbones are spatial-specific, and thus it is sensitive to spatial translation. Meanwhile, the channel-agnostic property of the existing token-mixing MLPs limits their capability in mixing tokens. To overcome those limitations, we propose an improved structure termed as Circulant Channel-Specific (CCS) token-mixing MLP, which is spatial-invariant and channel-specific. It takes fewer parameters but achieves higher classification accuracy on ImageNet1K benchmark.
연구 동기 및 목표
- 순수-MLP 비전 백본에서 기존 토큰 믹싱 MLP의 공간 민감성과 채널 무관성 문제를 해결하기 위해.
- 공간 이동에 대한 모델의 강건성을 향상시키면서 채널 특화 믹싱을 통해 특징 표현 능력을 향상시키기 위해.
- 성능을 저하시키지 않은 채 토큰 믹싱 MLP 레이어의 파라미터 수를 줄이기 위해.
- 기존의 순수 MLP 기반 모델 대비 더 적은 파라미터와 FLOPs로 ImageNet1K에서 높은 정확도를 달성하기 위해.
- 순환 구조와 그룹 기반 채널 특화 연산이 비전 트랜스포머 유사 아키텍처에서 효과적으로 기능하는지 입증하기 위해.
제안 방법
- 공간 불변성을 달성하기 위해 표준 완전 연결 레이어를 순환 가중치 행렬로 대체하는 순환 채널 특화(ССS) 토큰 믹싱 MLP를 제안한다.
- 채널을 그룹으로 나누어 각 그룹에 대해 별개의 순환 행렬을 적용함으로써 채널 특화 믹싱을 구현하여 표현 능력을 향상시킨다.
- 순환 행렬의 행렬-벡터 곱을 효율적으로 계산하기 위해 푸리에 변환(FFT)을 활용한다.
- 각 채널 그룹이 독립적으로 토큰 믹싱을 수행하는 그룹 기반 설계를 도입하여 더 rich한 패턴 인코딩을 가능하게 한다.
- MLP-Mixer와 ResMLP의 표준 토큰 믹싱 MLP를 제안된 CCS 모듈로 대체하여 성능 및 효율성 평가를 수행한다.
- 모델 용량과 파라미터 수의 균형을 조절하기 위해 하이퍼파rameter G(그룹 수)를 도입한다.
실험 결과
연구 질문
- RQ1기존 표준 토큰 믹싱 MLP의 공간 특화 설계가 공간 이동에 대한 모델 강건성에 어떤 영향을 미치는가?
- RQ2기존 토큰 믹싱 MLP의 채널 무관성 특성은 비전 백본에서 특징 표현 능력에 얼마나 큰 제한을 끼치는가?
- RQ3순환 가중치 구조는 토큰 믹싱 MLP에서 공간 불변성을 달성하면서도 파라미터 수를 줄일 수 있는가?
- RQ4채널 특화 믹싱은 순수-MLP 비전 아키텍처에서 성능 향상에 기여하는가?
- RQ5제안된 CCS 모듈은 더 적은 파라미터와 FLOPs로 기존 토큰 믹싱 MLP보다 더 높은 정확도를 달성할 수 있는가?
주요 결과
- MLP-Mixer-B/16의 기존 토큰 믹싱 MLP를 CCS로 대체하면, 파라미터 수가 57M에 불과한 상황에서 ImageNet1K의 top-1 정확도가 77.2%에서 79.8%로 향상된다.
- ResMLP-36에서 CCS 모듈을 적용하면 파라미터 수가 44M에서 43M로 감소하면서 top-1 정확도가 79.8%에서 80.6%로 상승한다.
- G=8 그룹일 경우 정확도와 파라미터 효율성 간 최적의 균형을 달성하며, top-1 정확도는 80.6%이고 파라미터 수는 43M이다.
- G를 8 이상으로 늘일 경우 정확도는 포화 상태에 도달하지만 파라미터 수는 43M에서 46M로 증가하여 수익 감소 현상이 나타난다.
- CCS는 더 적은 파라미터와 FLOPs로 S²-MLP-wide 및 S²-MLP-deep와 유사하거나 더 뛰어난 성능을 달성한다.
- 순환 구조 덕분에 FFT를 통해 효율적인 계산이 가능하지만, 패치 수가 적을 경우(예: N=196) 이점이 다소 뚜렷하지 않다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.