[논문 리뷰] RepMLPNet: Hierarchical Vision MLP with Re-parameterized Locality
RepMLPNet은 지역성 주입이라는 재매개변수화 기법을 통해 훈련된 컨볼루션 커널을 완전히 연결된(FC) 가중치에 통합함으로써 완전히 연결된(FC) 레이어에 학습된 局소적 인덕티브 바이어스를 도입하는 새로운 계층적 비전 MLP 아키텍처를 제안한다. 이는 이미지 인식에서 뛰어난 성능을 발휘하며, 처음으로 Cityscapes 세그멘테이션 작업으로의 원활한 전이를 가능하게 하여 5×5 컨볼루션으로 대체했을 때 77.12 mIoU를 달성한다.
Compared to convolutional layers, fully-connected (FC) layers are better at modeling the long-range dependencies but worse at capturing the local patterns, hence usually less favored for image recognition. In this paper, we propose a methodology, Locality Injection, to incorporate local priors into an FC layer via merging the trained parameters of a parallel conv kernel into the FC kernel. Locality Injection can be viewed as a novel Structural Re-parameterization method since it equivalently converts the structures via transforming the parameters. Based on that, we propose a multi-layer-perceptron (MLP) block named RepMLP Block, which uses three FC layers to extract features, and a novel architecture named RepMLPNet. The hierarchical design distinguishes RepMLPNet from the other concurrently proposed vision MLPs. As it produces feature maps of different levels, it qualifies as a backbone model for downstream tasks like semantic segmentation. Our results reveal that 1) Locality Injection is a general methodology for MLP models; 2) RepMLPNet has favorable accuracy-efficiency trade-off compared to the other MLPs; 3) RepMLPNet is the first MLP that seamlessly transfer to Cityscapes semantic segmentation. The code and models are available at https://github.com/DingXiaoH/RepMLP.
연구 동기 및 목표
- 표준 MLP에서 지역성 인덕티브 바이어스의 부족으로 인해 소규모 데이터셋 및 후속 작업에서 성능이 저하되는 문제를 해결하기 위해.
- 추론 속도를 희생시키지 않고 완전히 연결된 레이어에 지역성을 도입할 수 있는 방법을 개발하기 위해.
- 세그멘테이션과 같은 밀도 예측 작업을 위한 강력한 백본이 될 수 있는 계층적 MLP 아키텍처를 설계하기 위해.
- 대규모 데이터셋이나 디스틸리케이션에 의존하지 않고도 표준 최적화 및 증강 기법을 사용하여 효율적이고 데이터 효율적인 훈련을 가능하게 하기 위해.
제안 방법
- 지역성 주입을 제안함: 훈련된 컨볼루션 커널을 FC 레이어 가중치에 통합하여 지역성 인덕티브 바이어스를 도입하는 구조적 재매개변수화 기법.
- RepMLP 블록을 도입함: 전역 퍼셉트론, 채널별 퍼셉트론, 국소 컨볼루션을 조합한 다중브랜치 모듈이며, 잔차 통합을 위해 배치 정규화를 사용함.
- 훈련 시기의 세 브랜치 구조(FC + conv + BN)를 등가 매개변수 변환을 통해 단일 세 FC 추론 구조로 재매개변수화함.
- 고해상도 작업(예: Cityscapes)을 위해 패치 기반 추론 전략을 사용함. 표준 임bedding 레이어 대신 3×3 또는 5×5 컨볼루션을 사용하여 패치 간 컨텍스트를 유지함.
- 디스틸리케이션 또는 특수 기법 없이 표준 데이터 증강 및 훈련 프로토콜을 적용함.
- 다양한 RepMLP 블록을 사용한 계층적 RepMLPNet을 설계하여 세그멘테이션 백본에 적합한 다중스케일 특징 맵을 생성함.
실험 결과
연구 질문
- RQ1추론 비용을 증가시키지 않고 완전히 연결된 레이어에 지역성 인덕티브 바이어스를 효과적으로 강화할 수 있는가?
- RQ2거대한 데이터셋이나 디스틸리케이션 없이도 시각 MLP가 소규모 데이터셋 및 후속 밀도 예측 작업에서 뛰어난 성능을 낼 수 있는가?
- RQ3완전히 연결된 레이어에 지역성을 도입하면서도 전역 모델링 능력을 유지할 수 있는 재매개변수화 기법이 존재하는가?
- RQ4MLP 기반 백본이 Cityscapes와 같은 고해상도 세그멘테이션 작업으로 성공적으로 전이될 수 있는가?
- RQ5제안된 지역성 주입 기법이 다양한 MLP 아키텍처 및 데이터셋에 일반화되는가?
주요 결과
- 지역성 주입은 CIFAR-100에서 오직 216개의 추가 매개변수로도 ResMLP의 정확도를 9.51% 향상시켜 소규모 데이터셋에서도 효과적임을 입증함.
- RepMLPNet은 표준 ImageNet 사전 훈련을 사용하여 Cityscapes 검증 세트에서 76.27 mIoU를 달성하였으며, 이는 MLP 백본이 이 작업으로 성공적으로 전이된 최초의 사례임.
- 3×3 다운샘플링 레이어를 5×5 컨볼루션으로 대체함으로써 mIoU가 77.12로 상승했고, FLOP 증가가 거의 없어 패치 간 상호작용이 향상됨을 보여줌.
- RepMLPNet-D256에서 국소 퍼셉트론을 제거하면 ImageNet에서 정확도가 2.15% 감소함으로써 도입된 지역성의 중요성을 확인함.
- 디스틸리케이션 필요 없이 낮은 훈련 비용과 함께 동시대의 다른 MLP들과 비교해 유리한 정확도-효율성 트레이드오프를 유지함.
- 계층적 설계 덕분에 다중스케일 특징 맵을 생성할 수 있어, UperNet와 같은 세그멘테이션 프레임워크의 실용적 백본으로서의 자격을 갖춤.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.