Skip to main content
QUICK REVIEW

[논문 리뷰] BiMLP: Compact Binary Architectures for Vision Multi-Layer Perceptrons

Yixing Xu, Xinghao Chen|arXiv (Cornell University)|2022. 12. 29.
Neural Networks and Applications인용 수 5
한 줄 요약

이 논문은 시각 다층퍼셉트론(MLP)을 위한 컴act한 이진 아키텍처인 BiMLP를 제안한다. 이는 이진화된 완전연결(FC) 층의 표현 능력이 제한되어 있는 문제를 다중지점 이진 블록(MBB)과 통합된 단순 경로(Uni-shortcut) 및 재설계된 다운샘플링 레이어를 도입하여 해결한다. 이 방법은 ReActNet 대비 12.1% 적은 FLOPs를 사용하면서 ImageNet-1k에서 Top-1 정확도 70.0%의 최신 기술 수준(SOTA) 성능을 달성하였으며, 존재하는 MLP의 직접 이진화보다 뚜렷하게 뛰어난 성능을 보였다.

ABSTRACT

This paper studies the problem of designing compact binary architectures for vision multi-layer perceptrons (MLPs). We provide extensive analysis on the difficulty of binarizing vision MLPs and find that previous binarization methods perform poorly due to limited capacity of binary MLPs. In contrast with the traditional CNNs that utilizing convolutional operations with large kernel size, fully-connected (FC) layers in MLPs can be treated as convolutional layers with kernel size $1 imes1$. Thus, the representation ability of the FC layers will be limited when being binarized, and places restrictions on the capability of spatial mixing and channel mixing on the intermediate features. To this end, we propose to improve the performance of binary MLP (BiMLP) model by enriching the representation ability of binary FC layers. We design a novel binary block that contains multiple branches to merge a series of outputs from the same stage, and also a universal shortcut connection that encourages the information flow from the previous stage. The downsampling layers are also carefully designed to reduce the computational complexity while maintaining the classification performance. Experimental results on benchmark dataset ImageNet-1k demonstrate the effectiveness of the proposed BiMLP models, which achieve state-of-the-art accuracy compared to prior binary CNNs. The MindSpore code is available at \url{https://gitee.com/mindspore/models/tree/master/research/cv/BiMLP}.

연구 동기 및 목표

  • 이진화된 완전연결 층의 표현 능력이 제한되어 있어 기존 이진화 방법이 시각 MLP에서 성능이 떨어지는 문제를 해결하기 위해.
  • 계산 복잡도를 제곱적으로 증가시키지 않고도 이진 MLP의 표현 능력을 향상시키기 위해.
  • FLOPs를 줄이면서도 분류 정확도를 유지하는 효율적인 다운샘플링 메커니즘을 설계하기 위해.
  • 기존 이진 CNN과 비교해 이중 시각 모델에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 동일한 네트워크 단계에서 여러 브랜치의 출력을 융합하는 다중지점 이진 MLP 블록(MBB)을 제안하여 특징 표현 능력을 향상시킨다.
  • 다른 공간 크기의 특징 간 잔차 연결을 가능하게 하는 통합 경로(Uni-shortcut)를 도입하여 기울기 흐름과 특징 재사용을 향상시킨다.
  • 완전연결 레이어와 다중지점 풀링의 조합을 사용하여 다운샘플링 레이어를 재설계함으로써 표준 3×3 컨벌루션 대비 FLOPs를 41.1% 감소시켰다.
  • 지식 전이와 진짜 레이블에 의한 감독 간 균형을 맞추기 위해, 디스틸레이션 손실에 학습 가능한 스케일링 인자 α를 사용한다.
  • 기울기 전파를 위한 직선 추정기(STE)를 사용한 시그널 함수를 활용해 가중치와 활성화를 이진화하고, 배치 정규화와 ReLU-PReLU(RPReLU)를 결합하여 학습 안정성을 향상시킨다.

실험 결과

연구 질문

  • RQ1기존 이진화 방법이 CNN과 비교해 왜 시각 MLP에서 성능이 열 劣하는가?
  • RQ2계산 비용을 증가시키지 않고도 이진화된 완전연결 층의 표현 능력을 어떻게 향상시킬 수 있는가?
  • RQ3변동하는 크기의 특징 맵을 가진 이진 MLP에서 통합 경로 메커니즘이 특징 흐름과 성능을 어떻게 향상시킬 수 있는가?
  • RQ4재설계된 다운샘플링 레이어는 정확도를 유지하면서 이진 MLP에서 FLOPs를 얼마나 줄일 수 있는가?

주요 결과

  • 제안된 BiMLP는 ImageNet-1k에서 Top-1 정확도 70.0%를 달성하였으며, 1비트 이진화된 Wave-MLP(55.3%)와 ReActNet(68.7%)를 모두 초월하였다.
  • Uni-shortcut를 갖춘 MBB 블록은 잔차 연결이 전혀 없는 경우 대비 1.7% 향상된 Top-1 정확도를 기록하였고, 표준 단순 경로 대비 0.9% 향상되었다.
  • 제안된 다운샘플링 레이어는 FLOPs를 2.65×10⁸에서 1.56×10⁸로 감소시켜 41.1% 감소시켰고, Top-1 정확도는 단지 0.3% 하락에 그쳤다.
  • 제거 실험 결과, 배치 정규화와 RPReLU의 조합가 가장 뛰어난 성능을 보였으며, BiMLP-S 모델에서 Top-1 정확도 70.0%를 달성하였다.
  • 디스틸레이션 손실에서 하이퍼파라미터 α = 0.9가 최고의 검증 정확도를 보였으며, 지식 디스틸레이션과 감독 간 최적의 균형을 확인하였다.
  • 수정된 BiMLP 아키텍처는 원본 FP32 Wave-MLP(80.1%)와 유사한 성능을 달성하면서도 완전히 이진화된 상태를 유지하여, 직접 이진화가 아닌 아키텍처 재설계의 효과를 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.