[논문 리뷰] LPRNet: Lightweight Deep Network by Low-rank Pointwise Residual Convolution
LPRNet는 저랭크 풀웨이즈 잔차(LPR) 컨볼루션을 사용하여 모델 크기와 계산 비용을 줄이는 경량 딥러닝 모듈을 제안한다. 풀웨이즈 컨볼루션을 저랭크 행렬로 분해하고 깊이분리 잔차 연결을 추가함으로써, LPRNet는 MobileNetv1에 비해 73%의 파라미터 압축과 CPU 기준 1.8배의 추론 속도 향상을 달성하면서도 이미지 분류 및 얼굴 정렬 작업에서 경쟁 가능한 정확도를 유지한다.
Deep learning has become popular in recent years primarily due to the powerful computing device such as GPUs. However, deploying these deep models to end-user devices, smart phones, or embedded systems with limited resources is challenging. To reduce the computation and memory costs, we propose a novel lightweight deep learning module by low-rank pointwise residual (LPR) convolution, called LPRNet. Essentially, LPR aims at using low-rank approximation in pointwise convolution to further reduce the module size, while keeping depthwise convolutions as the residual module to rectify the LPR module. This is critical when the low-rankness undermines the convolution process. We embody our design by replacing modules of identical input-output dimension in MobileNet and ShuffleNetv2. Experiments on visual recognition tasks including image classification and face alignment on popular benchmarks show that our LPRNet achieves competitive performance but with significant reduction of Flops and memory cost compared to the state-of-the-art deep models focusing on model compression.
연구 동기 및 목표
- 자원 제약이 있는 기기(예: 모바일 및 임베디드 시스템)에 배포하기 위해 딥 네트워크의 계산 및 메모리 비용을 줄이기 위해.
- MobileNet 및 ShuffleNetv2와 같은 깊이분리 가중치 컨볼루션 아키텍처 내에서도 풀웨이즈 컨볼루션의 높은 파라미터 수와 FLOP 수를 해결하기 위해.
- 기존 네트워크 아키텍처를 수정하지 않고도 표준 컨볼루션을 대체할 수 있는 일반적인, 아키텍처에 종속되지 않는 모듈을 개발하기 위해.
- 저랭크 근사에 의한 극단적인 압축에도 불구하고 잔차 학습을 통합하여 성능을 유지하거나 향상시키기 위해.
제안 방법
- LPRNet는 CP-분해를 사용하여 큰 풀웨이즈 컨볼루션을 두 개의 더 작은 저랭크 컨볼루션으로 분해하는 저랭크 풀웨이즈 잔차(LPR) 모듈을 도입한다.
- 이 방법은 풀웨이즈 컨볼루션의 파라미터 수를 $nm$ 에서 $ (n + m)r $ 로 줄이며, 여기서 $ r \ll \min(n, m) $ 이므로 계산 비용을 크게 낮춘다.
- 저랭크 근사로 인한 정보 손실를 보완하기 위해 깊이분리 컨볼루션을 통한 잔차 연결을 구현하며, 추가 파라미터 없이도 구현된다.
- LPR 모듈은 아키텍처 변경 없이 MobileNet 및 ShuffleNetv2 아키텍처에 통합되어 플러그 앤 플레이 배포가 가능하다.
- 모델은 $L_2$ 손실과 Adam 옵timizer를 사용하여 훈련되며 Xavier 초기화를 적용하고, 15 에포크 이후 학습률 감소를 적용한다.
- 모델 압축과 속도는 압축된 모델의 저장 크기와 함께 CPU에서 프레임 당 프레임 수(FPS)를 사용해 평가된다.
실험 결과
연구 질문
- RQ1저랭크 행렬 분해가 성능 저하 없이 딥 네트워크의 파라미터 수와 FLOPs를 줄이기 위해 모듈 수준에서 효과적으로 적용될 수 있는가?
- RQ2깊이분리 컨볼루션을 통한 잔차 연결이 풀웨이즈 컨볼루션의 저랭크 근사로 인한 성능 저하를 어떻게 완화하는가?
- RQ3LPR 모듈은 이미지 분류 및 얼굴 정렬 벤치마크에서 모델 크기와 추론 시간을 얼마나 줄일 수 있으며, 정확도를 유지할 수 있는가?
- RQ4LPR 모듈은 아키텍처 수정 없이 기존의 경량 네트워크인 MobileNet 및 ShuffleNetv2에 원활하게 통합될 수 있는가?
주요 결과
- ImageNet 데이터셋에서 LPRNet는 최첨단 압축 모델들보다 훨씬 적은 파라미터와 FLOPs를 사용하면서도 경쟁 가능한 top-1 정확도를 달성한다.
- AFLW2000-3D 얼굴 정렬 벤치마크에서 LPRNet ×0.5는 최첨단 PCD-CNN보다 5% 낮은 NME를 기록한다.
- LPRNet ×0.25는 PCD-CNN 및 MobileNetv1와 유사한 NME를 기록하지만 CPU에서 1.8배 더 빠르게 작동하며 73%의 파라미터 압축을 달성한다.
- LPRNet ×0.25는 ShuffleNetv1보다 3.4배 작고, 가장 작은 기초 딥러닝 모델보다 120배 작으며, NME도 낮다.
- CPU에서 LPRNet ×0.25는 경량 모델 중 두 번째로 빠른 속도를 기록하면서도, SDM, ERT와 같은 가장 빠른 모델들보다 정확도에서 뛰어나다.
- 모델은 다양한 얼굴 자세 각도에서 높은 성능을 유지하며, 모든 테스트 세트에서 누적 오차 분포에 일관된 향상을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.