[논문 리뷰] CUP: Cluster Pruning for Compressing Deep Neural Networks
CUP (Cluster Pruning)는 가중치 연결 특성 기반으로 필터를 군집화하여 층단위 비균일한 프루닝을 허용하는 채널 프루닝 방법으로, 단일 하이퍼파rameter $ t $ 를 통해 깊이 신경망을 압축한다. 이는 ImageNet에서 2.2× FLOPs 감소와 1% 미만의 상위 5위 정확도 하락을 달성하며 최신 기술 수준의 압축 성능을 보이며, CUP-SS는 초기 학습 중 단일 스텝 프루닝을 통해 학습 시간을 14시간 이상 단축시킨다.
We propose Cluster Pruning (CUP) for compressing and accelerating deep neural networks. Our approach prunes similar filters by clustering them based on features derived from both the incoming and outgoing weight connections. With CUP, we overcome two limitations of prior work-(1) non-uniform pruning: CUP can efficiently determine the ideal number of filters to prune in each layer of a neural network. This is in contrast to prior methods that either prune all layers uniformly or otherwise use resource-intensive methods such as manual sensitivity analysis or reinforcement learning to determine the ideal number. (2) Single-shot operation: We extend CUP to CUP-SS (for CUP single shot) whereby pruning is integrated into the initial training phase itself. This leads to large savings in training time compared to traditional pruning pipelines. Through extensive evaluation on multiple datasets (MNIST, CIFAR-10, and Imagenet) and models(VGG-16, Resnets-18/34/56) we show that CUP outperforms recent state of the art. Specifically, CUP-SS achieves 2.2x flops reduction for a Resnet-50 model trained on Imagenet while staying within 0.9% top-5 accuracy. It saves over 14 hours in training time with respect to the original Resnet-50. The code to reproduce results is available.
연구 동기 및 목표
- 각 층의 최적의 비균일성 스파arsity를 결정하는 데 어려움이 있으며, 이는 일반적으로 층별 하이퍼파rameter로는 해결하기 어려운 과제이다.
- 균일한 프루닝의 한계와 비용이 큰 민감도 분석을 해결하기 위해, 각 층에서 자동으로 비균일한 필터 프루닝을 가능하게 한다.
- 프루닝을 초기 학습 단계에 통합하여 재학습을 제거함으로써 학습 시간을 크게 단축시킨다.
- 다양한 모델과 데이터셋에서 최신 기술 수준의 압축 효율성을 달성하면서 정확도 저하를 최소화한다.
제안 방법
- 들어오는 및 나가는 가중치 연결 특성에서 유도된 특징을 사용해 각 층의 필터를 군집화하여 유사한 필터를 그룹화한다.
- 단일 하이퍼파rameter $ t $ 를 사용해 프루닝 임계값을 제어함으로써, 각 층에서 얼마나 많은 필터를 제거할지 자동으로 결정한다.
- 계층적 군집화를 적용해 필터를 그룹화하고 유사도 기반으로 전체 군집을 제거함으로써 네트워크 성능을 유지한다.
- CUP을 CUP-SS(싱글샷)으로 확장하기 위해 프루닝을 초기 학습 루프에 통합하고, 각 에포크 전에 CUP을 호출하여 모델을 점진적으로 프루닝한다.
- 하이퍼파ram터 $ k $ (기울기)와 $ b $ (오프셋)로 제어되는 선형 프루닝 스케줄을 사용해 학습 기간 동안 필터 수를 점진적으로 감소시킨다.
- 필터 유사도와 학습 진행 상황에 따라 동적으로 프루닝 강도를 조정함으로써 모델 정확도를 유지한다.
실험 결과
연구 질문
- RQ1단일 하이퍼파arameter가 높은 모델 정확도를 유지하면서 층단위 비균일 프루닝을 제어할 수 있는가?
- RQ2수동 민감도 분석과 비교해 군집 기반 프루닝이 각 층의 최적 필터 프루닝을 결정하는 데 얼마나 효과적인가?
- RQ3초기 학습 단계에 통합된 프루닝(CUP-SS)이 모델 성능을 훼손하지 않으면서 학습 시간을 얼마나 줄일 수 있는가?
- RQ4다양한 모델과 데이터셋에서 프루닝이 추론 속도 향상과 FLOPs 감소에 미치는 영향은 어떠한가?
- RQ5싱글샷 프루닝 스케줄의 하이퍼파aram터 $ k $ 와 $ b $ 는 최종 모델 정확도와 압축 효율성에 어떤 영향을 미치는가?
주요 결과
- ResNet-50을 사용한 ImageNet에서 CUP-SS는 원본 모델 대비 14시간 이상 학습 시간을 단축시켰으며, 2.2× FLOPs 감소와 함께 상위 5위 정확도가 0.88% 하락하는 데 그쳤다.
- ResNet-50을 사용한 ImageNet에서 CUP는 상위 5위 정확도를 원본 모델 대비 0.9% 이내로 유지하면서 2.2× FLOPs 감소를 달성했다.
- VGG-16을 사용한 CIFAR-10에서 CUP는 $ t = 1 $ 일 때 최대 4.6× 추론 속도 향상을 보이며 뚜렷한 효율성 향상을 입증했다.
- 수동 민감도 분석과 높은 상관관계를 보였으며, 자동으로 후행 층(예: VGG-16의 8–14층)이 전행 층보다 더 강하게 프루닝될 수 있음을 식별했다.
- 절단 분석 결과, CUP-SS에서 중간 정도의 프루닝 비율($ k \approx 0.01 $에서 $ 0.05 $)이 정확도를 가장 잘 유지하며, 과도한 프루닝과 과소 프루닝을 방지함을 확인했다.
- 단일 하이퍼파arameter를 사용해 ResNet-50에서 1.27%의 상위 1위 정확도 하락과 2.47× FLOPs 감소를 달성했으며, 이는 이전 최신 기술 수준의 방법들보다도 더 뛰어난 압축 효율성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.