[논문 리뷰] Deep Model Compression based on the Training History
이 논문은 훈련 이력을 활용하여 에포크 동안 필터의 ℓ₁-노름 유사도를 분석함으로써 부적절한 필터를 식별하고 제거하는 새로운 필터 프루닝 방법인 히스토리 기반 필터 프루닝(HBFP)을 제안한다. 프루닝 이전에 정보 손실을 최소화하도록 필터 쌍을 최적화하고 이후에 피니팅을 수행함으로써, HBFP는 LeNet-5에서 최대 97.98%의 FLOPs 감소를 달성하면서 낮은 오차율을 유지하며 최신 기술을 초월한다.
Deep Convolutional Neural Networks (DCNNs) have shown promising performances in several visual recognition problems which motivated the researchers to propose popular architectures such as LeNet, AlexNet, VGGNet, ResNet, and many more. These architectures come at a cost of high computational complexity and parameter storage. To get rid of storage and computational complexity, deep model compression methods have been evolved. We propose a "History Based Filter Pruning (HBFP)" method that utilizes network training history for filter pruning. Specifically, we prune the redundant filters by observing similar patterns in the filter's L1-norms (absolute sum of weights) over the training epochs. We iteratively prune the redundant filters of a CNN in three steps. First, we train the model and select the filter pairs with redundant filters in each pair. Next, we optimize the network to ensure an increased measure of similarity between the filters in a pair. This optimization of the network facilitates us to prune one filter from each pair based on its importance without much information loss. Finally, we retrain the network to regain the performance, which is dropped due to filter pruning. We test our approach on popular architectures such as LeNet-5 on MNIST dataset; VGG-16, ResNet-56, and ResNet-110 on CIFAR-10 dataset, and ResNet-50 on ImageNet. The proposed pruning method outperforms the state-of-the-art in terms of FLOPs reduction (floating-point operations) by 97.98%, 83.42%, 78.43%, 74.95%, and 75.45% for LeNet-5, VGG-16, ResNet-56, ResNet-110, and ResNet-50, respectively, while maintaining the less error rate.
연구 동기 및 목표
- 자원이 제한된 장치에서 딥 컨volution 네트워크의 높은 계산 비용과 저장 비용을 해결하기 위해.
- 정적 지표가 아닌 훈련 다이내믹스를 활용하여 필터 프루닝의 효율성을 향상시키기 위해.
- 제거 전에 필터 유사도를 최적화하여 프루닝 중 정보 손실를 최소화하기 위해.
- 기존 방법보다 더 높은 압축률을 달성하면서 모델 정확도를 유지하기 위해.
- ImageNet을 포함한 다양한 아키텍처와 데이터셋에서 방법의 타당성을 검증하기 위해.
제안 방법
- 훈련 에포크 동안 필터 쌍의 ℓ₁-노름 차이의 절대값 합을 측정하여 부적절한 필터 쌍을 식별한다.
- 필터 쌍의 ℓ₁-노름 차이를 최소화하는 맞춤형 정규화 항을 도입하여 재현성과 정보 손실를 감소시킨다.
- 각 부적절한 필터 쌍에서 ℓ₁-노름 크기가 작은 필터를 선택하여 제거함으로써 덜 중요한 필터를 우선시한다.
- 각 프루닝 반복 후에 네트워크를 피니팅하여 필터 제거로 인한 성능 저하를 복구한다.
- 점진적인 압축을 달성하기 위해 프로세스를 반복적으로 수행한다.
- 이 방법은 ℓ₂-노름 또는 코사인 유사도와 같은 다른 지표로도 적용 가능하다.
실험 결과
연구 질문
- RQ1훈련 이력을 효과적으로 활용하여 성능 저하 없이 부적절한 필터를 식별할 수 있는가?
- RQ2직접 프루닝하기 전에 필터 유사도를 최적화하는 것이 정보 손실를 감소시키는 데 효과적인가?
- RQ3제안된 방법이 최신 기술보다 더 높은 FLOPs 감소를 달성할 수 있는가?
- RQ4이 방법은 다양한 아키텍처와 데이터셋, 특히 대규모 ImageNet에서 어떻게 성능을 내는가?
- RQ5맞춤형 정규화 항의 사용이 프루닝 후 정확도 향상에 뚜렷한 기여를 하는가?
주요 결과
- HBFP는 LeNet-5에서 최대 97.98%의 FLOPs 감소를 달성하면서 정확도 손실를 최소화하여 이전 방법들을 능가했다.
- VGG-16에서 HBFP는 FLOPs를 83.42% 감소시키며 높은 정확도를 유지했으며, 최신 기술을 뛰어넘었다.
- CIFAR-10에서 ResNet-56과 ResNet-110에 대해 각각 78.43%와 74.95%의 FLOPs 감소를 달성했으며, 경쟁 가능한 정확도를 확보했다.
- ImageNet에서 ResNet-50를 사용한 결과, HBFP는 FLOPs를 75.45% 감소시키고 파라미터를 68.30% 줄였으며, top-1 정확도 69.17%를 달성했다.
- 제거 실험을 통해 맞춤형 정규화 항이 프루닝 중 정보 손실를 최소화함으로써 성능 향상에 뚜렷한 기여를 한다는 것이 확인되었다.
- HBFP는 MNIST, CIFAR-10, ImageNet을 포함한 저해상도 및 고해상도 데이터셋 모두에서 뛰어난 내성적 안정성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.