Skip to main content
QUICK REVIEW

[논문 리뷰] PruneNet: Channel Pruning via Global Importance

Ashish Khetan, Zohar Karnin|arXiv (Cornell University)|2020. 05. 22.
Advanced Neural Network Applications참고 문헌 34인용 수 11
한 줄 요약

PruneNet는 데이터 기반의 전역 최적화 채널 프루닝 방법을 제안하며, 경량 최적화 단계를 통해 각 레이어의 채널 너비를 특정하여 뛰어난 정확도와 FLOP 효율성을 달성한다. ImageNet에서 PruneNet의 프루닝된 ResNet-50은 FLOPs를 감소시키면서도 ResNet-34와 ResNet-18을 초월하는 정확도를 기록하며, 프루닝된 ResNet-101은 ResNet-50를 능가한다.

ABSTRACT

Channel pruning is one of the predominant approaches for accelerating deep neural networks. Most existing pruning methods either train from scratch with a sparsity inducing term such as group lasso, or prune redundant channels in a pretrained network and then fine tune the network. Both strategies suffer from some limitations: the use of group lasso is computationally expensive, difficult to converge and often suffers from worse behavior due to the regularization bias. The methods that start with a pretrained network either prune channels uniformly across the layers or prune channels based on the basic statistics of the network parameters. These approaches either ignore the fact that some CNN layers are more redundant than others or fail to adequately identify the level of redundancy in different layers. In this work, we investigate a simple-yet-effective method for pruning channels based on a computationally light-weight yet effective data driven optimization step that discovers the necessary width per layer. Experiments conducted on ILSVRC-$12$ confirm effectiveness of our approach. With non-uniform pruning across the layers on ResNet-$50$, we are able to match the FLOP reduction of state-of-the-art channel pruning results while achieving a $0.98\%$ higher accuracy. Further, we show that our pruned ResNet-$50$ network outperforms ResNet-$34$ and ResNet-$18$ networks, and that our pruned ResNet-$101$ outperforms ResNet-$50$.

연구 동기 및 목표

  • 균일하거나 통계 기반의 채널 프루닝의 한계를 해결하기 위해 각 레이어별로 특정되는 데이터 기반의 채널 너비 선택을 가능하게 한다.
  • 그룹 라소와 같은 비용이 많이 드는 정규화를 피하면서도, 미세조정된 프루닝 모델을 능가하는 계산 효율적인 방법을 개발한다.
  • 큰 네트워크의 프루닝된 버전(예: ResNet-50)이 더 작은 수동 설계된 아키텍처(예: ResNet-34)보다 정확도와 효율성 면에서 뛰어나다는 것을 입증한다.
  • 레이어 간 비균일한 프루닝이 균일한 프루닝이나 표준 모델 변형보다 더 뛰어난 성능을 낼 수 있음을 검증한다.

제안 방법

  • PruneNet는 각 레이어의 최적 채널 수를 결정하기 위해 경량의 데이터 기반 최적화 단계를 기반으로 한 전역 중요도 점수를 도입한다.
  • 이 방법은 채널 너비와 네트워크 가중치를 동시에 최적화하는 미분 가능하고 유사하게 미분 가능한 프루닝 전략을 사용한다.
  • 채널 프루닝을 제약 조건이 있는 최적화 문제로 공식화하며, 정확도 저하를 최소화하면서 FLOPs를 줄이는 것을 목표로 한다.
  • 이 방법은 네트워크 성능에 대한 각 채널의 전역 기여도에 따라 적응적으로 채널을 제거하는 프루닝 스케줄을 사용한다.
  • 두 단계로 구성된 훈련 프로세스를 활용한다: 첫 번째 단계에서는 활성화 통계를 사용해 전역 중요도 지표를 계산하고, 두 번째 단계에서는 선택된 채널 너비로 네트워크를 미세조정한다.
  • 이 방법은 사전 훈련 후 적용되며, 다시 시작부터 훈련하거나 그룹 라소와 같은 복잡한 정규화가 필요하지 않다.

실험 결과

연구 질문

  • RQ1데이터 기반의 비균일한 채널 프루닝 전략이 ResNet-34와 ResNet-18과 같은 표준보다 작은 아키텍처를 능가할 수 있는가?
  • RQ2전역 최적화된 채널 프루닝 방법이 균일하거나 통계 기반의 프루닝보다 더 나은 정확도-FLOP 트레이드오프를 달성할 수 있는가?
  • RQ3프루닝된 ResNet-50가 더 큰, 비프루닝된 ResNet-101의 성능을 뛰어넘을 수 있는가?
  • RQ4정확도와 효율성 측면에서 PruneNet의 성능이 DCP나 ThiNet과 같은 최신 채널 프루닝 방법보다 어떻게 비교되는가?

주요 결과

  • 프루닝된 ResNet-50는 상태최악의 채널 프루닝 방법보다 정확도가 0.98% 높으면서도 FLOP 감소율은 동일하게 유지한다.
  • 프루닝된 ResNet-50는 FLOPs가 더 적음에도 불구하고 정확도와 처리량 면에서 ResNet-34와 ResNet-18을 모두 능가한다.
  • 프루닝된 ResNet-101은 원본 ResNet-50보다 더 높은 정확도와 더 빠른 처리량을 기록하여, 프루닝이 수동 설계된 더 작은 변형보다 더 효율적인 아키텍처를 생성할 수 있음을 보여준다.
  • Caltech-256에서 프루닝된 ResNet-50는 최대 10배의 FLOP 감소에도 불구하고 정확도를 유지하거나 향상시키며, FLOPs 감소율이 5.75배일 경우 정확도가 7.53% 향상되었다.
  • 강한 프루닝(예: 10배 FLOPs 감소) 상황에서도 PruneNet는 균일한 프루닝과 DCP, ThiNet과 같은 최신 기준 모델보다 뚜렷한 정확도 우위를 유지한다.
  • PruneNet의 GCP-f 버전은 FLOPs를 5배 줄였을 때 ResNet-50보다 정확도가 3.86% 높아졌으며, 파라미터 수도 3.09배 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.