Skip to main content
QUICK REVIEW

[논문 리뷰] Single-shot Channel Pruning Based on Alternating Direction Method of Multipliers

Chengcheng Li, Zi Wang|arXiv (Cornell University)|2019. 02. 18.
Domain Adaptation and Few-Shot Learning참고 문헌 23인용 수 4
한 줄 요약

이 논문은 단일 스텝 채널 프루닝을 통해 훈련 중에 필터 수준의 희소성(스패arsity)을 달성하기 위해 보조 변수를 사용하는 분할 방법(ADMM)을 제안한다. 이로 인해 한 번의 프루닝과 피니팅만으로도 성능을 회복할 수 있으며, 다양한 아키텍처와 데이터셋에서 최신의 반복적 프루닝 방법(예: 타일러 전개)을 능가한다. 특히 높은 압축 비율에서 뛰어난 성능을 보인다.

ABSTRACT

Channel pruning has been identified as an effective approach to constructing efficient network structures. Its typical pipeline requires iterative pruning and fine-tuning. In this work, we propose a novel single-shot channel pruning approach based on alternating direction methods of multipliers (ADMM), which can eliminate the need for complex iterative pruning and fine-tuning procedure and achieve a target compression ratio with only one run of pruning and fine-tuning. To the best of our knowledge, this is the first study of single-shot channel pruning. The proposed method introduces filter-level sparsity during training and can achieve competitive performance with a simple heuristic pruning criterion (L1-norm). Extensive evaluations have been conducted with various widely-used benchmark architectures and image datasets for object classification purpose. The experimental results on classification accuracy show that the proposed method can outperform state-of-the-art network pruning works under various scenarios.

연구 동기 및 목표

  • 반복적 프루닝과 피니팅이 필요 없는 채널 프루닝을 위해 단일 스텝 프레임워크를 도입함으로써 이를 제거하고자 한다.
  • ADMM를 활용해 훈련 중에 필터 수준의 희소성(스패arsity)을 강제함으로써 구조적 희소성(스패arsity)을 필터 수준에서 달성하고자 한다.
  • 표준 벤치마크(MNIST, CIFAR-10)와 널리 사용되는 아키텍처(LeNet-5, AlexNet)에서 제안된 방법의 성능을 평가하고자 한다.
  • 다양한 압축 비율에서 단일 스텝 프루닝의 성능을 최신의 반복적 프루닝 방법과 비교하고자 한다.
  • ADMM가 필터 수준의 희소성 유도 및 프루닝 이후 일반화 성능 향상에 얼마나 효과적인지 분석하고자 한다.

제안 방법

  • ADMM를 사용해 채널 수준의 희소성(스패arsity)을 강제하는 딥 컨volution 신경망(DCNN)을 훈련함. 이때 희소성은 보조 변수를 포함한 라그랑주 승수 형식으로 강제된다.
  • 지표 함수 $ g_i(W_i) $ 를 사용해 필터 수준의 희소성 제약 조건을 도입함. 여기서 $ \text{card}(W_i) \leq l_i $ 이며, $ l_i $ 는 각 레이어에서 유지할 필터의 목표 수이다.
  • ADMM 훈련 후에 $ l_1 $-노름을 기반으로 한 히우리스틱 프루닝 기준을 적용해 중요도가 낮은 필터를 식별하고 제거함.
  • 프루닝 후 성능 저하를 복구하기 위해 표준 훈련 절차를 사용해 단일 피니팅 단계를 수행함.
  • ADMM 프레임워크를 활용해 반복적으로 가중치 $ W $, 이중 변수 $ Y $, 보조 변수 $ Z $ 를 업데이트함. 이때 제약 조건 $ W = Z $ 는 교대 최소화를 통해 강제함.
  • 프루닝 문제를 제약 조건이 있는 최적화 문제로 공식화함: 손실 함수 $ C(W,D) $ 와 희소성 유도 페널티 $ \sum g_i(W_i) $ 의 합을 최소화하며, 필터 수 제약 조건을 만족시킴.

실험 결과

연구 질문

  • RQ1ADMM는 훈련 중에 채널 수준의 희소성(스패arsity)을 효과적으로 유도하여 단일 스텝 프루닝을 가능하게 할 수 있는가?
  • RQ2ADMM를 사용한 단일 스텝 프루닝은 기존의 반복적 프루닝 방법에 비해 정확도와 압축 효율성 측면에서 뛰어나게 성능을 냈는가?
  • RQ3ADMM 훈련 중에 필터의 $ l_1 $-노름은 어떻게 변화하며, 이는 필터 중요도와 관련이 있는가?
  • RQ4표준 훈련과 비교했을 때 ADMM는 프루닝된 네트워크의 일반화 성능에 어떤 영향을 미치는가?
  • RQ5반복적 보정 없이도 높은 프루닝 비율에서도 높은 정확도를 유지할 수 있는가?

주요 결과

  • CIFAR-10에서 AlexNet을 사용한 실험에서, 제안된 방법은 50% 프루닝 비율에서 77.17%의 top-1 정확도를 달성했으며, 타일러 전개(TE)는 73.06% (추가 피니팅 없이) 및 75.47% (추가 피니팅 있음)를 기록함.
  • 75% 프루닝 비율에서 제안된 방법은 72.04%의 정확도를 기록했으며, TE는 추가 피니팅 없이 62.72% 및 추가 피니팅 있음 70.03%를 기록함.
  • 87.5% 프루닝 비율에서 제안된 방법은 64.17%의 정확도를 유지했으며, TE는 추가 피니팅 없이 51.83% 및 추가 피니팅 있음 60.92%를 기록함.
  • ADMM 훈련은 많은 필터들이 $ l_1 $-노름이 거의 0에 가까워지는 현상을 유도하여, 채널 수준의 희소성(스패arsity) 유도가 효과적임을 확인함.
  • ADMM 훈련 중에 더 깊은 레이어에서 $ |W - Z| $ 거리가 크게 감소함을 관찰하여, 중요도가 낮은 필터들이 효과적으로 희소화되었음을 시사함.
  • 사전 훈련된 ADMM 모델의 정확도는 다소 낮지만, ADMM 최적화된 모델에서 프루닝한 후 피니팅한 네트워크는 모든 단계에서 비-ADMM 기반 베이스라인보다 높은 정확도를 지속적으로 확보함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.