Skip to main content
QUICK REVIEW

[논문 리뷰] Group Sparsity: The Hinge Between Filter Pruning and Decomposition for Network Compression

Yawei Li, Shuhang Gu|Lirias (KU Leuven)|2020. 03. 19.
Sparse and Compressive Sensing Techniques참고 문헌 54인용 수 18
한 줄 요약

이 논문은 그룹 스퍼스티를 통해 필터 프루닝과 저랭크 분해를 연결하는 통합 프레임워크를 제안한다. 학습 가능한 스퍼스티 유도 행렬에 그룹 스퍼스티 정규화를 적용함으로써, 열 스퍼스티를 통한 프루닝과 행 스퍼스티를 통한 분해 사이에서 동적으로 전환하는 방법을 제시한다. 이는 CIFAR-10, CIFAR-100, ImageNet 벤치마크에서 정확도-압축 성능 트레이드오프를 최적화하는 데 성공하며, 통합적이고 종단 간 최적화를 통해 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

In this paper, we analyze two popular network compression techniques, i.e. filter pruning and low-rank decomposition, in a unified sense. By simply changing the way the sparsity regularization is enforced, filter pruning and low-rank decomposition can be derived accordingly. This provides another flexible choice for network compression because the techniques complement each other. For example, in popular network architectures with shortcut connections (e.g. ResNet), filter pruning cannot deal with the last convolutional layer in a ResBlock while the low-rank decomposition methods can. In addition, we propose to compress the whole network jointly instead of in a layer-wise manner. Our approach proves its potential as it compares favorably to the state-of-the-art on several benchmarks.

연구 동기 및 목표

  • 신경망 압축을 위한 필터 프루닝과 저랭크 분해를 단일 최적화 프레임워크로 통합하는 것.
  • 잔차 연결이 존재하는 잔차 신경망에서 필터 프루닝의 한계를 해결하는 것, 특히 ResBlock의 마지막 합성곱층을 프루닝할 경우 스킵 커넥션에 영향을 주는 문제를 해결하는 것.
  • 층 단위의 압축이 아닌 전체 네트워크의 통합 압축을 가능하게 하여 전반적인 모델 효율성을 향상시키는 것.
  • 프루닝(파라미터 감소)과 분해(계산량 절감)의 상호보완적 강점을 통합적이고 융통성 있는 메커니즘을 통해 활용하는 것.
  • 다양한 벤치마크에서 정확도 및 FLOP 감소 성능을 최고 수준으로 달성하는 것.

제안 방법

  • 필터 프루닝과 분해 사이의 연결고리로 기능하는 학습 가능한 스퍼스티 유도 행렬 A를 도입하며, 이는 열 또는 행에 대한 그룹 스퍼스티를 가능하게 한다.
  • A의 열에 그룹 스퍼스티 정규화를 적용하여 출력 채널을 감소시키며, 이는 행렬 곱 W × A^c를 통한 필터 프루닝과 동치이다.
  • A의 행에 그룹 스퍼스티 정규화를 적용하여 내부 차원을 감소시키며, 두 개의 경량 합성곱층 W^r과 A^r을 활용한 저랭크 분해를 가능하게 한다.
  • 근사 최적화를 위해 적응형 학습률, 층 균형 조정, 정규화 인자 안내를 포함한 프록시멀 기반 경사하강법을 사용하여 최적화 문제를 해결한다.
  • 압축 과정 중 정밀도 유지를 위해 피취너 훈련 단계에서 지식 정복을 적용한다.
  • 층 단위의 압축이 아닌 전체 네트워크를 종단 간 통합적으로 최적화하여 전역적 압축 효율성을 향상시킨다.

실험 결과

연구 질문

  • RQ1필터 프루닝과 저랭크 분해를 단일 최적화 프레임워크로 통합할 수 있는가?
  • RQ2스퍼스티 유도 행렬의 그룹 스퍼스티가 프루닝 모드와 분해 모드 사이에서 동적으로 전환하는 데 어떻게 기여하는가?
  • RQ3전체 네트워크의 통합적 종단 간 압축 전략이 층 단위의 압축 전략을 능가하는가?
  • RQ4제안된 방법이 잔차 연결이 존재하는 층에서 필터 프루닝의 한계를 극복할 수 있는가?
  • RQ5정규화 유형과 안내 전략이 압축 성능 및 일반화 능력에 미치는 영향은 무엇인가?

주요 결과

  • CIFAR-10에서 제안된 방법은 50% 압축 비율에서 Top-1 오차율 6.37%를 달성하였으며, SSS(25.82%) 및 기타 최신 기술 수준(SOTA) 방법보다 뛰어난 성능을 보였다.
  • CIFAR-100의 ResNet-164에서 정규화 안내를 적용한 방법은 지식 정복 없이도 CGES 및 SSS를 능가하는 성능을 보였다.
  • ImageNet-2012에서 제안된 방법은 Top-1 오차율과 FLOP 압축 비율 사이의 최신 기술 수준 트레이드오프를 달성하였으며, KSE 및 SSS와 같은 기존 방법들을 능가하였다.
  • 절단 실험 결과, ℓ₁ 정규화와 T=0.005, α=0.01 조합이 가장 우수한 성능를 보였으며, 하이퍼파rameter 변화에 대해 매우 낮은 민감도를 보였다.
  • 유사한 압축 비율에서 VGG와 DenseNet에 대해 각각 기존 연구 대비 Top-1 오차율을 0.41%, 1.51% 감소시켰다.
  • 모든 압축 수준에서 FLOP 및 파라미터 감소가 KSE보다 뚜렷하게 우수하였으며, 유사 오차율 수준에서 제안된 방법이 더 낮은 FLOPs를 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.