Skip to main content
QUICK REVIEW

[논문 리뷰] Filter Sketch for Network Pruning

Mingbao Lin, Liujuan Cao|arXiv (Cornell University)|2020. 01. 23.
Advanced Neural Network Applications참고 문헌 57인용 수 5
한 줄 요약

FilterSketch는 사전 훈련된 합성곱 필터의 두 번째 순서 공분산을 Frequent Direction 알고리즘을 통한 행렬 스케칭을 통해 유지함으로써 재훈련이나 반복 최적화 없이도 높은 정확도를 유지하는 구조적 모델 압축 방법을 제안한다. ResNet-110에서는 FLOPs를 63.3% 감소시키고 파라미터를 59.9% 줄였으며 정확도 저하가 거의 없고, ResNet-50에서는 FLOPs를 45.5% 감소시켰고 상위 1위 정확도 손실이 0.69%에 불과하다.

ABSTRACT

We propose a novel network pruning approach by information preserving of pre-trained network weights (filters). Network pruning with the information preserving is formulated as a matrix sketch problem, which is efficiently solved by the off-the-shelf Frequent Direction method. Our approach, referred to as FilterSketch, encodes the second-order information of pre-trained weights, which enables the representation capacity of pruned networks to be recovered with a simple fine-tuning procedure. FilterSketch requires neither training from scratch nor data-driven iterative optimization, leading to a several-orders-of-magnitude reduction of time cost in the optimization of pruning. Experiments on CIFAR-10 show that FilterSketch reduces 63.3% of FLOPs and prunes 59.9% of network parameters with negligible accuracy cost for ResNet-110. On ILSVRC-2012, it reduces 45.5% of FLOPs and removes 43.0% of parameters with only 0.69% accuracy drop for ResNet-50. Our code and pruned models can be found at https://github.com/lmbxmu/FilterSketch.

연구 동기 및 목표

  • 반복 최적화 또는 다시 시작하는 훈련이 필요한 기존의 구조적 프루닝 방법의 높은 계산 비용을 해결하기 위해.
  • 프루닝 과정에서 사전 훈련된 가중치로부터 중요한 두 번째 순서 정보를 유지함으로써 모델 압축 효율을 향상시키기 위해.
  • 구조적 프루닝에서 데이터 기반 반복 절차나 복잡한 정규화 기법의 필요성을 제거하기 위해.
  • 정보 유지 가능한 파라미터 초기화를 통해 높은 압축 비율을 달성하면서도 모델 정확도를 유지하기 위해.

제안 방법

  • 사전 훈련된 필터 가중치의 두 번째 순서 공분산을 유지하기 위해 네트워크 프루닝을 행렬 스케칭 문제로 재정의한다.
  • 반복 최적화를 피하기 위해 사전 구현된 Frequent Direction 알고리즘을 적용하여 스케칭을 효율적으로 계산한다.
  • 스케칭된 파라미터를 미세조정을 위한 온전한 초기화로 사용하여 빠른 성능 복구를 가능하게 한다.
  • 스케칭 과정 중 수치적 값을 안정화하기 위해 프로베니우스 노름을 적용한다.
  • 표준 CNN 추론 및 BLAS 라이브러리와의 호환성을 확보하기 위해 계층별로 구조적 필터에 적용한다.
  • 재훈련을 피하고 데이터 의존적 반복 최적화를 제거함으로써 프루닝 시간을 극적으로 단축시킨다.

실험 결과

연구 질문

  • RQ1사전 훈련된 필터의 두 번째 순서 공분산을 유지함으로써 반복 최적화 없이도 프루닝된 모델의 정확도를 크게 향상시킬 수 있는가?
  • RQ2Frequent Direction을 통한 행렬 스케칭은 반복적 또는 정규화 기반 프루닝과 비교해 성능과 속도 면에서 어떻게 다른가?
  • RQ3특히 60% 이상의 파라미터 감소율을 초과할 경우 FilterSketch는 얼마나 높은 압축 비율에서도 성능을 유지할 수 있는가?
  • RQ4프로베니우스 노름을 포함함으로써 스케칭 과정의 수치적 안정성과 최종 정확도가 향상되는가?
  • RQ5FilterSketch의 최적화 시간은 ThiNet 및 CP와 같은 최신 기술과 비교해 어떻게 다른가?

주요 결과

  • FilterSketch는 CIFAR-10에서 ResNet-110의 FLOPs를 63.3% 감소시키고 파라미터를 59.9% 줄였으며 정확도 저하가 0.33%에 불과하다.
  • ILSVRC-2012에서 FilterSketch-0.6는 ResNet-50에 대해 상위 1위 정확도 74.68%와 상위 5위 정확도 92.17%를 달성하여 유사 압축 수준에서 최신 기술을 뛰어넘었다.
  • ResNet-110에서 FilterSketch는 GPU에서 실질적인 1.57배의 성능 향상을 기록했으며 최적화 시간이 1.06초에 불과한 반면, ThiNet은 63,000초 이상이 소요되었다.
  • 높은 프루닝 비율(60% 이상)에서도 안정적인 성능을 유지하는 반면, L1 및 GAL 방법은 정확도가 극도로 떨어졌다.
  • 프로베니우스 노름을 포함함으로써 다양한 모델에서 정확도가 0.2–0.4% 향상되어 수치적 안정성에서의 기여를 확인했다.
  • 깊은 네트워크인 ResNet-110에 대해서도 FilterSketch의 최적화 비용이 2초 이내로 매우 낮아 반복 기반 방법 대비 몇 개의 지수 차수 감소를 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.