Skip to main content
QUICK REVIEW

[논문 리뷰] Effective Model Sparsification by Scheduled Grow-and-Prune Methods

Xiaolong Ma, Minghai Qin|arXiv (Cornell University)|2021. 06. 18.
Advanced Neural Network Applications참고 문헌 41인용 수 5
한 줄 요약

이 논문은 사전에 밀도 높은 모델을 훈련하지 않고도 연속적인 레이어 파artitions를 반복적으로 성장시키고 자르는 방식의 스케줄링된 성장-자르기(GaP) 방법을 제안한다. 이 방법은 높은 희박성에서도 최신 기술 수준의 정확도를 달성한다. 예를 들어, 90% 비균일 희박성의 ResNet-50 모델에서 ImageNet에서 77.9%의 top-1 정확도를 기록하며 이전 방법들을 능가한다. 동시에 메모리 사용량을 줄이고 체계적인 탐색을 통해 가중치 커버리지 향상을 이룬다.

ABSTRACT

Deep neural networks (DNNs) are effective in solving many real-world problems. Larger DNN models usually exhibit better quality (e.g., accuracy) but their excessive computation results in long inference time. Model sparsification can reduce the computation and memory cost while maintaining model quality. Most existing sparsification algorithms unidirectionally remove weights, while others randomly or greedily explore a small subset of weights in each layer for pruning. The limitations of these algorithms reduce the level of achievable sparsity. In addition, many algorithms still require pre-trained dense models and thus suffer from large memory footprint. In this paper, we propose a novel scheduled grow-and-prune (GaP) methodology without having to pre-train a dense model. It addresses the shortcomings of the previous works by repeatedly growing a subset of layers to dense and then pruning them back to sparse after some training. Experiments show that the models pruned using the proposed methods match or beat the quality of the highly optimized dense models at 80% sparsity on a variety of tasks, such as image classification, objective detection, 3D object part segmentation, and translation. They also outperform other state-of-the-art (SOTA) methods for model sparsification. As an example, a 90% non-uniform sparse ResNet-50 model obtained via GaP achieves 77.9% top-1 accuracy on ImageNet, improving the previous SOTA results by 1.5%. Code available at: https://github.com/boone891214/GaP.

연구 동기 및 목표

  • 기존의 모델 희박화 방법들이 단방향적으로 가중치를 자르거나 사전에 밀도 높은 모델을 의존하는 데서 비롯되는 한계를 해결하기 위해.
  • 희박화 과정에서 사전에 밀도 높은 모델을 훈련할 필요 없이 메모리 사용량을 줄이기 위해.
  • 구조적 레이어 파artitions와 스케줄링된 성장/자르기를 통해 모든 가중치를 시스템적으로 탐색함으로써 희박성-정확도 트레이드오프를 향상시키기 위해.
  • 훈련 중에 동적 가중치 재평가 기능을 제공함으로써 고희박성 수준에서 더 나은 모델 품질을 달성하기 위해.

제안 방법

  • GaP 방법은 DNN를 연속적인 레이어 파artitions로 나누고, 이러한 파artitions의 반복적 성장 및 자르기를 스케줄링한다.
  • 순환형 GaP에서는 한 파artition만 밀도 높은 상태로 성장시키고, 나머지는 여전히 희박한 상태를 유지한다. 훈련 후에는 그 파artition가 자르고, 다음 파artition가 성장하며 모든 파artitions를 순환한다.
  • 병렬 GaP에서는 여러 머신에서 동시에 여러 모델을 훈련시키며, 각각 다른 파artition가 한 번에 성장한다.
  • 모든 가중치가 파artition의 밀도 높은 단계 동안 탐색되므로, 무작위 또는 탐욕적 탐색 방식에 비해 가중치 커버리지가 완전해진다.
  • 훈련 전반에 걸쳐 희박성이 유지되며, 파artition 내 모든 가중치가 탐색된 후에만 희박 마스크가 업데이트된다.
  • 표준 가정 하에 하향 수렴 분석을 통해 이론적으로 기반을 두었으며, 순환형 GaP 방법은 하향 수렴 속도가 O(1/√Q)인 하위선형 수렴 속도를 보임을 확인했다. 여기서 Q는 훈련 사이클 수이다.

실험 결과

연구 질문

  • RQ1사전에 밀도 높은 모델을 훈련하지 않아도 모델 희박화를 달성할 수 있는가? 이는 메모리 오버헤드를 줄이는 데 기여하는가?
  • RQ2체계적이고 파artitions 기반의 성장 및 자르기가 랜덤 또는 탐욕적 탐색보다 더 나은 가중치 커버리지와 모델 품질을 제공하는가?
  • RQ3제안된 스케줄링된 GaP 방법은 다양한 비전 및 NLP 작업에서 고희박성 수준에서 최신 기술 수준의 정확도를 달성할 수 있는가?
  • RQ4스케줄링된 GaP 방법의 수렴 행동은 기존의 희박 훈련 방법과 비교해 어떻게 다른가?

주요 결과

  • GaP를 사용해 훈련한 90% 비균일 희박성 ResNet-50 모델은 ImageNet에서 77.9%의 top-1 정확도를 기록했으며, 이는 이전 최고 기록보다 1.5% 향상된 성능이다.
  • 80% 희박성 수준에서 GaP 모델은 이미지 분류, 객체 검출, 3D 세그멘테이션, 기계 번역 등의 작업에서 고도로 최적화된 밀도 높은 모델과 동등하거나 그 이상의 정확도를 달성한다.
  • 특히 고희박성 수준에서 RigL, DSR, SET 등의 최신 기술 수준의 희박화 기법보다 뛰어난 성능을 보였다.
  • 이론적 분석을 통해 순환형 GaP 방법이 표준 가정 하에 하향 수렴 속도가 O(1/√Q)인 하위선형 수렴 속도를 보임을 확인했다. 여기서 Q는 훈련 사이클 수이다.
  • 사전에 훈련된 밀도 높은 모델이 필요 없어지므로 메모리 사용량이 감소하여 자원이 제한된 훈련 환경에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.