Skip to main content
QUICK REVIEW

[논문 리뷰] A Deeper Look at the Layerwise Sparsity of Magnitude-based Pruning.

Jaeho Lee, Sejun Park|arXiv (Cornell University)|2020. 10. 15.
Advanced Neural Network Applications참고 문헌 41인용 수 4
한 줄 요약

이 논문은 전역 크기 기반 프루닝을 위한 새로운 중요도 점수인 계층 적응형 크기 기반 프루닝(LAMP)을 제안한다. LAMP는 모델 수준의 ℓ₂ 왜곡을 통해 가중치 크기를 재스케일링하여 계층 간 스파arsity를 적응적으로 결정함으로써 초모수 튜닝 없이도 성능을 향상시킨다. LAMP는 다양한 모델과 데이터셋에서 최신 기술 수준의 성능을 달성하며, 연결성 기반 스파arsity와 같은 기존 방법들보다 뛰어나며, 특히 기저선의 성능이 저하되는 가중치 재시작 설정에서 뛰어난 성능을 보인다.

ABSTRACT

Recent discoveries on neural network pruning reveal that, with a carefully chosen layerwise sparsity, a simple magnitude-based pruning achieves state-of-the-art tradeoff between sparsity and performance. However, without a clear consensus on how to choose, the layerwise sparsities are mostly selected algorithm-by-algorithm, often resorting to handcrafted heuristics or an extensive hyperparameter search. To fill this gap, we propose a novel importance score for global pruning, coined layer-adaptive magnitude-based pruning (LAMP) score; the score is a rescaled version of weight magnitude that incorporates the model-level $\ell_2$ distortion incurred by pruning, and does not require any hyperparameter tuning or heavy computation. Under diverse datasets and models, LAMP consistently outperforms popular existing schemes for layerwise sparsity selection. Furthermore, we observe that LAMP continues to outperform baselines even in weight-rewinding setups, while the connectivity-oriented layerwise sparsity (the strongest baseline overall) performs worse than a simple global magnitude-based pruning in this case.

연구 동기 및 목표

  • 크기 기반 프루닝에서 최적의 계층별 스파arsity를 선택하는 데 있어 아직 합의된 바가 없는 문제를 해결하기 위해.
  • 프루닝 전략 설계 시 수작업 히ュ리스틱이나 광범위한 초모수 검색에 의존하는 것을 제거하기 위해.
  • 전역 모델 영향을 기반으로 계층별 스파arsity를 적응적으로 결정하는 원칙적이고 계산적으로 효율적인 중요도 점수를 개발하기 위해.
  • 가중치 재시작을 포함한 다양한 훈련 제도에서 전역 크기 기반 프루닝의 성능을 향상시키기 위해.
  • 기본적인 설정에서는 강력한 성능를 보이는 연결성 기반 스파arsity가, 동적 훈련 환경(예: 가중치 재시작)에서는 성능이 떨어지는 이유를 입증하기 위해.

제안 방법

  • LAMP는 전체 모델에서 프루닝이 유도하는 ℓ₂ 왜곡을 고려한 재스케일링된 가중치 크기 점수를 도입한다.
  • 중요도 점수는 가중치 크기의 크기에 기반하며, 프루닝이 모델 성능에 미치는 영향을 반영하는 계층별 정규화로 조정된다.
  • 추가적인 순방향 전파나 기울기 계산이 필요 없어 계산적으로 경량이다.
  • 초모수 튜닝이나 검증 없이도 LAMP 점수로부터 직접 계층별 스파arsity를 결정한다.
  • 모든 계층에 걸쳐 전역적으로 적용되어 일관된 성능을 보이는 종단 간 프루닝을 가능하게 한다.
  • 표준 및 가중치 재시작 훈련 프rotocol 하에서 평가하여 내구성을 점검한다.

실험 결과

연구 질문

  • RQ1LAMP는 다양한 모델과 데이터셋에서 기존의 계층별 스파arsity 선택 방법과 비교해 정확도와 스파arsity 트레이드오프 측면에서 어떻게 성능을 냅니다?
  • RQ2가중치 재시작 설정에서, 모델 동역학이 크게 변화하는 상황에서도 LAMP는 우수한 성능을 유지합니까?
  • RQ3왜 연결성 기반 계층별 스파arsity는 가중치 재시작 시나리오에서 실패하는 반면, LAMP는 여전히 내구성이 있습니까?
  • RQ4간단한 초모수 없는 중요도 점수는 복잡하고 튜닝된 기준보다 전역 프루닝에서 뛰어난 성능을 낼 수 있습니까?
  • RQ5모델 수준의 ℓ₂ 왜곡은 효과적인 계층별 스파arsity 할당을 이끄는 데 어떤 역할을 합니까?

주요 결과

  • LAMP는 다양한 데이터셋과 모델 아키텍처에서 인기 있는 계층별 스파arsity 선택 방법들을 일관되게 능가한다.
  • 추가적인 초모수 튜닝이나 계산 부담 없이도 최신 기술 수준의 정확도-스파arsity 트레이드오프를 달성한다.
  • 가중치 재시작 설정에서는 LAMP가 강력한 성능를 유지하지만, 연결성 기반 스파arsity 방법은 상당히 성능이 저하된다.
  • 동적 훈련 환경에서 LAMP와 기준선 간의 성능 격차가 더욱 벌어지며, 이는 LAMP의 내구성을 강력히 입증한다.
  • LAMP의 ℓ₂ 왜곡 인식 재스케일링은 각 계층의 프루닝 영향을 효과적으로 포착하여 더 나은 스파arsity 할당을 이끈다.
  • LAMP의 성공은 연결성 기반 히ュ리스틱보다 모델 수준의 전역 영향이 계층별 프루닝을 더 효과적으로 이끌 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.