[논문 리뷰] Layer-adaptive sparsity for the Magnitude-based Pruning
LAMP는 계층-적응 맥락에서의 규모 기반 가지치기 점수로, 계층 인식 왜곡 측정치를 통해 전역적으로 가중치를 가지치고, 다양한 아키텍처 및 데이터셋에서 하이퍼파라미터 튜닝 없이 더 나은 희소성-정확도 트레이드오프를 달성한다.
Recent discoveries on neural network pruning reveal that, with a carefully chosen layerwise sparsity, a simple magnitude-based pruning achieves state-of-the-art tradeoff between sparsity and performance. However, without a clear consensus on "how to choose," the layerwise sparsities are mostly selected algorithm-by-algorithm, often resorting to handcrafted heuristics or an extensive hyperparameter search. To fill this gap, we propose a novel importance score for global pruning, coined layer-adaptive magnitude-based pruning (LAMP) score; the score is a rescaled version of weight magnitude that incorporates the model-level $\ell_2$ distortion incurred by pruning, and does not require any hyperparameter tuning or heavy computation. Under various image classification setups, LAMP consistently outperforms popular existing schemes for layerwise sparsity selection. Furthermore, we observe that LAMP continues to outperform baselines even in weight-rewinding setups, while the connectivity-oriented layerwise sparsity (the strongest baseline overall) performs worse than a simple global magnitude-based pruning in this case. Code: https://github.com/jaeho-lee/layer-adaptive-sparsity
연구 동기 및 목표
- 수동 조정 없이 크기 기반 가지치기에 대한 기본적인 계층별 희소성 체계를 제안한다.
- 실용적인 가지치기 점수를 도출하기 위한 모델 차원의 왜곡 최소화 관점을 개발한다.
- 모델 출력의 무결성을 가지치기하에서도 보존하는 하이퍼파라미터 없는 점수인 LAMP를 제안한다.
- 가중치 리와인딩 여부에 관계없이 여러 아키텍처와 데이터셋에서 LAMP를 검증한다.
- LAMP로 도출된 희소성 패턴이 수작업으로 만든 휴리스틱 및 기존 기준선과 어떻게 비교되는지 분석한다.
제안 방법
- 계층 내에서 크기에 따라 정렬된 각 가중치에 대해 LAMP 점수를 score(u;W) = (W[u])^2 / sum_{v>=u} (W[v])^2 로 정의한다.
- 전체 희소성 제약을 만족시키기 위해 가장 작은 LAMP 점수를 선택하여 전역 가지치를 적용한다. 이는 자동으로 선택된 계층별 희소성과 동등한 규모 기반 가지치기에 해당한다.
- 출력 왜곡 관점에서 LAMP를 정당화하기 위해, 계층별 MP가 완화된 Frobenius 왜곡 최소화를 해결하고, 그 결과 탐욕적이고 왜곡 최소화 가지치기 과정을 이끈다는 것을 보인다.
- 분모를 위한 계층별 제곱합 누적 합만 필요로 하는 최소한의 오버헤드로 LAMP를 계산할 수 있음을 입증한다.
- LAMP가 하이퍼파라미터 없이 모델 특화 지식에 의존하지 않으면서도 모델 차원의 왜곡을 잘 근사한다는 것을 보여준다.
- VGG-16, ResNet-18/34, DenseNet-121, EfficientNet-B0 등 여러 CNN 아키텍처를 CIFAR-10/100, SVHN, Restricted ImageNet에서 평가한다.
실험 결과
연구 질문
- RQ1계층-적응형이고 하이퍼파라미터 없는 가지치기 점수가 기존의 계층별 희소성 선택 체계보다 크기 기반 가지치기에 더 나은 성능을 보일 수 있는가?
- RQ2다양한 아키텍처 및 데이터셋에서 LAMP 점수가 가지치기 하에서 모델 차원의 출력 왜곡을 효과적으로 근사하는가?
- RQ3다른 기준선과 비교하여 LAMP가 가중치 리와인딩 및 원샷 가지치기와 어떻게 상호작용하는가?
- RQ4LAMP가 계층 전반에 형성하는 희소성 패턴은 어떠하며, 처음 계층을 촘촘하게 유지하거나 마지막 계층에 희소성 제약을 두는 등 수작업으로 설계된 휴리스틱과 어떻게 비교되는가?
주요 결과
- LAMP는 CIFAR-10에서 VGG-16, ResNet-18/34, DenseNet-121, EfficientNet-B0에서 희소성-정확도 트레이드오프에서 일관되게 기존의 계층별 희소성 체계보다 우수하게 작동한다.
- CIFAR-10에서 LAMP는 가중치의 1.44%만 남겨도 테스트 정확도 88.1%를 달성하며, 77.8%를 달성하는 Erdős-Rényi 커널보다 성능이 앞선다.
- LAMP는 SVHN, CIFAR-100, Restricted ImageNet의 실험에서도 기준선보다 성능이 앞서며, Erdős-Rényi 커널은 일부 케이스에서 여전히 경쟁력이 있다.
- LAMP는 원샷 가지치기 및 가중치 리와인딩에서 안정적으로 좋은 성능을 보이는 반면, Erdős-Rényi는 리와인딩에 민감할 수 있다.
- SNIP 설정에서 LAMP는 Global SNIP와 비슷한 성능을 달성해 표준 MP 상황을 넘어서는 강건성을 시사한다.
- LAMP에 의해 계층별로 형성된 희소성은 보통 처음과 마지막 계층의 밀도를 비교적 높게 유지하고, 높은 희소도에서 계층 간 비제로 가중치의 분포를 더 균일하게 만드는 경향이 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.