[논문 리뷰] Effective Sparsification of Neural Networks with Global Sparsity Constraint
이 논문은 확률을 전역 기준으로 사용하여 모든 레이어에서 가중치 중요도와 흐าก이 수준을 자동으로 결정하는 새로운 네트워크 흐림화 방법인 ProbMask를 제안한다. 수동으로 프루닝 비율을 조정할 필요 없이, 확률 공간에서의 연속 최적화 문제로 프루닝을 설정하고, Gumbel-Softmax 기법을 활용함으로써, 특히 높은 흐림 비율에서 최신 기술 수준의 정확도를 달성한다. ImageNet에서 Top-1 정확도가 이전 방법들보다 최대 10% 높다.
Weight pruning is an effective technique to reduce the model size and inference time for deep neural networks in real-world deployments. However, since magnitudes and relative importance of weights are very different for different layers of a neural network, existing methods rely on either manual tuning or handcrafted heuristic rules to find appropriate pruning rates individually for each layer. This approach generally leads to suboptimal performance. In this paper, by directly working on the probability space, we propose an effective network sparsification method called {\it probabilistic masking} (ProbMask), which solves a natural sparsification formulation under global sparsity constraint. The key idea is to use probability as a global criterion for all layers to measure the weight importance. An appealing feature of ProbMask is that the amounts of weight redundancy can be learned automatically via our constraint and thus we avoid the problem of tuning pruning rates individually for different layers in a network. Extensive experimental results on CIFAR-10/100 and ImageNet demonstrate that our method is highly effective, and can outperform previous state-of-the-art methods by a significant margin, especially in the high pruning rate situation. Notably, the gap of Top-1 accuracy between our ProbMask and existing methods can be up to 10\%. As a by-product, we show ProbMask is also highly effective in identifying supermasks, which are subnetworks with high performance in a randomly weighted dense neural network.
연구 동기 및 목표
- 신경망 흐림화에서 레이어별 최적의 프루닝 비율을 선택하는 문제를 해결하기 위해, 수동으로 설정할 경우 어려움과 비최적의 결과를 피하기 위함.
- 크기 기반 또는 정규화된 점수 기반 방법의 한계를 극복하기 위해, 모든 레이어에서 일관되게 적용 가능한 전역적이고 비교 가능한 가중치 중요도 기준을 개발하기 위함.
- 확률 공간에서 전역적 흐림 제약 조건을 통해 각 레이어의 부여된 빈도를 자동으로 학습함으로써, 레이어별로 수동으로 프루닝 비율을 조정할 필요 없이, 빈도 예산을 자동으로 탐지할 수 있도록 하기 위함.
- 특히 ImageNet과 같은 대규모 데이터셋에서 관찰된 이전 프루닝 방법의 학습-테스트 성능 격차 문제를 해결하기 위함.
- 랜덤 초기화된 네트워크에서 고성능 하위망(슈퍼마스크)을 효과적으로 식별하기 위함.
제안 방법
- 각 마스크 요소를 학습 가능한 확률을 가진 베르누이 랜덤 변수로 간주하는 확률 공간에서의 연속 최적화 문제로 네트워크 프루닝을 공식화함.
- 전체 확률 합계를 제한하여 전반적인 모델의 흐림 수준을 제어하는 전역적 흐림 제약 조건을 도입함으로써, 각 레이어에서의 자동 빈도 탐지가 가능해짐.
- Gumbel-Softmax 재구성 기법을 사용하여 확률 매개변수를 미분 가능하게 학습함으로써, 이산 마스크 샘플링을 통한 역전파가 가능해짐.
- Gumbel-Softmax의 온도를 안내하는 스케줄을 적용하여 확률이 0 또는 1로 수렴하도록 유도함으로써, 결정론적 흐린 마스크를 형성함.
- 확률 공간에 ℓ₁ 정규화를 적용하여 흐림을 촉진하고, 저분산, 결정론적 마스크로의 수렴을 향상시킴.
- 최종 마스크를 흐린 이진 네트워크로 간주하여, 재학습 없이도 효율적인 추론을 가능하게 함.
실험 결과
연구 질문
- RQ1확률은 깊은 신경망의 서로 다른 레이어에서 가중치 중요도의 전역적으로 비교 가능한 측정 기준이 될 수 있는가?
- RQ2특히 높은 프루닝 비율에서, 확률 공간에서의 전역적 흐림 제약 조건이 레이어별로 고정된 흐림 제약 조건보다 정확도 측면에서 뛰어나게 작용하는가?
- RQ3제안된 방법은 수동 조정 없이도 각 레이어에 적절한 흐림 예산을 자동으로 학습할 수 있는가?
- RQ4ProbMask는 대규모 데이터셋에서 관찰된 이전 프루닝 방법의 학습-테스트 성능 격차 문제를 완화하는가?
- RQ5ProbMask는 무작위 초기화된 밀집 네트워크에서 고정밀도 슈퍼마스크를 효과적으로 식별할 수 있는가?
주요 결과
- ResNet50를 사용한 ImageNet에서 ProbMask는 99.9% 프루닝 비율에서도 Top-1 정확도 74.68%를 달성하며, 이는 이전 최신 기술 수준의 방법들보다 최대 10%포인트 높은 성능이다.
- ResNet32를 사용한 CIFAR-100에서 ProbMask는 99.9% 프루닝 비율에서도 높은 정확도를 유지하지만, PBW와 MLPrune는 붕괴되며, 이는 확률 기반 중요도 점수의 전역적 비교 가능성에 우수함을 시사한다.
- CIFAR-10에서 99.9% 프루닝 비율에서, 확률 공간의 전역적 흐림 제약 조건은 레이어별 균일 흐림 제약 조건보다 57.75% 높은 정확도를 기록하며, 각 레이어의 예산 적응의 중요성을 입증한다.
- CIFAR-100에서 ProbMask는 원래 가중치의 2%만을 사용하는 슈퍼마스크를 성공적으로 식별하였으며, 초기화 상태에서 가중치를 고정한 상태에서도 거의 50%의 정확도를 달성하였다.
- 최종 마스크의 확률 분포가 모든 레이어에서 0 또는 1로 수렴함을 확인하여, 학습 후 마스크가 결정론적이고 흐린 상태로 변하는 것을 확인하였다.
- 이 방법은 모델(ResNet, VGG, DenseNet)과 데이터셋(CIFAR-10/100, ImageNet)에 관계없이 뛰어난 강건성을 보이며, 항상 크기 기반 및 헤시안 기반 프루닝 기준보다 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.