[논문 리뷰] Lottery Jackpots Exist in Pre-trained Models
이 논문은 VGGNet-19 및 ResNet-50와 같은 확장되지 않은 사전 훈련된 모델 내에 가중치 미세조정 없이도 존재하는 높은 성능을 내는 희박한 하위망(로또 잭팟)을 소개한다. 크기 기반 마스크 초기화와 효율적인 마스크 탐색을 위한 새로운 단기 제한 기법을 활용함으로써, ImageNet에서 5개 이하의 훈련 에포크 내에 최대 90%의 파rameter 감소를 달성하면서 최신 기술 수준의 정확도를 확보하였으며, 기존 방법에 비해 프루닝 비용을 크게 감소시켰다.
Network pruning is an effective approach to reduce network complexity with acceptable performance compromise. Existing studies achieve the sparsity of neural networks via time-consuming weight training or complex searching on networks with expanded width, which greatly limits the applications of network pruning. In this paper, we show that high-performing and sparse sub-networks without the involvement of weight training, termed "lottery jackpots", exist in pre-trained models with unexpanded width. Furthermore, we improve the efficiency for searching lottery jackpots from two perspectives. Firstly, we observe that the sparse masks derived from many existing pruning criteria have a high overlap with the searched mask of our lottery jackpot, among which, the magnitude-based pruning results in the most similar mask with ours. Consequently, our searched lottery jackpot removes 90% weights in ResNet-50, while it easily obtains more than 70% top-1 accuracy using only 5 searching epochs on ImageNet. In compliance with this insight, we initialize our sparse mask using the magnitude-based pruning, resulting in at least 3x cost reduction on the lottery jackpot searching while achieving comparable or even better performance. Secondly, we conduct an in-depth analysis of the searching process for lottery jackpots. Our theoretical result suggests that the decrease in training loss during weight searching can be disturbed by the dependency between weights in modern networks. To mitigate this, we propose a novel short restriction method to restrict change of masks that may have potential negative impacts on the training loss. Our code is available at https://github.com/zyxxmu/lottery-jackpots.
연구 동기 및 목표
- 사전 훈련된 모델 내에 가중치 미세조정 없이도 높은 성능을 내는 희박한 하위망(로또 잭팟)이 존재하는지 조사하기.
- 기존 방법에서 일반적으로 높은 비용을 수반하는 이러한 하위망을 탐색하는 데 드는 계산 비용을 줄이기.
- 마스크 업데이트를 위한 더 나은 초기화 및 동적 제한 기법을 도입하여 로또 잭팟 탐색의 효율성과 수렴성을 향상시키기.
- 사전 훈련된 모델 내 로또 잭팟이 최신 기술 수준의 가중치 훈련 기반 프루닝 방법과 동일하거나 이를 초월하는 성능을 낼 수 있음을 입증하기.
제안 방법
- 크기 기반 프루닝을 사용해 희박한 마스크를 초기화함으로써 사전 훈련된 모델 내에서 로또 잭팟을 효율적으로 탐색하는 새로운 방법 SR-popup을 제안한다. 이는 최종 잭팟 마스크와 높은 겹침을 보여준다.
- 딥 네트워크 내 가중치 의존성에 대한 이론적 분석에 기반해, 마스크 탐색 중 가중치 교환을 제한하는 단기 제한 기법을 도입하여 훈련 손실에 악영향을 주지 않도록 한다.
- 반복마다 교환되는 가중치 수를 동적으로 스케줄링함으로써, 초기에는 높은 탐색을 수행하고 점차 제한을 강화함으로써 수렴성을 향상시키고 진동을 줄인다.
- 마스크의 원래 사전 훈련된 가중치를 유지하면서도 엔드 투 엔드 훈련이 가능한 미분 가능한 리 릴랙세이션을 사용한 유연한 마스크 정식화를 적용한다.
- 엣지팝업 알고리즘을 기반으로 하되, 개선된 초기화 및 제한 기법을 통해 속도를 향상시켜 탐색 비용을 최소 3배 이상 감소시켰다.
- VGGNet-19 및 ResNet-50를 사용해 CIFAR-10 및 ImageNet에서 검증하여, 최소한의 재훈련으로도 높은 성능를 확보하였다.
![Figure 1 : Training/Search cost v.s. top-1 accuracy of ResNet-50 [ 21 ] with a sparse rate of $90\%$ on ImageNet [ 22 ] . Search epoch differs from training epoch in that it only trains the mask for indicating the removal or preserve of weights, without modifying the weight value. Our method can qui](https://ar5iv.labs.arxiv.org/html/2104.08700/assets/x1.png)
실험 결과
연구 질문
- RQ1확장되지 않은 사전 훈련된 모델 내에 가중치 미세조정 없이도 높은 성능을 내는 희박한 하위망(로또 잭팟)이 존재하는가?
- RQ2이러한 로또 잭팟을 위한 탐색 비용을 성능을 유지하거나 향상시키면서도 크게 줄일 수 있는가?
- RQ3초기 마스크 선택(예: 크기 기반 프루닝)이 로또 잭팟 탐색의 효율성과 결과에 어떤 영향을 미치는가?
- RQ4마스크 탐색 중 가중치 교환을 제한하는 것이 어떤 영향을 미치며, 최적의 수렴을 위해 제한 스케줄는 어떻게 설계되어야 하는가?
- RQ5이론적으로 근거가 있는 기법이 마스크 탐색 과정에서 가중치 의존성의 악영향을 완화시킬 수 있는가?
주요 결과
- VGGNet-19에서 원래 모델의 10%만을 사용하는 로또 잭팟이 CIFAR-10에서 가중치 수정 없이도 동일한 성능을 달성한다.
- 제안된 방법은 기준선인 엣지팝업 대비 최소 3배 이상의 탐색 비용 절감을 이룩하였으며, 동일하거나 더 높은 성능를 확보하였다.
- 크기 기반 프루닝은 최종 로또 잭팟 마스크와 가장 높은 겹침을 보이며, 효과적인 초기화 전략으로서의 타당성을 입증한다.
- 제안된 단기 제한 기법은 마스크 탐색 중 더 빠른 수렴과 진동 감소를 이끌어내어, 무작위 및 역순 스케줄링 변형보다 뛰어난 성능를 보였다.
- ImageNet에서 이 방법은 단지 5개의 훈련 에포크 내에 ResNet-50에서 90%의 희박도를 달성하면서도 70% 이상의 정확도를 확보하여 높은 효율성을 입증하였다.
- 아블레이션 연구를 통해 크기 기반 초기화 및 동적 제한 스케줄이 최적 성능을 내기 위해 필수적인 구성 요소임을 확인하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.