[논문 리뷰] Rare Gems: Finding Lottery Tickets at Initialization
이 논문은 초기화 단계에서 룩업 티켓(희박하고 훈련 가능한 하위신경망)을 발견하는 알고리즘인 Gem-Miner를 제안한다. CIFAR-10 및 ImageNet에서 사전 훈련 없이도 최신 기준 성능을 달성하며, 이는 기존의 19배 빠른 훈련 속도로 기록된 바 있다. Gem-Miner는 반복적인 프루닝과 피니어튜닝을 통해 정교화되는 '희귀 보석'(초기 정확도가 높은 하위신경망)을 식별하여, 이는 이전 방법보다 최대 19배 빠른 훈련 속도로 모든 알려진 기준 성능을 뛰어넘는다.
Large neural networks can be pruned to a small fraction of their original size, with little loss in accuracy, by following a time-consuming "train, prune, re-train" approach. Frankle & Carbin conjecture that we can avoid this by training "lottery tickets", i.e., special sparse subnetworks found at initialization, that can be trained to high accuracy. However, a subsequent line of work by Frankle et al. and Su et al. presents concrete evidence that current algorithms for finding trainable networks at initialization, fail simple baseline comparisons, e.g., against training random sparse subnetworks. Finding lottery tickets that train to better accuracy compared to simple baselines remains an open problem. In this work, we resolve this open problem by proposing Gem-Miner which finds lottery tickets at initialization that beat current baselines. Gem-Miner finds lottery tickets trainable to accuracy competitive or better than Iterative Magnitude Pruning (IMP), and does so up to $19 imes$ faster.
연구 동기 및 목표
- 초기화 단계에서 단순 기준 및 훈련 후 프루닝 방법보다 뛰어난 성능을 내는 룩업 티켓을 찾는 열린 문제를 해결하기 위해.
- 사전 훈련 없이도 최신 기준 성능에 도달할 수 있는 희박한 하위신경망을 식별하는 방법을 개발하기 위해.
- 식별된 하위신경망이 랜덤 희박 하위신경망 기준 등 모든 알려진 사전 검증 조건을 통과하도록 보장하기 위해.
- 반복적 크기 프루닝(IMP)과 사전 훈련을 통한 성능에 비해 훨씬 적은 훈련 에포크 수로 경쟁적 또는 더 높은 정확도를 달성하기 위해.
- 초기화 단계에서의 높은 정확도가 최종 성능을 강력하게 예측할 수 있음을 입증하여, 더 빠르고 효율적인 훈련을 가능하게 하기 위해.
제안 방법
- Gem-Miner는 초기화 시 비현저한 정확도를 보이는 하위신경망(즉, '희귀 보석')을 식별함으로써, 사전 피니어튜닝 없이도 정확도가 높은 희박 하위신경망을 발견한다.
- 크기와 기울기 정보를 기반으로 한 글로벌 스코어 메트릭을 사용하여 반복적 프루닝을 이끌며, 적응형 임계값을 통해 층 붕괴를 방지한다.
- 알고리즘은 매 5 에포크마다 반복적 프루닝을 적용하여 점진적으로 희박성 수준을 목표 수준으로 감소시키면서도 높은 초기 정확도를 유지한다.
- 스코어 벡터에 정규화 항을 포함시켜 프루닝 중 안정성을 향상시키고 희박성을 장려한다.
- 학습 가능한 파라미터 λ를 사용해 프루닝 임계값을 동적으로 조정함으로써 층 전체가 제거되는 것을 방지한다.
- Gem-Miner는 글로벌 프루닝, 점진적 희박성 감소, 스코어 정규화를 결합함으로써 기존 방법(예: EP 및 SR)을 뛰어넘도록 설계되어 있다.
실험 결과
연구 질문
- RQ1초기화 단계에서 IMP와 사전 훈련을 통한 성능을 뛰어넘는 룩업 티켓을 찾을 수 있는가?
- RQ2초기화 시 높은 정확도를 보이는 하위신경망(즉, '희귀 보석')은 랜덤 희박 하위신경망보다 더 나은 최종 성능을 내는가?
- RQ3기존의 기준(랜덤 희박 하위신경망, 계층별 희박성 히우리스틱 포함)을 모두 뛰어넘는 초기화 단계의 프루닝 방법을 개발할 수 있는가?
- RQ4기존의 초기화 단계 프루닝 방법(예: EP)에 어떤 수정 사항이 추가되어야 초기화 단계에서의 높은 정확도와 피니어튜닝 후 성능을 달성할 수 있는가?
- RQ5Gem-Miner의 훈련 기간을 연장하면 성능 향상이 이루어지며, 이는 훈련 후 프루닝 방법과의 격차를 줄일 수 있는가?
주요 결과
- Gem-Miner는 CIFAR-10에서 ResNet-20에 대해 0.59% 희박성으로 초기화 단계에서 66.15%의 테스트 정확도를 달성하며, 최고의 EP 변종(63.72%)과 모든 이전 기준을 초월한다.
- CIFAR-10에서 1.4% 희박성일 경우, Gem-Miner는 150 에포크 내에 피니어튜닝 후 77.89%의 정확도를 기록하며, IMP와 사전 훈련을 통한 성능(74.52%)을 뛰어넘고 Renda 등이 제안한 훈련 후 프루닝 방법(80.21%)과도 맞먹는다.
- 3000 에포크 동안 훈련된 Long Gem-Miner는 79.50%의 정확도를 기록하며, 표준 Gem-Miner 대비 1.5% 향상된 성능을 보이며, 연장된 훈련이 성능 향상에 기여함을 시사한다.
- Gem-Miner는 IMP와 사전 훈련을 통한 성능에 비해 최대 19배 더 빠른 훈련 속도를 기록하며, 유사하거나 더 높은 정확도를 더 적은 훈련 에포크 수로 달성한다.
- 모든 알려진 사전 검증 조건을 통과한다: 랜덤 희박 하위신경망 및 다른 히우리스틱 기반 방법보다도 뛰어나며, 계층별 희박성 조정을 철저히 해도 여전히 승리한다.
- 제거 실험 결과, 글로벌 프루닝, 점진적 희박성 감소, 스코어 정규화가 필수적인 구성 요소임을 확인한다. 특히 글로벌 프루닝과 점진적 프루닝이 핵심이며, 정규화만으로는 최소한의 이점을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.