[논문 리뷰] Lottery Ticket Preserves Weight Correlation: Is It Desirable or Not?
이 논문은 러키 티켓 가설이 초기화된 가중치와 최종 가중치 간의 가중치 상관관계에 의존하며, 잘 훈련된 네트워크에서는 이 상관관계가 감소함을 밝혀낸다. 이를 해결하기 위해, VGG, ResNet, MobileNet-v2 모델 전반에서 동일한 프루닝 및 훈련 설정 하에 러키 티켓 스파arsity 훈련을 항상 능가하는 피니팅 방법을 제안한다.
In deep model compression, the recent finding Lottery Ticket Hypothesis (LTH) (Frankle & Carbin, 2018) pointed out that there could exist a winning ticket (i.e., a properly pruned sub-network together with original weight initialization) that can achieve competitive performance than the original dense network. However, it is not easy to observe such winning property in many scenarios, where for example, a relatively large learning rate is used even if it benefits training the original dense model. In this work, we investigate the underlying condition and rationale behind the winning property, and find that the underlying reason is largely attributed to the correlation between initialized weights and final-trained weights when the learning rate is not sufficiently large. Thus, the existence of winning property is correlated with an insufficient DNN pretraining, and is unlikely to occur for a well-trained DNN. To overcome this limitation, we propose the & fine-tuning method that consistently outperforms lottery ticket sparse training under the same pruning algorithm and the same total training epochs. Extensive experiments over multiple deep models (VGG, ResNet, MobileNet-v2) on different datasets have been conducted to justify our proposals.
연구 동기 및 목표
- 대부분의 실용적 시나리오, 특히 큰 학습률을 사용할 경우 러키 티켓 가설이 성립하지 않는 이유를 조사하는 것.
- 승리 티켓이 존재할 수 있는 근본적인 조건을 규명하며, 초기화된 가중치와 최종 훈련된 가중치 간의 가중치 상관관계에 집중하는 것.
- 승리 티켓이 잘 훈련된 딥 네트워크에서 발생하기 어려운 한계를 해결하는 것.
- 동일한 프루닝 및 훈련 제약 조건 하에 러키 티켓 스파arsity 훈련을 항상 능가하는 성능 향상 방법을 제안하는 것.
- 다양한 아키텍처(VGG, ResNet, MobileNet-v2)와 데이터셋에서 제안된 방법을 검증하는 것.
제안 방법
- 승리 티켓 존재 여부를 결정하는 핵심 요소로 초기 가중치와 최종 훈련된 가중치 간의 상관관계를 분석하는 방법.
- 고도의 가중치 상관관계가 러키 티켓 성공에 필수적이지만, 이 상관관계가 큰 학습률로 훈련할 경우 떨어짐을 규명함.
- 표준 훈련 과정에서 손실되는 유익한 가중치 상관관계를 유지하기 위해, 프루닝 이후 피니팅 단계를 도입하는 제안된 접근 방식.
- 작은 학습률을 사용해 프루닝된 하위망에 대해 피니팅을 적용하여 초기 가중치 상관관계를 복구하고 안정화함.
- 기준 러키 티켓 훈련과 동일한 총 훈련 에포크 수와 프루닝 알고리즘을 유지하여 공정한 비교를 보장함.
- 일관된 일반화를 확보하기 위해 여러 모델과 데이터셋에 걸쳐 종단 간 전반적인 적용을 수행함.
실험 결과
연구 질문
- RQ1왜 러키 티켓 가설이 많은 실용적 훈련 시나리오, 특히 큰 학습률을 사용할 경우 나타나지 않는가?
- RQ2프루닝된 하위망에서 승리 티켓이 존재할 수 있는 근본적인 조건은 무엇인가?
- RQ3초기 가중치와 최종 가중치 간의 가중치 상관관계는 러키 티켓 성능에 어떻게 영향을 미치는가?
- RQ4가중치 상관관계가 부족하여 러키 티켓이 실패하는 경우, 피니팅 전략이 성능을 복구할 수 있는가?
- RQ5제안된 방법은 동일한 훈련 및 프루닝 조건 하에 표준 러키 티켓 스파arsity 훈련을 항상 능가하는가?
주요 결과
- 승리 티켓의 존재는 초기 가중치와 최종 훈련된 가중치 간의 높은 상관관계와 강하게 연관되어 있다.
- 이 가중치 상관관계는 모델이 큰 학습률로 훈련될 경우 크게 감소하며, 이는 이러한 설정에서 러키 티켓이 실패하는 이유를 설명한다.
- 잘 훈련된 딥 네트워크는 낮은 가중치 상관관계를 보이며, 이는 승리 티켓 후보로 적합하지 않음을 시사한다.
- 제안된 피니팅 방법은 프루닝된 하위망에서 가중치 상관관계를 복구하고 강화함으로써 성능을 성공적으로 복구한다.
- 모든 평가된 모델과 데이터셋에서 표준 러키 티켓 스파arsity 훈련을 일관되게 능가한다.
- 총 훈련 에포크 수를 늘리거나 프루닝 알고리즘을 변경하지 않음으로써 공정한 비교를 보장한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.