[논문 리뷰] Good Students Play Big Lottery Better.
이 논문은 ResNet-50 및 ResNet-110와 같은 대규모 모델에서 라운드티켓의 성능을 matching하거나 초월하는 희박한 하위망을 식별하는 데 새로운 방법인 지식 정복 티켓(KD 티켓)을 소개한다. 훈련된 밀도 네트워크로부터의 소프트 레이블을 활용해 하위망을 재훈련함으로써, 초깃값 조정 없이도 리워빙(rewinding)을 능가하거나 동등하게 성능을 내며, 리워빙과 조합할 경우 더욱 향상된 성능을 보이며 CIFAR-10 및 ImageNet에서 최신 기술 수준의 결과를 달성한다.
Lottery hypothesis suggests that a dense neural network contains a sparse sub-network that can match the test accuracy of the original dense net when trained in isolation from (the same) random initialization. However, the hypothesis failed to generalize to larger dense networks such as ResNet-50. As a remedy, recent studies demonstrate that a sparse sub-network can still be obtained by using a rewinding technique, which is to re-train it from early-phase training weights or learning rates of the dense model, rather than from random initialization. Is rewinding the only or the best way to scale up lottery tickets? This paper proposes a new, simpler and yet powerful technique for re-training the sub-network, called Knowledge Distillation ticket (KD ticket). Rewinding exploits the value of inheriting knowledge from the early training phase to improve lottery tickets in large networks. In comparison, KD addresses a complementary possibility - inheriting useful knowledge from the late training phase of the dense model. It is achieved by leveraging the soft labels generated by the trained dense model to re-train the sub-network, instead of the hard labels. Extensive experiments are conducted using several large deep networks (e.g ResNet-50 and ResNet-110) on CIFAR-10 and ImageNet datasets. Without bells and whistles, when applied by itself, KD performs on par or better than rewinding, while being nearly free of hyperparameters or ad-hoc selection. KD can be further applied together with rewinding, yielding state-of-the-art results for large-scale lottery tickets.
연구 동기 및 목표
- ResNet-50와 같은 대규모 모델에 적용할 때 표준적인 무작위 초기화가 강력한 희박한 하위망을 도출하지 못하는 라운드티켓 가설의 한계를 해결하기 위해.
- 밀도 네트워크의 후기 훈련 단계에서의 지식이 라운드티켓 성능을 향상시킬 수 있는지, 이는 리워빙에서처럼 초기 단계의 가중치에만 의존하는 것이 아니라, 검토하기 위해.
- 초깃값 조정에 민감하거나 훈련 단계의 수동 선택이 필요한 리워빙의 더 단순하고 더 강력한 대안을 개발하기 위해.
- 훈련된 밀도 모델의 소프트 레이블에서의 지식 정복을 통해 고성능의 희박한 하위망을 도출할 수 있으며, 이는 고립된 상태에서도 성능이 뛰어나다는 것을 입증하기 위해.
- KD와 리워빙을 조합하여 대규모 라운드티켓 탐색에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- 지식 정복 티켓(KD 티켓)을 제안하며, 이는 밀도 네트워크가 완전히 훈련된 후 소프트 레이블(로짓)을 사용하여 희박한 하위망을 재훈련하는 방식이다.
- 하위망은 원래의 밀도 네트워크와 동일한 무작위 가중치에서 초기화되지만, 하드 레이블을 사용한 표준 교차 엔트로피 대신 정복 손실을 사용하여 훈련된다.
- 밀도 네트워크의 최종 상태에서의 지식을 활용해 하위망의 학습을 이끌어내어, 무작위 또는 초기 단계의 초기화보다 더 잘 일반화되도록 한다.
- 핵심 형태로는 초깃값 조정이 필요 없으며, 훈련 단계나 학습률 스케줄링의 선택이 필요하지 않다.
- 먼저 KD를 적용한 후 리워운된 가중치로 미세조정함으로써 리워빙과 조합할 수 있으며, 이는 상호보완적인 성능 향상을 이룬다.
- 온도 스케일링과 지식 정복 손실을 포함한 표준 정복 기법을 활용해 교사(밀도 모델)에서 학생(하위망)으로 지식을 전달한다.
실험 결과
연구 질문
- RQ1밀도 네트워크의 후기 훈련 단계에서의 지식이 대규모 모델의 희박한 하위망 성능을 향상시킬 수 있는가?
- RQ2소프트 레이블에서의 지식 정복이 대규모 라운드티켓 탐색에서 리워빙의 성능을 능가하거나 동등하게 할 수 있는가?
- RQ3라운드티켓을 위한 정복 기반 방법이 효과적이면서도 초깃값 조정이 없어야 하며, 수동적인 단계 선택이 필요 없는가?
- RQ4다양한 아키텍처와 데이터셋에서 KD는 리워빙과 비교해 정확도와 강건성 측면에서 어떻게 성능을 내는가?
- RQ5KD는 리워빙과 조합하여 대규모 라운드티켓 훈련에서 최신 기술 수준의 결과를 달성할 수 있는가?
주요 결과
- KD 티켓은 초깃값 조정 없이 ResNet-50 및 ResNet-110에서 리워빙과 동등하거나 더 뛰어난 성능을 달성한다.
- KD 방법은 거의 초깃값 조정이 없어, 훈련 단계나 학습률의 수동 선택이 필요 없다.
- CIFAR-10 및 ImageNet에서 KD만으로도 이전 연구에서 보고된 최신 기술 수준의 라운드티켓 성능을 matching하거나 초월한다.
- 리워빙과 조합할 경우 KD는 성능을 추가로 향상시키며, 대규모 라운드티켓 탐색에서 최신 기술 수준의 결과를 달성한다.
- 훈련된 밀도 모델의 소프트 레이블을 사용하면 하드 레이블만 사용하는 것보다 더 강건하고 일반화 능력이 뛰어난 특징을 학습할 수 있다.
- 이 방법은 아키텍처와 데이터셋 모두에 걸쳐 잘 일반화되며, CIFAR-10 및 ImageNet 벤치마크에서 일관된 성능 향상을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.