Skip to main content
QUICK REVIEW

[논문 리뷰] Dual Lottery Ticket Hypothesis

Yue Bai, Huan Wang|arXiv (Cornell University)|2022. 03. 08.
Machine Learning and Data Classification인용 수 11
한 줄 요약

이 논문은 밀도 네트워크에서 무작위로 초기화된 하위망을, 무작위 희소 네트워크 변환(RST)이라는 새로운 정규화 기반 학습 전략을 통해 훈련 가능하고 높은 성능을 내는 모델로 변환할 수 있다는 이중 로또 티켓 가설(DLTH)을 제안한다. RST는 사전 훈련이 필요 없이 로또 티켓 가설(LTH)과 유사한 성능을 달성하며, 무작위 하위망이 가중치 정규화와 정보 추출을 통해 훈련 가능하게 만들 수 있음을 보여주어, 희소 네트워크 훈련에 더 유연하고 일반화 능력이 뛰어난 접근법을 제공한다.

ABSTRACT

Fully exploiting the learning capacity of neural networks requires overparameterized dense networks. On the other side, directly training sparse neural networks typically results in unsatisfactory performance. Lottery Ticket Hypothesis (LTH) provides a novel view to investigate sparse network training and maintain its capacity. Concretely, it claims there exist winning tickets from a randomly initialized network found by iterative magnitude pruning and preserving promising trainability (or we say being in trainable condition). In this work, we regard the winning ticket from LTH as the subnetwork which is in trainable condition and its performance as our benchmark, then go from a complementary direction to articulate the Dual Lottery Ticket Hypothesis (DLTH): Randomly selected subnetworks from a randomly initialized dense network can be transformed into a trainable condition and achieve admirable performance compared with LTH -- random tickets in a given lottery pool can be transformed into winning tickets. Specifically, by using uniform-randomly selected subnetworks to represent the general cases, we propose a simple sparse network training strategy, Random Sparse Network Transformation (RST), to substantiate our DLTH. Concretely, we introduce a regularization term to borrow learning capacity and realize information extrusion from the weights which will be masked. After finishing the transformation for the randomly selected subnetworks, we conduct the regular finetuning to evaluate the model using fair comparisons with LTH and other strong baselines. Extensive experiments on several public datasets and comparisons with competitive approaches validate our DLTH as well as the effectiveness of the proposed model RST. Our work is expected to pave a way for inspiring new research directions of sparse network training in the future. Our code is available at https://github.com/yueb17/DLTH.

연구 동기 및 목표

  • 무작위로 초기화된 밀도 네트워크에서 무작위로 선택된 하위망이 강력한 성능을 내는 훈련 가능한 구성으로 변환될 수 있는지 조사하는 것.
  • 기존의 로또 티켓 가설(LTH)에 대한 집중을 도전하기 위해 반대 문제를 탐색함: 어떤 무작위 하위망이라도 웨이팅 티켓이 될 수 있는가?
  • 반복적인 크기 기반 프루닝이나 사전 훈련에 의존하지 않고 다양한 희소 구조에 대해 일반화할 수 있는 학습 전략을 개발하는 것.
  • ResNet 아키텍처를 사용하여 CIFAR-10, CIFAR-100, ImageNet 서브셋에서 광범위한 실험을 통해 가설을 검증하는 것.
  • 밀도 네트워크와 그 하위망 간의 내부 관계에 초점을 맞추어, 희소 네트워크 훈련에 대한 새로운 시각을 제공하는 것.

제안 방법

  • 정규화 항을 도입하여 학습 능력을 향상시키고, 무작위로 선택된 하위망을 훈련 가능한 구성으로 변환하는 데 목적이 있는 무작위 희소 네트워크 변환(RST) 전략을 제안한다.
  • 정규화 항을 사용해 마스킹되지 않은 가중치로부터 학습 능력을 빌려오고, 마스킹된 가중치로부터 정보를 추출하는 데 기여한다.
  • RST 과정 이후에 반복적인 피니팅을 적용하여 LTH 및 기타 기준과의 공정한 비교를 가능하게 한다.
  • GraSP에서 유도된 계층별 희소 비율을 사용하여 다양한 희소 수준에서 일관되고 공정한 평가를 확보한다.
  • RST 프레임워크를 다양한 희소 비율과 네트워크 아키텍처(예: ResNet56 및 ResNet18)에 적응시켜 적용 가능성을 높인다.
  • 반복적 변환의 영향을 분석하기 위해 사이클 수와 희소 수준에 대한 분석을 수행한다.

실험 결과

연구 질문

  • RQ1무작위로 초기화된 밀도 네트워크에서 무작위로 선택된 하위망이 LTH의 웨이팅 티켓과 유사한 성능을 내는 훈련 가능한 구성으로 변환될 수 있는가?
  • RQ2제안된 RST 전략이 사전 훈련이나 반복적인 크기 기반 프루닝 없이도 무작위 하위망이 강력한 일반화 성능을 달성할 수 있는가?
  • RQ3다양한 희소 수준에서 RST의 성능가 GraSP와 같은 기존의 초기화 시 프루닝 방법과 비교해 볼 때 어떻게 되는가?
  • RQ4반복적 변환 사이클과 희소 비율은 변환된 하위망의 최종 성능에 어떤 영향을 미치는가?
  • RQ5RST 전략은 다양한 데이터셋과 네트워크 아키텍처에서 높은 성능 유지를 유지하면서 일반화될 수 있는가?

주요 결과

  • CIFAR-10에서 50% 희소 비율일 때 RST는 상위-1 정확도 92.69% ± 0.13을 기록하여 GraSP(91.72%)를 초월하고 기준 정확도 93.50%에 가까워졌다.
  • CIFAR-100에서는 50% 희소 비율에서 70.18% ± 0.29를 기록하여 GraSP의 67.88%를 뛰어넘었으며, 더 높은 희소 비율 수준에서도 강력한 일반화 능력을 보였다.
  • ResNet18를 사용한 ImageNet 서브셋에서 RST는 70% 희소 비율일 때 상위-1 정확도 76.95%를 기록하여 GraSP의 75.20%를 초월했고, 더 높은 희소 비율 수준에서도 뛰어난 성능을 유지했다.
  • 분석 실험 결과, RST는 1~5회의 반복 사이클 동안 안정적인 성능 유지를 보였으며, 98% 희소 비율일 때조차도 최소한의 성능 저하를 보여, 고희소성에 대한 강건성을 입증했다.
  • LTH보다 훈련 사이클 수가 적어도 희소 네트워크 훈련에서 계산 비용을 줄일 잠재력이 있음을 시사한다.
  • 결과적으로 이중 로또 티켓 가설이 검증되었으며, 정규화와 반복적 피니팅을 통해 무작위 하위망이 고성능 모델로 변환될 수 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.