Skip to main content
QUICK REVIEW

[논문 리뷰] Lottery Tickets on a Data Diet: Finding Initializations with Sparse Trainable Networks

Mansheej Paul, Brett W. Larsen|arXiv (Cornell University)|2022. 06. 02.
Anomaly Detection Techniques and Applications인용 수 4
한 줄 요약

이 논문은 희소 가중치를 가진 학습 가능한 하위망을 찾는 데 있어 반복적 크기 제거(IMP)에서 초기 사전 훈련의 핵심적인 역할을 조사한다. 풀 데이터셋이 아닌 간단한 예제의 소수의 일부만으로도 동일한 수준의 초기화를 얻을 수 있음을 보여주며, 선형 모드 연결성과 같은 손실 경관 특성들이 IMP 성공 여부를 강력하게 예측할 수 있음을 규명한다.

ABSTRACT

A striking observation about iterative magnitude pruning (IMP; Frankle et al. 2020) is that $\unicode{x2014}$ after just a few hundred steps of dense training $\unicode{x2014}$ the method can find a sparse sub-network that can be trained to the same accuracy as the dense network. However, the same does not hold at step 0, i.e. random initialization. In this work, we seek to understand how this early phase of pre-training leads to a good initialization for IMP both through the lens of the data distribution and the loss landscape geometry. Empirically we observe that, holding the number of pre-training iterations constant, training on a small fraction of (randomly chosen) data suffices to obtain an equally good initialization for IMP. We additionally observe that by pre-training only on "easy" training data, we can decrease the number of steps necessary to find a good initialization for IMP compared to training on the full dataset or a randomly chosen subset. Finally, we identify novel properties of the loss landscape of dense networks that are predictive of IMP performance, showing in particular that more examples being linearly mode connected in the dense network correlates well with good initializations for IMP. Combined, these results provide new insight into the role played by the early phase training in IMP.

연구 동기 및 목표

  • 반복적 크기 제거(IMP)에서 성공하기 위해 첫 300단계의 밀도 네트워크 사전 훈련이 필수적인 이유를 이해하는 것.
  • 특히 '쉬운' 예제들로 구성된 작은 훈련 데이터 하위집합이 전체 데이터셋 사전 훈련을 대체할 수 있는지 조사하는 것.
  • IMP 성공 결과를 예측할 수 있는 밀도 네트워크 초기화의 손실 경관 특성들을 규명하는 것.
  • IMP 사전 훈련에서의 데이터 역할과 밀도 훈련에서의 최적화 학습률 워밍업의 역할을 비교하는 것.
  • 희소 네트워크 발견을 위한 최적의 데이터 및 사전 훈련 방식을 규명함으로써 더 효율적인 훈련 전략을 이끌어내는 것.

제안 방법

  • 랜덤으로 선택된 하위집합과 EL2N 점수(예제 난이도)로 필터링된 하위집합을 사용해 밀도 네트워크를 프루닝된 데이터셋에서 사전 훈련한다.
  • 각 사전 훈련 지점에서의 프루닝 및 피니팅 후 테스트 정확도를 측정하여 IMP 성공 여부를 평가한다.
  • 동일한 초기화에서 독립적으로 훈련된 두 네트워크 간의 학습 손실 장벽을 계산하여 손실 경관의 안정성을 평가한다.
  • 다른 데이터 순서에서 훈련된 밀도 네트워크 가중치 간의 선형 모드 연결성을 통해 경관 기하학을 대체 지표로 사용한다.
  • 학습률 워밍업 지속 시간과 데이터 구성(쉬운, 랜덤, 어려운)을 아블레이트하여 밀도 훈련에서의 안정성 평가를 수행한다.
  • 사전 훈련 성능(테스트 정확도)과 손실 경관 특성(학습 손실 장벽, 모드 연결성)을 최종 IMP 성공과 상관관계 분석한다.

실험 결과

연구 질문

  • RQ1특히 '쉬운' 예제들로 구성된 작은 훈련 데이터 하위집합이 전체 데이터셋 사전 훈련을 대체하여 IMP에 동일한 초기화를 제공할 수 있는가?
  • RQ2손실 경관 특성—특히 학습 손실 장벽과 선형 모드 연결성—은 어떻게 IMP 성공 여부를 예측하는가?
  • RQ3쉬운 데이터에서의 사전 훈련은 IMP에 대한 좋은 초기화를 찾는 데 필요한 단계 수를 줄이는가?
  • RQ4IMP 사전 훈련에서의 데이터 역할은 밀도 훈련에서의 학습률 워밍업과 비교해 어떻게 다른가?
  • RQ5밀도 네트워크의 초기 손실 경관에서 기하학적 특성들이 이후 희소 네트워크 성능과 강하게 상관관계를 가지는가?

주요 결과

  • 랜덤으로 선택된 데이터의 10%만으로 몇 백 단계 동안 훈련해도, 전체 데이터셋 사전 훈련과 동일한 수준의 테스트 정확도를 보이는 희소 하위망을 IMP가 발견할 수 있는 초기화를 제공한다.
  • EL2N 점수로 선별된 가장 쉬운 예제들에서의 사전 훈련은 랜덤 또는 전체 데이터 하위집합보다 IMP에 대한 좋은 초기화를 찾는 데 필요한 사전 훈련 단계 수를 줄인다.
  • 동일한 초기화에서 독립적으로 훈련된 두 네트워크 간의 학습 손실 장벽은 사전 훈련 테스트 정확도보다 최종 IMP 성능과 더 강한 상관관계를 보인다.
  • 밀도 네트워크의 손실 경관에서 개별 예제에 대한 선형 모드 연결성은 IMP 성공 여부를 예측할 수 있다: 높은 연결성일수록 더 나은 희소 하위망 성능을 보인다.
  • IMP 사전 훈련과는 달리, 학습률 워밍업 기간 동안 쉬운 데이터를 사용할 경우, 특히 긴 워밍업 지속 시간에서 훈련 안정성과 성능이 악화된다.
  • 밀도 네트워크의 초기 손실 경관 기하학—특히 학습 손실 장벽과 예제 수준의 모드 연결성—은 사전 훈련 정확도만으로는 예측력이 떨어지며, IMP 성공 여부에 대해 더 강력한 예측력을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.