Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Understanding Iterative Magnitude Pruning: Why Lottery Tickets Win

Jaron Maene, Mingxiao Li|arXiv (Cornell University)|2021. 06. 13.
Domain Adaptation and Few-Shot Learning참고 문헌 27인용 수 5
한 줄 요약

이 논문은 대규모 시각 모델이 대용량 배치 미니배치 경사하강법를 사용함으로써 초기화 상태에서 로또 티켓 프루닝을 달성할 수 있음을 보여주며, 이는 훈련을 안정화시키고 선형 모드 연결성을 가능하게 한다. 이는 재흡수 티켓 해석(RTI)에 강력한 경험적 근거를 제공하며, 반복적 크기 프루닝이 프루닝 라운드 간 유사한 최적화 지점으로 재학습함을 보여주어, 로또 티켓이 이전의 밀도 높은 훈련에 의존하며 데이터 독립적 초기화로는 찾을 수 없다는 것을 시사한다.

ABSTRACT

The lottery ticket hypothesis states that sparse subnetworks exist in randomly initialized dense networks that can be trained to the same accuracy as the dense network they reside in. However, the subsequent work has failed to replicate this on large-scale models and required rewinding to an early stable state instead of initialization. We show that by using a training method that is stable with respect to linear mode connectivity, large networks can also be entirely rewound to initialization. Our subsequent experiments on common vision tasks give strong credence to the hypothesis in Evci et al. (2020b) that lottery tickets simply retrain to the same regions (although not necessarily to the same basin). These results imply that existing lottery tickets could not have been found without the preceding dense training by iterative magnitude pruning, raising doubts about the use of the lottery ticket hypothesis.

연구 동기 및 목표

  • 로또 티켓이 초기 훈련 상태로 되돌리지 않고도 대규모 시각 모델에서 찾을 수 있는지 조사하는 것.
  • 재흡수 티켓 해석(RTI)을 테스트하는 것. RTI는 프루닝 라운드 간 유사한 최적화 지점으로 재학습한다는 가정을 둔다.
  • IMP의 성공이 랜덤 초기화뿐 아니라 동일한 솔루션 영역으로 재학습하는 데 기인하는지 판단하는 것.
  • 훈련 안정성과 선형 모드 연결성이 로또 티켓 발견을 가능하게 하는 데 미치는 영향을 평가하는 것.
  • 로또 티켓이 이전의 밀도 높은 훈련에 의존하는지 분석함으로써 데이터 독립적 프루닝의 가능성 여부를 평가하는 것.

제안 방법

  • 대용량 배치 확률적 경사하강법를 사용해 훈련을 안정화시켜, 되돌리지 않고도 선형 모드 연결성을 달성하는 것.
  • 각 프루닝 라운드 이후 초기 값으로 가중치를 재설정하는 반복적 크기 프루닝(IMP)을 사용하는 것.
  • 이전에 발견된 최적화 지점을 밀어내기 위해 손실 함수를 수정하여 IMP가 RTI에 의존하는지의 인과관계를 테스트하는 것.
  • 프루닝 라운드 간 가중치 벡터 간의 각도 거리를 측정하여 솔루션 유사성을 정량화하는 것.
  • 다른 훈련 경로에서 유도된 솔루션 간의 선형 모드 연결성을 평가하여 안정성을 평가하는 것.
  • 손실 함수에 밀어내기 기능을 추가하거나 제거한 경우의 IMP 성능을 비교하여 솔루션 유사성의 역할을 분리하는 것.

실험 결과

연구 질문

  • RQ1로또 티켓은 초기 훈련 상태로 되돌리지 않고도 대규모 시각 모델에서 발견될 수 있는가?
  • RQ2반복적 크기 프루닝이 프루닝 라운드 간 유사한 최적화 지점으로 재학습함으로써 성공하는가? (재흡수 티켓 해석(RTI)에 따름)
  • RQ3선형 모드 연결성으로 측정된 훈련 안정성이 로또 티켓 발견 능력에 어떻게 영향을 주는가?
  • RQ4프루닝 희박성과 프루닝 라운드 간 솔루션의 유사성 간의 관계는 무엇인가?
  • RQ5로또 티켓은 데이터 독립적 초기화를 통해 찾을 수 있는가, 아니면 이전의 밀도 높은 훈련이 필수적인가?

주요 결과

  • 대용량 배치 훈련은 훈련을 충분히 안정화시켜 대규모 시각 모델에서 초기화 상태에서 로또 티켓을 찾을 수 있게 하며, 되돌리기 위한 필요성을 제거한다.
  • 재흡수 티켓 해석(RTI)은 강력하게 지지된다: IMP는 특히 중간 수준의 희박성에서 프루닝 라운드 간 유사한 솔루션 영역으로 재학습한다.
  • 이전에 발견된 최적화 지점을 밀어내기 위해 손실 함수를 수정하면 IMP는 로또 티켓을 찾는 능력을 상실하지만, 랜덤 재초기화는 영향을 받지 않는다.
  • 안정된 훈련 하에서 프루닝 라운드 간 가중치 벡터 간의 각도 거리는 일관되게 작으며, 이는 강한 솔루션 유사성을 시사한다.
  • 매우 낮은 및 높은 희박성에서의 솔루션은 반드시 같은 손실 골짜기 안에 있지 않으며, 이는 RTI가 중간 수준의 희박성에서 더 강하게 성립함을 시사한다.
  • 결과적으로 데이터 독립적 프루닝 접근법은 성공할 가능성이 낮아 보이며, 로또 티켓이 이전의 밀도 높은 모델의 솔루션에 의존하기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.