Skip to main content
QUICK REVIEW

[논문 리뷰] Rigging the Lottery: Making All Tickets Winners

Utku Evci, Trevor Gale|arXiv (Cornell University)|2019. 11. 25.
Sports Analytics and Performance참고 문헌 48인용 수 120
한 줄 요약

RigL은 매개변수 및 FLOP 예산을 고정한 채, 학습 중 토폴로지를 동적으로 업데이트하여 크기 기반 드롭과 기울기 가이드 성장을 통해 희소 신경망을 훈련시키고, 이전의 조밀-에서-희소 방법들보다 더 낮은 계산으로 더 높은 정확도를 달성합니다.

ABSTRACT

Many applications require sparse neural networks due to space or inference time restrictions. There is a large body of work on training dense networks to yield sparse networks for inference, but this limits the size of the largest trainable sparse model to that of the largest trainable dense model. In this paper we introduce a method to train sparse neural networks with a fixed parameter count and a fixed computational cost throughout training, without sacrificing accuracy relative to existing dense-to-sparse training methods. Our method updates the topology of the sparse network during training by using parameter magnitudes and infrequent gradient calculations. We show that this approach requires fewer floating-point operations (FLOPs) to achieve a given level of accuracy compared to prior techniques. We demonstrate state-of-the-art sparse training results on a variety of networks and datasets, including ResNet-50, MobileNets on Imagenet-2012, and RNNs on WikiText-103. Finally, we provide some insights into why allowing the topology to change during the optimization can overcome local minima encountered when the topology remains static. Code used in our work can be found in github.com/google-research/rigl.

연구 동기 및 목표

  • 자원 제약하에서 배치를 위한 효율적인 희소 신경망의 필요성을 자극한다.
  • 고정된 매개변수 수와 FLOP 예산을 유지하면서 정확도를 향상시키는 학습 알고리즘을 개발한다.
  • 학습 중 토폴로지의 변화가 로컬 미니마를 탈출하고 최적화를 개선하는 데 어떤 도움이 되는지 조사한다.

제안 방법

  • 고정된 희소성 분포를 가진 임의의 희소 네트워크에서 시작한다.
  • 가장 작은 크기 정보를 가진 연결을 주기적으로 제거하고, 큰 그래디언트를 가진 새로운 연결로 확장한다.
  • 성장 결정은 손실 증가를 최소화하기 위해 비활성 연결 중 상위-k 그래디언트에 기초한다.
  • 네트워크 밀도에 비례하는 총 FLOPs를 고정하고 희소성 분포(Uniform, ERK, ERK-Kernel)를 통해 선택 가능한 FLOPs를 허용하는 스케줄을 사용한다.
  • RigL을 Vision(ResNet-50, MobileNets) 및 Language(WikiText-103)에서 기존의 희소 학습 방법 및 조밀-에서-희소 기준선과 비교한다.

실험 결과

연구 질문

  • RQ1매우 제한된 매개변수 예산으로 희소 네트워크를 처음부터 학습시켜도 조밀-에서-희소 방법보다 성능이 우수한가?
  • RQ2학습 중 토폴로지를 변화시키는 것이 정적 희소나 무작위 성장을 넘어 최적화와 최종 정확도를 향상시키는가?
  • RQ3주어진 FLOP 예산에서 아키텍처와 작업에 따라 어떤 희소성 분포와 업데이트 스케줄이 정확도를 최대화하는가?
  • RQ4RigL은 계산 효율성과 최종 성능 측면에서 크기 기반 가지치기 기반 방법과 어떻게 비교되는가?

주요 결과

  • RigL은 이미지넷-2012에서 ResNet-50 및 MobileNets에 대해 유사하거나 더 낮은 학습 FLOPs에서 이전의 조밀-에서-희소 방법보다 더 높은 정확도를 달성합니다.
  • ERK 희소성에서 RigL은 ResNet-50에서 96.5% 희소도에서 Top-1 72.75%를 달성하며, 이전 연구의 확장된 크기 기반 가지치기를 능가합니다.
  • RigL은 다수의 희소도 수준과 데이터세트에서 Static, SET, SNFS, SNIP 및 일부 가지치기 기준선보다 뛰어나며, 종종 훨씬 적은 FLOPs를 사용합니다.
  • 동적 연결성(그래디언트에 의해 이끄는 성장)은 정적 희소 학습이 만나는 로컬 미니마를 탈피하도록 도와주며, 손실 지형과 최종 정확도를 향상시킵니다.
  • RigL은 유사한 매개변수 예산에서 Dense 기준선 대비 상당한 성능 향상을 가진 더 넓은 희소 모델(Big-Sparse) 학습을 가능하게 합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.