Skip to main content
QUICK REVIEW

[논문 리뷰] Why Random Pruning Is All We Need to Start Sparse

Advait Gadhikar, Sohum Mukherjee|arXiv (Cornell University)|2022. 10. 05.
Music and Audio Processing인용 수 4
한 줄 요약

이 논문은 무작위로 잘라낸 신경망—특히 무작위 마스크(ER)를 가진 네트워크—가 희박 모델 훈련을 위한 효과적이고 계산 비용이 저렴한 초기화로 기능할 수 있음을 보여준다. 이는 희박 모델의 성능이 밀도가 높은 네트워크와 동등하거나 그 이상이며, 최신의 러트 티켓 프루닝 수준에 도달한다. 이론적으로는, 목표 네트워크를 근사하기 위해 역 희박성의 로그적 요인만큼 넓은 무작위 네트워크가 존재할 경우, 어떤 목표 네트워크라도 근사할 수 있음을 증명한다. 이는 밀도 없는 초기화를 피하고 계산 비용을 줄이는 '희박에서 희박으로' 훈련이 가능하게 한다.

ABSTRACT

Random masks define surprisingly effective sparse neural network models, as has been shown empirically. The resulting sparse networks can often compete with dense architectures and state-of-the-art lottery ticket pruning algorithms, even though they do not rely on computationally expensive prune-train iterations and can be drawn initially without significant computational overhead. We offer a theoretical explanation of how random masks can approximate arbitrary target networks if they are wider by a logarithmic factor in the inverse sparsity $1 / \log(1/ ext{sparsity})$. This overparameterization factor is necessary at least for 3-layer random networks, which elucidates the observed degrading performance of random networks at higher sparsity. At moderate to high sparsity levels, however, our results imply that sparser networks are contained within random source networks so that any dense-to-sparse training scheme can be turned into a computationally more efficient sparse-to-sparse one by constraining the search to a fixed random mask. We demonstrate the feasibility of this approach in experiments for different pruning methods and propose particularly effective choices of initial layer-wise sparsity ratios of the random source network. As a special case, we show theoretically and experimentally that random source networks also contain strong lottery tickets.

연구 동기 및 목표

  • 반복적 프루닝이나 재훈련 없이도 초기화 단계에서의 무작위 프루닝이 실질적으로 놀라운 성능을 내는 이유를 설명하기 위해.
  • 통제된 과다 파rameter화 조건 하에서 무작위 희박 네트워크의 보편 근사 능력에 대한 이론적 기반을 제공하기 위해.
  • 밀도 있는 네트워크에서 시작하는 것과는 달리, 무작은 잘라낸 네트워크에서 시작하는 '희박에서 희박으로' 훈련이 밀도 있는 네트워크에서 시작하는 것과 동일하거나 더 높은 성능을 달성할 수 있음을 보여주기 위해.
  • 강력한 러트 티켓(SLT)이 희박한 무작위 소스 네트워크 내에 존재하며, 이를 효율적으로 탐색할 수 있음을 보여주기 위해.
  • 성능과 효율성을 극대화하기 위해 무작위 소스 네트워크에 최적의 계층별 희박 비율을 제안하기 위해.

제안 방법

  • 이론적 분석을 통해 3층 무작위 네트워크가 목표 네트워크를 근사할 수 있음을 증명한다. 이때 네트워크의 폭이 목표 네트워크보다 O(1/log(1/sparsity))의 요인만큼 넓어야 하며, 이는 필수적인 과다 파rameter화 조건을 제공한다.
  • 1층 히든 레이어를 가진 무작위 네트워크의 경우, 보편 근사에 필요한 최소 폭을 유도하여, 로그적 과다 파arameter화가 보편 근사에 필수적임을 보여준다.
  • 희박에서 희박으로 훈련을 제안한다: 고정된 무작위 희박 마스크(ER)로 초기화하고, IMP나 연속적 희박화와 같은 프루닝 알고리즘을 적용한다.
  • 성능과 효율성을 향상시키기 위해 초기 무작위 네트워크에 계층별 희박 비율을 도입하며, 다양한 아키텍처와 데이터셋에서 검증되었다.
  • 반복적 크기 기반 프루닝(IMP) 및 기타 방법을 사용하여 ImageNet, GCNs, 알고리즘 데이터, 표형 데이터에서 실험적으로 방법을 평가한다.
  • 강력한 러트 티켓(SLT)이 희박한 무작위 네트워크 내에 존재하며, 이를 통해 초기화가 없는 훈련이 가능함을 보여준다.

실험 결과

연구 질문

  • RQ1무작위 희박 네트워크가 어떤 목표 네트워크를 근사할 수 있으며, 어떤 정도의 과다 파arameter화가 필요할까?
  • RQ2왜 초기화 단계에서의 무작위 프루닝이 더 복잡한 프루닝 기법보다 실질적으로 더 우수한 성능을 내는가?
  • RQ3밀도 있는 네트워크에서 시작하지 않고도 희박 모델을 효과적으로 훈련시킬 수 있는가?
  • RQ4강력한 러트 티켓(SLT)이 희박한 무작위 소스 네트워크 내에 존재하며, 이를 효율적으로 찾을 수 있는가?
  • RQ5성능과 효율성을 극대화하기 위해 초기 무작위 네트워크에 최적의 계층별 희박 비율은 무엇인가?

주요 결과

  • O(1/log(1/sparsity))의 요인만큼 넓은 무작위 네트워크는 어떤 목표 네트워크라도 근사할 수 있으며, 이는 무작위 프루닝의 효과성에 대한 이론적 근거를 제공한다.
  • 필요한 과다 파arameter화 조건은 3층 무작위 네트워크에 대해 필수적이며, 매우 높은 희박성 수준에서 성능 저하가 발생하는 이유를 설명한다.
  • 고정된 무작위 마스크를 사용한 희박에서 희박으로 훈련은 CIFAR-10, ImageNet, GCNs에서 밀도 있는 네트워크에서 시작하는 것과 동일하거나 더 높은 성능을 달성한다.
  • ResNet-50을 사용한 ImageNet 실험에서, 50% 희박한 무작위 네트워크에서 시작해도 80% 희박 모델을 71.73% 정확도로 훈련시킬 수 있었으며, 밀도 있는 초기화와 동일한 성능을 달성했다.
  • GCN 실험에서는 40% 희박한 초기 네트워크에서 시작해 70% 희박 모델을 81.9% 정확도로 훈련시켰으며, 밀도 있는 초기화의 83.33%에 비해 약간 낮은 성능이었다.
  • 알고리즘 데이터와 표형 데이터에서, 희박에서 희박으로 훈련은 밀도 있는 네트워크에서 시작하는 것과 동일한 성능을 달성했으며, 다양한 도메인에 걸쳐 강건함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.