Skip to main content
QUICK REVIEW

[논문 리뷰] Pruning Randomly Initialized Neural Networks with Iterative Randomization

Daiki Chijiwa, Shin’ya Yamaguchi|arXiv (Cornell University)|2021. 06. 17.
Advanced Neural Network Applications참고 문헌 30인용 수 5
한 줄 요약

이 논문은 반복적으로 삭제된 가중치를 재난수화하는 방식인 IteRand를 제안한다. 이는 무작위로 초기화된 신경망을 더 효율적으로 양자화함으로써 매개변수 효율성을 크게 향상시킨다. 이론적으로 IteRand는 승리 티켓 탐색에 필요한 네트워크 너비를 완전히 훈련된 네트워크 수준의 상수 요인 내로 줄이며, 이는 이전 연구에서 지적한 로그형 넓이 페널티를 극복한다. 실험적으로 IteRand는 CIFAR-10, ImageNet, IMDB에서 양자화 전용 설정에서 최고 성능을 기록한다.

ABSTRACT

Pruning the weights of randomly initialized neural networks plays an important role in the context of lottery ticket hypothesis. Ramanujan et al. (2020) empirically showed that only pruning the weights can achieve remarkable performance instead of optimizing the weight values. However, to achieve the same level of performance as the weight optimization, the pruning approach requires more parameters in the networks before pruning and thus more memory space. To overcome this parameter inefficiency, we introduce a novel framework to prune randomly initialized neural networks with iteratively randomizing weight values (IteRand). Theoretically, we prove an approximation theorem in our framework, which indicates that the randomizing operations are provably effective to reduce the required number of the parameters. We also empirically demonstrate the parameter efficiency in multiple experiments on CIFAR-10 and ImageNet. The code is available at: https://github.com/dchiji-ntt/iterand

연구 동기 및 목표

  • 가중치 양자화 최적화의 매개변수 비효율성을 해결한다. 이는 동일한 정확도를 달성하기 위해 가중치 최적화보다 훨씬 넓은 네트워크가 필요로 하는 문제를 다룬다.
  • Pensia 등(2020)의 이전 연구에서 지적한 바와 같이, 양자화 전용 방법이 훈련 기반 방법보다 넓은 네트워크가 필요로 하는 로그형 넓이 페널티를 극복한다.
  • 메모리 사용량을 늘리지 않고도 양자화 전용 최적화의 효과를 향상시키는 방법을 개발한다.
  • 반복적 난수화가 승리 티켓 탐색에 필요한 네트워크 너비를 증명 가능하게 줄일 수 있음을 입증한다.
  • 시각 및 자연어 처리 작업을 포함한 다양한 아키텍처와 데이터셋에서 엄격한 메모리 제약 조건 하에서 방법의 성능을 검증한다.

제안 방법

  • 반복적 난수화 도입: 각 양자화 단계 이후에 삭제된 연결의 가중치를 재난수화하여 추가 메모리 없이 더 넓은 네트워크를 시뮬레이션한다.
  • 활성 가중치를 추적하기 위해 이진 마스크를 유지하면서, 각 반복 단계에서 삭제된 가중치의 값을 새로운 난수 값으로 재초기화한다.
  • 가중치의 중요도를 식별하기 위해 미분 가능 점수 기반 마스크 최적화(Edge-Popup 유사)를 사용한 후, 반복적인 양자화와 난수화를 수행한다.
  • 고정된 수의 난수화 횟수를 각 훈련 단계에 적용하여 안정성을 확보하면서, 여러 훈련 루프에 걸쳐 난수화 과정을 적용한다.
  • 수렴성과 성능 향상을 보장하기 위해 하이퍼파라미터 $K_{\text{per}}$와 $r$을 통해 난수화 빈도와 크기를 제어한다.
  • 기존의 양자화 프레임워크(예: OpenLTH)에 통합하여 IMP 및 Edge-Popup와의 공정한 비교를 가능하게 한다.

실험 결과

연구 질문

  • RQ1반복적 난수화가 양자화 전용 최적화에서 승리 티켓 탐색에 필요한 네트워크 너비를 완전히 훈련된 네트워크 수준의 상수 요인 내로 줄일 수 있는가?
  • RQ2고정된 메모리 제약 조건 하에서 반복적 난수화가 Edge-Popup 및 IMP보다 양자화 전용 방법의 정확도를 향상시키는가?
  • RQ3VGG, ResNet, WideResNet, LSTM 등의 다양한 아키텍처와 CIFAR-10, ImageNet, IMDB 등의 다양한 데이터셋에서 이 방법은 어떻게 성능을 내는가?
  • RQ4난수화 빈도와 크기 등의 하이퍼파라미터 및 다양한 희박도 수준에 대해 IteRand의 성능 향상이 얼마나 강인한가?
  • RQ5반복적 난수화의 이론적 이점이 시각 및 자연어 처리 작업 전반에서 실험적으로 검증될 수 있는가?

주요 결과

  • IteRand는 이전 연구에서 지적한 로그형 넓이 페널티를 극복하여 승리 티켓 탐색에 필요한 네트워크 너비를 완전히 훈련된 네트워크 수준의 상수 요인 내로 줄였다.
  • CIFAR-10에서 IteRand는 너비 요인 ρ=1.0일 때 ResNet18으로 92.47%의 정확도를 달성했으며, Edge-Popup는 이 성능을 달성하기 위해 ρ=1.3이 필요했다.
  • ImageNet에서 IteRand는 WideResNet-50-2(68.8M 파라미터)를 사용해 73.57%의 Top-1 정확도를 기록했고, 동일한 파라미터 예산 하에서 Edge-Popup(71.59%)를 능가했다.
  • IMDB 텍스트 분류 작업에서 IteRand는 LSTM으로 88.44%의 정확도, BiLSTM으로 88.51%의 정확도를 기록했으며, Edge-Popup(88.16% 및 88.34%)와 SGD(87.39% 및 87.62%)를 모두 뛰어넘었다.
  • 이 방법은 다양한 아키텍처와 작업에서 효과적이며, 메모리 사용량을 늘리지 않고도 일관된 정확도 향상을 보였다.
  • 반복적 난수화 과정을 통해 양자화 전용 최적화는 재훈련 기반 방법(예: IMP)의 성능에 도달할 수 있었고, 엄격한 메모리 제약 조건 하에서도 성능 향상을 이룰 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.