Skip to main content
QUICK REVIEW

[논문 리뷰] On Iterative Neural Network Pruning, Reinitialization, and the Similarity of Masks

M. Paganini, Jessica Zosa Forde|arXiv (Cornell University)|2020. 01. 14.
Domain Adaptation and Few-Shot Learning참고 문헌 40인용 수 4
한 줄 요약

이 논문은 가중치 재설정을 동반한 반복적 신경망 프루닝을 조사하여, 프루닝 기법에 따라 다양한 고성능 희소 서브넷워크(워닝 티켓)가 존재할 수 있음을 보여준다. 또한, 크기 기반 비정형 프루닝과 함께 재설정을 적용할 경우, 정형 프루닝과 유사한 연결 구조를 생성하며, 특히 후기 재설정 없이도 가중치 안정성이 성능과 강하게 상관됨을 입증한다.

ABSTRACT

We examine how recently documented, fundamental phenomena in deep learning models subject to pruning are affected by changes in the pruning procedure. Specifically, we analyze differences in the connectivity structure and learning dynamics of pruned models found through a set of common iterative pruning techniques, to address questions of uniqueness of trainable, high-sparsity sub-networks, and their dependence on the chosen pruning method. In convolutional layers, we document the emergence of structure induced by magnitude-based unstructured pruning in conjunction with weight rewinding that resembles the effects of structured pruning. We also show empirical evidence that weight stability can be automatically achieved through apposite pruning techniques.

연구 동기 및 목표

  • 동일한 과다 매개변수화된 네트워크 내에서 프루닝 방법과 무관하게 다수의 고성능 희소 서브넷워크(워닝 티켓)가 존재하는지 조사하기.
  • 다양한 반복적 프루닝 기법이 프루닝된 모델의 연결 구조와 학습 동역학에 미치는 영향을 분석하기.
  • 프루닝된 네트워크에서 가중치 재설정이 파인튜닝 대비 구조적 및 성능적 이점이 있는지 평가하기.
  • 반복적 프루닝에서의 가중치 안정성이 성공에 기여하는 역할과 모델 성능과의 상관관계를 평가하기.
  • 비정형 대비 정형 프루닝, 무작위 대비 크기 기반 프루닝의 효과를 비교하여 학습 가능한 희소 서브넷워크를 식별하는 데의 효율성 평가하기.

제안 방법

  • MNIST 및 CIFAR-10 데이터셋을 사용하여 소형 아키텍처(LeNet, AlexNet, VGG-11)에서 반복적 프루닝 기법을 실증적으로 비교한다.
  • 각 프루닝 반복 단계에서 초기 가중치 분포를 유지하기 위해 크기 기반 비정형 프루닝에 가중치 재설정을 적용한다.
  • 입력 채널을 따라 정형 프루닝을 적용하여 비정형 프루닝 + 재설정과의 연결 구조를 비교한다.
  • 연속된 프루닝 반복 사이의 가중치 값 차이를 계산하여 가중치 안정성을 측정한다.
  • 테스트 정확도를 통해 성능을 평가하고, 다양한 프루닝 기법 간 일반화 행동을 분석한다.
  • 다양한 프루닝 절차 간 프루닝된 네트워크 마스크(즉, 연결 구조)의 유사성을 시각화하고 비교한다.

실험 결과

연구 질문

  • RQ1다른 프루닝 기법이 동일한 과다 매개변수화된 네트워크 내에서 고유한 고성능 서브넷워크(즉, 다수의 워닝 티켓)를 생성하는가?
  • RQ2각 프루닝 반복 후 가중치 재설정이 입력 특징 선택 측면에서 정형 프루닝과 유사한 연결 구조를 생성하는가?
  • RQ3프루닝 방법의 선택이 최종 마스크의 구조적 유사성과 프루닝 중 가중치의 안정성에 어떤 영향을 미치는가?
  • RQ4프루닝 중 가중치 안정성과 최종 모델 성능 사이에 상관관계가 있는가?
  • RQ5다른 프루닝 기법이 보류된 테스트 세트에서 다른 오류를 내는 모델을 생성하는가? 이는 앙상블 방법의 유용성을 시사한다.

주요 결과

  • 동일한 과다 매개변수화된 네트워크 내에서 프루닝 기법에 따라 다양한 고성능 희소 서브넷워크(워닝 티켓)가 존재할 수 있으며, 이는 워닝 티켓의 유일성에 대한 도전이 된다.
  • 크기 기반 비정형 프루닝에 가중치 재설정을 적용할 경우, 입력 차원을 따라 정형 프루닝과 유사한 연결 구조를 생성하며, 이는 입력 특징 선택 효과를 시사한다.
  • 프루닝 중 가중치 안정성이 최종 모델 성능과 강하게 상관되며, 후기 재설정 없이도 적절한 프루닝 기법을 통해 이를 달성할 수 있다.
  • '하이브리드' 프루닝 방법(정형 및 비정형 프루닝을 조합)이 가장 높은 가중치 안정성을 보이며, 프루닝 반복 간 가중치의 순서 변화가 최소화된다.
  • 무작위 정형 프루닝이 무작위 비정형 프루닝보다 성능이 뛰어나며, 네트워크가 무작위 채널/유닛 제거보다는 무작위 연결 제거에 더 강건함을 시사한다.
  • 다른 프루닝 기법이 테스트 세트에서 다른 오류를 내는 모델을 생성하며, 이는 이러한 모델을 앙상블하여 일반화 성능을 향상시킬 수 있음을 암시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.