[논문 리뷰] DropNet: Reducing Neural Network Complexity via Iterative Pruning
DropNet는 모든 훈련 샘플을 통해 평균 후활성화 값이 가장 낮은 노드/필터를 영구적으로 제거함으로써 신경망 복잡도를 감소시키는 반복적 프루닝 방법이다. 이 방법은 다층퍼셉트론(MLP)과 컨볼루션 네트워크(CNN)에서 최대 90%의 파라미터 감소를 달성하면서 정확도 손실를 최소화하며, 특수한 가중치 초기화가 필요 없이 오라클 프루닝 방법과 동등한 성능을 보인다.
Modern deep neural networks require a significant amount of computing time and power to train and deploy, which limits their usage on edge devices. Inspired by the iterative weight pruning in the Lottery Ticket Hypothesis, we propose DropNet, an iterative pruning method which prunes nodes/filters to reduce network complexity. DropNet iteratively removes nodes/filters with the lowest average post-activation value across all training samples. Empirically, we show that DropNet is robust across diverse scenarios, including MLPs and CNNs using the MNIST, CIFAR-10 and Tiny ImageNet datasets. We show that up to 90% of the nodes/filters can be removed without any significant loss of accuracy. The final pruned network performs well even with reinitialization of the weights and biases. DropNet also has similar accuracy to an oracle which greedily removes nodes/filters one at a time to minimise training loss, highlighting its effectiveness.
연구 동기 및 목표
- 엣지 디바이스에 배포하기 위한 딥 네트워크의 계산 및 메모리 오버헤드를 줄이기 위해.
- 완전 연결 및 컨볼루션 네트워크 모두에 적용 가능한 강력하고 데이터 기반의 프루닝 방법을 개발하기 위해.
- 프루닝된 모델에서 특수한 가중치 초기화(예: 로또티켓 스타일 재초기화)가 필요 없도록 하기 위해.
- 훈련 손실을 최소화하는 데에 집중하는 탐욕적 프루닝 방법과 동등한 프루닝 성능을 달성하기 위해.
- 표준 머신러닝 라이브러리와 하드웨어를 사용하여 프루닝된 모델을 실용적으로 배포할 수 있도록 하기 위해.
제안 방법
- DropNet는 모든 훈련 샘플을 통해 평균 후활성화 값이 가장 낮은 노드/필터를 전역적으로 또는 계층별로 반복적으로 제거한다.
- 프루닝 결정은 검증 세트가 아닌 전체 훈련 세트에서 각 노드/필터의 평균 활성화 크기를 기반으로 한다.
- 각 프루닝 단계 이후, 나머지 네트워크는 원래의 로또티켓 초기화가 아닌 무작위 가중치와 절편으로 재초기화된다.
- 알고리즘은 프루닝된 네트워크를 훈련하고, 활성화 통계를 기반으로 다음 프루닝 대상 노드/필터를 식별하는 것을 번갈아 수행한다.
- 두 가지 프루닝 메트릭이 평가되었으며, 'minimum'(전역 프루닝)와 'minimum_layer'(계층별 프루닝)이며, 후자는 더 깊은 모델에서 더 우수한 성능을 보였다.
- 이 방법은 MNIST, CIFAR-10, Tiny ImageNet에서 완전 연결 네트워크(MLP)와 컨볼루션 네트워크(CNN) 모두에 적용되었다.
실험 결과
연구 질문
- RQ1평균 후활성화 값에 기반한 반복적 프루닝이 네트워크 복잡도를 감소시키면서도 높은 정확도를 달성할 수 있는가?
- RQ2DropNet는 로또티켓 스타일의 가중치 재초기화가 필요 없이도 성능을 유지하는가?
- RQ3DropNet의 성능은 훈련 손실을 최소화하는 데에 집중하는 오라클 프루닝 방법과 어떻게 비교되는가?
- RQ4더 깊은 아키텍처인 ResNet18과 VGG19에서 계층별 프루닝(mostly_layer)이 전역 프루닝(minimum)보다 우수한가?
- RQ5DropNet는 Tiny ImageNet과 같은 다양한 아키텍처와 데이터셋에 효과적으로 적용될 수 있는가?
주요 결과
- DropNet는 MNIST, CIFAR-10, Tiny ImageNet에서 MLP와 CNN에서 최대 90%의 노드/필터 감소를 달성하면서 정확도 저하를 최소화한다.
- 무작위 가중치 초기화로 훈련된 프루닝된 모델의 성능이 원래 로또티켓 초기화로 훈련된 모델과 동등하여 특수한 초기화가 필요하지 않음을 시사한다.
- DropNet의 성능은 훈련 손실을 최소화하는 데에 집중하는 오라클 프루닝 방법과 유사하다.
- ResNet18과 VGG19와 같은 더 깊은 모델에서 계층별 프루닝(mostly_layer)이 전역 프루닝(minimum)보다 우수한 성능을 보이며, 더 깊은 네트워크에서는 계층별 활성화 통계가 중요하다는 것을 시사한다.
- 한 번의 반복에서 더 큰 비율(p=0.5 또는 0.9)로 프루닝을 수행할 경우 성능이 열악해지며, 이는 더 작은 프루닝 단위(p=0.2)가 더 효과적임을 시사한다.
- 동일한 프루닝 수준에서 APoZ 메트릭보다 정확도와 강건성 면에서 우수한 성능을 보이며, 데이터 기반 프루닝 기준으로서 DropNet의 열등성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.