Skip to main content
QUICK REVIEW

[논문 리뷰] Pruning Neural Networks via Coresets and Convex Geometry: Towards No Assumptions

Murad Tukan, Loay Mualem|arXiv (Cornell University)|2022. 09. 18.
Advanced Neural Network Applications인용 수 6
한 줄 요약

이 논문은 코어셋과 볼록 기하학을 활용하여 데이터에 의존하지 않고 이론적으로 탄탄한 방법으로 딥 네ural 네트워크를 프루닝하는 방법을 제안한다. Löwner 타원체와 Carathéodory 정리를 이용해 데이터나 모델 가중치에 대한 가정 없이 신경망 뉴런의 중요도를 계산한다. 최소한의 정확도 손실로 최신 기술 수준의 압축 성능을 달성하며, 예를 들어 ResNet50/ImageNet에서 62%의 압축률을 기록했고 정확도 손실은 1.09%에 불과하다.

ABSTRACT

Pruning is one of the predominant approaches for compressing deep neural networks (DNNs). Lately, coresets (provable data summarizations) were leveraged for pruning DNNs, adding the advantage of theoretical guarantees on the trade-off between the compression rate and the approximation error. However, coresets in this domain were either data-dependent or generated under restrictive assumptions on both the model's weights and inputs. In real-world scenarios, such assumptions are rarely satisfied, limiting the applicability of coresets. To this end, we suggest a novel and robust framework for computing such coresets under mild assumptions on the model's weights and without any assumption on the training data. The idea is to compute the importance of each neuron in each layer with respect to the output of the following layer. This is achieved by a combination of Löwner ellipsoid and Caratheodory theorem. Our method is simultaneously data-independent, applicable to various networks and datasets (due to the simplified assumptions), and theoretically supported. Experimental results show that our method outperforms existing coreset based neural pruning approaches across a wide range of networks and datasets. For example, our method achieved a $62\%$ compression rate on ResNet50 on ImageNet with $1.09\%$ drop in accuracy.

연구 동기 및 목표

  • 학습 데이터나 모델 가중치 분포에 대한 제한적인 가정에 의존하는 기존 코어셋 기반 프루닝 방법의 한계를 해결한다.
  • 이론적으로 탄탄하면서도 다양한 네트워크와 데이터셋에 적용 가능한 프루닝 프레임워크를 개발한다.
  • 가중치 벡터의 기하적 성질을 통해 뉴런 중요도를 유도함으로써 데이터에 의존하지 않는 프루닝을 가능하게 한다.
  • 높은 압축률과 추론 속도를 유지하면서도 근사 오차에 대한 이론적 보장을 확보한다.

제안 방법

  • 각 레이어의 뉴런을 고차원 공간 상의 점으로 표현하며, 이는 각 뉴런의 가중치 벡터를 의미한다.
  • 뉴런 가중치 벡터의 볼록 껍질을 근사하기 위해 Löwner 타원체를 적용하여 뉴런의 기하적 분포를 포괄한다.
  • Carathéodory 정리를 활용해 다음 레이어의 출력을 근사할 수 있는 소규모 뉴런 집합(코어셋)을 식별한다.
  • 기하적 기여도에 따라 선택된 뉴런에 샘플링 가중치를 할당하여 근사 오차가 유한하게 유지되도록 보장한다.
  • 각 레이어를 독립적으로 코어셋으로 구성함으로써 데이터 의존 없이 종단 간 프루닝을 가능하게 한다.
  • 전체 네트워크의 훈련 및 미세조정 파이프라인에 코어셋 기반 프루닝을 통합하여 성능을 유지한다.

실험 결과

연구 질문

  • RQ1학습 데이터나 모델 가중치 분포에 대한 가정 없이 효과적인 신경망 프루닝을 달성할 수 있는가?
  • RQ2볼록 기하학과 코어셋 이론을 어떻게 활용하여 데이터에 의존하지 않고도 이론적으로 탄탄한 방식으로 뉴런 중요도를 정의할 수 있는가?
  • RQ3기하학적 코어셋을 사용한 프루닝 시 압축률과 정확도 손실 간의 상호 관계는 어떠한가?
  • RQ4다양한 아키텍처에서 기존의 코어셋 기반 프루닝 방법과 비교했을 때, 제안된 방법의 정확도 및 일반화 성능는 어떠한가?

주요 결과

  • 제안된 방법은 ResNet50에 대해 ImageNet에서 62%의 압축률을 기록했고, 상위-1 정확도 손실은 1.09%에 불과하여 이전의 코어셋 기반 방법을 능가한다.
  • 이 방법은 완전히 데이터에 의존하지 않아 학습 데이터나 입력 통계 정보에 접근하지 않아도 프루닝을 수행할 수 있다.
  • 실험 결과 코어셋 구성 과정이 강력한 근사 보장을 유지하며, 코어셋 크기가 증가할수록 평균 덧셈 오차가 감소하는 경향을 보였다.
  • 이 방법이 유도하는 샘플링 분포는 더 긴 尾(꼬리)를 가지며, 높은 영향력을 지닌 뉴런을 선호함을 확인하였으며, [82]와의 비교를 통해 이를 뒷받침한다.
  • 프루닝 이후의 미세조정 과정에서 정확도가 점진적으로 향상되었으며, VGG19/CIFAR10에서 18번째 에포크에 기준선 방법을 초월하는 성능을 기록했다.
  • 이론적 한계보다 훨씬 작은 코어셋 크기에서도 방법이 효과를 유지함으로써 실용적 내구성이 뛰어나다는 것을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.