Skip to main content
QUICK REVIEW

[논문 리뷰] Model compression as constrained optimization, with application to neural nets. Part V: combining compressions

Miguel Á. Carreira-Perpiñán, Yerlan Idelbayev|arXiv (Cornell University)|2021. 07. 09.
Neural Networks and Applications참고 문헌 55인용 수 5
한 줄 요약

이 논문은 저랭크 근사, 프루닝, 양자화와 같은 다수의 모델 압축 기법을 조합하는 제약 최적화 프레임워크를 제안한다. 이는 가중치 행렬을 별도로 압축된 구성요소들의 덧셈으로 표현함으로써 이루어지며, 이러한 구성요소들을 동시에 최적화함으로써 정확도 손실을 최소화하면서도 뛰어난 압축 비율을 달성한다. 예를 들어, ResNet과 AlexNet을 1bit per weight로 압축해도 정확도 저하가 발생하지 않으며, VGG는 저랭크와 프루닝 조합에서 더 큰 이점을 얻는다.

ABSTRACT

Model compression is generally performed by using quantization, low-rank approximation or pruning, for which various algorithms have been researched in recent years. One fundamental question is: what types of compression work better for a given model? Or even better: can we improve by combining compressions in a suitable way? We formulate this generally as a problem of optimizing the loss but where the weights are constrained to equal an additive combination of separately compressed parts; and we give an algorithm to learn the corresponding parts' parameters. Experimentally with deep neural nets, we observe that 1) we can find significantly better models in the error-compression space, indicating that different compression types have complementary benefits, and 2) the best type of combination depends exquisitely on the type of neural net. For example, we can compress ResNets and AlexNet using only 1 bit per weight without error degradation at the cost of adding a few floating point weights. However, VGG nets can be better compressed by combining low-rank with a few floating point weights.

연구 동기 및 목표

  • 신경망 압축 기법을 최적으로 선택하는 데 도전하는 문제를 해결하기 위해, 개별 기법이 상호보완적 강점을 완전히 활용하지 못할 수 있다는 점을 고려한다.
  • 순차적이거나 별개로 적용하는 것이 아니라, 다수의 압축 기법을 통합하여 동시에 최적화할 수 있는 통합 프레임워크를 개발한다.
  • 압축 유형을 덧셈 분해를 통해 조합할 경우, 개별 기법보다 모델 크기, 추론 속도, 정확도 간의 더 나은 트레이드오프를 달성할 수 있는지 탐색한다.
  • ResNet, AlexNet, VGG와 같은 다양한 아키텍처에서 복합 압축의 효과를 실증적으로 평가하여 아키텍처별 최적의 조합을 규명한다.

제안 방법

  • 원본 가중치 행렬를 W = W₁ + W₂ + W₃와 같이 구성요소의 합으로 분해함으로써 모델 압축을 제약 최적화 문제로 공식화한다. 각 구성요소는 서로 다른 압축 유형(예: 저랭크, 희소, 양자화)을 나타낸다.
  • 각 구성요소의 파라미터를 동시에 학습할 수 있도록 미분 가능한 최적화 프레임워크를 사용하여 백프로파게이션을 통한 엔드 투 엔드 학습을 가능하게 한다.
  • 교차 최적화를 적용한다: 나머지 구성요소는 고정하고 한 개의 구성요소만 경사 하강법으로 최적화하며, 수렴할 때까지 구성요소를 순환한다.
  • 기존의 압축 기법들—저랭크 근사(SVD), 크기 기반 프루닝, 1비트 양자화—를 덧셈 분해 프레임워크에 통합한다.
  • 스팸니티 및 양자화 제약 조건을 소프트 임계값과 스트레이트스루 추정기(straight-through estimators)를 사용해 미분 가능한 형태로 완화하여 기울기 흐름을 가능하게 한다.
  • Jetson Nano와 같은 엣지 디바이스에서 정확도, 모델 크기, 추론 지연 시간을 측정하기 위해 ImageNet에서 ResNet, AlexNet, VGG 아키텍처를 대상으로 방법을 검증한다.

실험 결과

연구 질문

  • RQ1압축 기법들을 덧셈 분해를 통해 조합할 경우, 개별적으로 적용했을 때보다 더 나은 압축-정확도 트레이드오프를 달성할 수 있는가?
  • RQ2저랭크 + 프루닝, 양자화 + 프루닝 등의 특정 압축 기법 조합 중 어떤 것이 특정 신경망 아키텍처에서 가장 뛰어난 성능을 낼 수 있는가?
  • RQ3압축의 덧셈 조합이 기존 기반 방법보다 더 높은 압축 비율을 달성하면서도 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ4ResNet, AlexNet, VGG와 같은 다양한 모델 아키텍처에서 복합 압축의 성능은 어떻게 변화하는가?

주요 결과

  • 저랭크 근사와 1비트 양자화, 프루닝을 조합하면 AlexNet과 ResNet을 1bit per weight로 압축해도 정확도 저하가 발생하지 않으며, Jetson Nano에서 최대 72.15×의 압축 비율을 달성한다.
  • VGG 네트워크의 경우, 저랭크와 프루닝을 양자화와 조합하면 양자화만 사용했을 때보다 더 좋은 결과를 얻으며, L₃ 모델 버전에서 90.4×의 압축 비율을 기록한다.
  • 기존 Caffe-AlexNet 대비 Jetson Nano GPU에서 7.33×의 속도 향상을, CPU에서는 3.93×의 속도 향상을 기록했으며, 모델 크기는 3.7 MB에 불과하다.
  • 실행 시간 측정 결과, 복합 압축 방법은 L₃ 모델의 추론 시간을 CPU 기준 44.80 ms, GPU 기준 6.72 ms로 줄여 기반 모델 대비 빠른 속도와 작은 크기를 동시에 확보한다.
  • 덧셈 조합 프레임워크는 다수의 압축 다양체의 표현력을 조합함으로써 손실 없이 더 많은 가중치 행렬을 압축할 수 있도록 한다.
  • 최적의 압축 전략은 아키텍처에 따라 크게 달라진다: ResNets와 AlexNet은 1비트 양자화와 프루닝 조합에서 가장 큰 이점을 얻지만, VGG는 저랭크와 프루닝 조합에서 더 나은 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.