Skip to main content
QUICK REVIEW

[논문 리뷰] CNN Acceleration by Low-rank Approximation with Quantized Factors

Nikolay Kozyrskiy, Anh Huy Phan|arXiv (Cornell University)|2020. 06. 16.
Tensor decomposition and applications참고 문헌 51인용 수 5
한 줄 요약

이 논문은 모바일 및 임베디드 디바이스에서 추론을 가속화하기 위해 터커 텐서 분해와 가중치 및 활성화의 양자화를 조합한 새로운 CNN 압축 방법을 제안한다. 게으른 랭크 선택과 품질 복원 기법을 사용함으로써 높은 압축 비율을 달성하면서 정확도 손실를 최소화하였으며, CIFAR-10, CIFAR-100 및 ImageNet 벤치마크에서 ResNet18과 ResNet34에서 기존 방법들을 능가한다.

ABSTRACT

The modern convolutional neural networks although achieve great results in solving complex computer vision tasks still cannot be effectively used in mobile and embedded devices due to the strict requirements for computational complexity, memory and power consumption. The CNNs have to be compressed and accelerated before deployment. In order to solve this problem the novel approach combining two known methods, low-rank tensor approximation in Tucker format and quantization of weights and feature maps (activations), is proposed. The greedy one-step and multi-step algorithms for the task of multilinear rank selection are proposed. The approach for quality restoration after applying Tucker decomposition and quantization is developed. The efficiency of our method is demonstrated for ResNet18 and ResNet34 on CIFAR-10, CIFAR-100 and Imagenet classification tasks. As a result of comparative analysis performed for other methods for compression and acceleration our approach showed its promising features.

연구 동기 및 목표

  • 엄격한 전력, 메모리 및 지연 시간 제약 조건을 가진 모바일 및 임베디드 디바이스에 대규모이고 계산 비용이 높은 CNN을 구현하는 데 도전하는 것.
  • 상호 보완적인 방식으로 저랭크 근사와 양자화를 결합함으로써 기존의 압축 방법의 한계를 극복하는 것.
  • 다양한 구현 환경에 맞는 모델 압축 비율과 정확도 저하 사이의 탄력적이고 제어 가능한 트레이드오프를 개발하는 것.
  • 작업별 재학습이나 복잡한 하이퍼파ram터 튜닝 없이도 효율적인 배포를 위한 엔드 투 엔드 미세조정을 가능하게 하는 것.
  • ResNet18 및 ResNet34 아키텍처를 사용하여 표준 벤치마크(CIFAR-10, CIFAR-100, ImageNet)에서 제안된 방법의 유효성을 입증하는 것.

제안 방법

  • 4차원 컨볼루션 가중치 텐서에 터커 분해를 적용하여 저랭크 근사에 의해 매개변수 수를 줄이는 것.
  • 압축과 정확도의 균형을 이루기 위해 터커 형식에서 최적의 다중선형 랭크를 선택하기 위한 게으른 단계별 및 다단계 알고리즘을 사용하는 것.
  • 고정소수점 표현을 사용하여 가중치와 특징 맵(활성화)를 4~8비트로 양자화하여 메모리 및 계산 비용을 감소시키는 것.
  • 분해 및 양자화 이후에 품질 복원 기법을 도입하여 학습 안정성 향상과 정확도 복구를 개선하는 것.
  • 압축 및 양자화된 모델의 엔드 투 엔드 미세조정을 수행하여 분해 후 정확도 손실를 최소화하는 것.
  • 조정 가능한 랭크 및 비트 폭 파rameter를 통해 압축 비율과 정확도 손실 사이의 트레이드오프를 제어하는 것.

실험 결과

연구 질문

  • RQ1터커 분해와 가중치 및 활성화의 양자화를 조합하면 의미 있는 CNN 압축을 달성하면서 정확도 손실를 최소화할 수 있는가?
  • RQ2제안된 게으른 랭크 선택 알고리즘이 컨볼루션 레이어에 대한 최적의 저랭크 근사값을 효과적으로 식별하는가?
  • RQ3분해 및 양자화 이후에 품질 복원 기법이 수렴성과 정확도 복구에 얼마나 기여하는가?
  • RQ4표준 벤치마크에서 최신 기술 대비 이 방법의 압축 비율과 정확도 측면에서의 성능은 어떠한가?
  • RQ5이 방법은 다양한 모델과 데이터셋에 대해 제어 가능한 압축과 성능 간의 트레이드오프를 갖는 유연하게 적용될 수 있는가?

주요 결과

  • 제안된 방법은 기존 방법들과 비교해 우수한 압축 및 가속 성능을 달성하였으며, 특히 8비트 양자화와 조합했을 때 두드러진 성능 향상을 보였다.
  • ImageNet에서 이 방법은 공간 SVD 기반 방법을 제외한 모든 접근 방식을 능가했으며, 추가로 양자화로 인한 효율성 향상까지 제공하였다.
  • 압축 비율과 정확도 손실 사이의 제어 가능한 트레이드오프를 제공하여 다양한 하드웨어 제약 조건을 가진 디바이스에의 배포를 가능하게 하였다.
  • 엔드 투 엔드 미세조정은 수렴성과 정확도 복구를 크게 향상시켰으며, 미세조정되지 않았거나 잘못 초기화된 압축 전략보다 뛰어난 성능을 보였다.
  • 터커 분해와 양자화의 조합은 FLOPs와 모델 크기를 크게 감소시켜 이동 및 실시간 응용 분야에 적합한 모델을 가능하게 하였다.
  • 이 방법은 일반화 가능하며, 딥러닝 프레임워크에 플러그인 모듈로 통합되어 즉각적인 모델 압축을 지원할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.