Skip to main content
QUICK REVIEW

[논문 리뷰] Post-training Quantization with Multiple Points: Mixed Precision without Mixed Precision

Xingchao Liu, Mao Ye|arXiv (Cornell University)|2020. 02. 20.
Advanced Neural Network Applications참고 문헌 35인용 수 6
한 줄 요약

이 논문은 후기훈련 양자화 방법인 다중점 양자화를 제안하며, 전체 정밀도 가중치를 다수의 저비트 벡터의 선형 조합으로 근사하여, 전용 하드웨어 없이 혼합 정밀도 성능을 달성한다. 게으른 알고리즘을 통해 중요한 채널에 대해 더 높은 점 수 근사를 자동으로 선택함으로써, 메모리 및 계산 오버헤드를 최소화하면서 ImageNet과 PASCAL VOC에서 최신 기준 성능을 달성한다.

ABSTRACT

We consider the post-training quantization problem, which discretizes the weights of pre-trained deep neural networks without re-training the model. We propose multipoint quantization, a quantization method that approximates a full-precision weight vector using a linear combination of multiple vectors of low-bit numbers; this is in contrast to typical quantization methods that approximate each weight using a single low precision number. Computationally, we construct the multipoint quantization with an efficient greedy selection procedure, and adaptively decides the number of low precision points on each quantized weight vector based on the error of its output. This allows us to achieve higher precision levels for important weights that greatly influence the outputs, yielding an 'effect of mixed precision' but without physical mixed precision implementations (which requires specialized hardware accelerators). Empirically, our method can be implemented by common operands, bringing almost no memory and computation overhead. We show that our method outperforms a range of state-of-the-art methods on ImageNet classification and it can be generalized to more challenging tasks like PASCAL VOC object detection.

연구 동기 및 목표

  • 재정비나 훈련 데이터에 접근할 수 없는 자원 제약이 있는 장치에 양자화된 신경망을 구현하는 데 도전한다.
  • 특수 하드웨어 가속기 없이도 후기훈련 양자화에서 혼합 정밀도 성능 향상을 달성한다.
  • 일반적인 연산만을 사용하고 메모리 및 계산 오버헤드를 낮추는 하드웨어 友好的한 양자화 방법을 개발한다.
  • 단일 정밀도 수준을 사용하여 다수의 저비트 벡터를 통해 채널별로 적응형 정밀도 제어를 가능하게 한다.
  • 이론적 일반화를 통해 이미지 분류를 넘어서 복잡한 작업인 객체 검출에도 적용 가능함을 보여준다.

제안 방법

  • 각 전체 정밀도 가중치 벡터를 다수의 저비트 벡터의 선형 조합으로 근사함으로써 채널별로 정밀도 할당을 탄력적으로 가능하게 한다.
  • 게으른 선택 알고리즘이 출력 오차를 가장 줄이는 저비트 벡터를 반복적으로 추가하며, 오차 향상이 임계값 이하로 떨어지면 정지한다.
  • 채널이 출력 오차에 기여하는 정도에 따라 각 채널에 사용할 저비트 벡터의 수를 적응적으로 결정하며, 중요도가 높은 채널을 우선시한다.
  • 표준 곱셈-합산(MAC) 연산만을 사용하므로 일반 하드웨어와 호환되며 혼합 정밀도 계산 요구 조건을 피한다.
  • 알고리즘은 층 또는 채널 단위로 적용되며, 가중치 및 활성화를 4비트 이하로 양자화하고, 강인성을 향상시키기 위해 클리핑을 포함한다.
  • 이 방법은 층 기반 및 채널 기반 양자화 모두에 일반화되며, 메모리 증가가 최소이고 계산 오버헤드가 거의 없다.

실험 결과

연구 질문

  • RQ1특수 하드웨어 가속기 없이도 후기훈련 양자화가 혼합 정밀도 성능을 달성할 수 있는가?
  • RQ2각 가중치에 다수의 저비트 벡터를 사용함으로써 단일 정밀도 양자화 방법이 기존 최신 기준 방법보다 더 높은 정확도를 달성할 수 있는가?
  • RQ3채널 간 저비트 벡터의 적응적 할당이 모델 정확도와 자원 비용에 어떤 영향을 미치는가?
  • RQ4제안된 방법이 이미지 분류를 넘어서 더 복잡한 작업인 객체 검출으로 일반화될 수 있는가?
  • RQ5제안된 다중점 양자화 프레임워크에서 계산 비용, 메모리 오버헤드, 정확도 향상 사이의 상충 관계는 어떠한가?

주요 결과

  • ImageNet 분류에서, 가중치 클리핑 후 VGG19-BN과 Inception-v3에서 최신 기준 혼합 정밀도 기반(Banner et al., 2019)보다 2% 이상의 Top-1 정확도 향상을 달성한다.
  • 4비트 양자화에서, 층 기반 양자화 시 SSD-VGG16에서 mAP를 1.24% 향상시키고, 채널 기반 양자화 시 0.41% 향상시킨다.
  • 3비트 가중치 양자화에서, 층 기반 양자화 시 SSD-VGG16에서 mAP를 4.38% 향상시키며, 메모리 오버헤드는 0.01MB 뿐이다.
  • 3비트 채널 기반 양자화에서 mAP를 1.09% 향상시켜 저비트 폭에서 뛰어난 성능을 입증한다.
  • 모든 실험에서 메모리 오버헤드는 5% 이하를 유지하며, 나머지 양자화 대비 계산 오버헤드는 17% 이내다.
  • 게으운 알고리즘이 신속한 수렴을 보이며, 사용된 저비트 벡터 수에 따라 오차가 지수적으로 감소한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.