Skip to main content
QUICK REVIEW

[논문 리뷰] Mixed-Precision Neural Network Quantization via Learned Layer-wise Importance

Chen Tang, Kai Ouyang|arXiv (Cornell University)|2022. 03. 16.
Advanced Image and Video Retrieval Techniques인용 수 5
한 줄 요약

이 논문은 양자화 스케일 요소를 사용하여 계층별 중요도를 학습하는 방법을 제안하여 정수 선형 프로그래밍(ILP)을 통한 빠르고 한 번만 실행되는 혼합 정밀도 양자화(MPQ)를 가능하게 한다. 양자화 인식 훈련 기간 동안 이러한 스케일 요소를 종단 간(end-to-end)으로 훈련시킴으로써 계층별 양자화 민감도를 포착하여 ResNet18에서 MPQ 검색 시간을 0.06초로 줄였으며, 반복적 방법보다 기하급수적으로 빠르게 작동한다. 이는 다양한 제약 조건 하에서 ImageNet에서 최고 성능의 정확도를 달성한다.

ABSTRACT

The exponentially large discrete search space in mixed-precision quantization (MPQ) makes it hard to determine the optimal bit-width for each layer. Previous works usually resort to iterative search methods on the training set, which consume hundreds or even thousands of GPU-hours. In this study, we reveal that some unique learnable parameters in quantization, namely the scale factors in the quantizer, can serve as importance indicators of a layer, reflecting the contribution of that layer to the final accuracy at certain bit-widths. These importance indicators naturally perceive the numerical transformation during quantization-aware training, which can precisely provide quantization sensitivity metrics of layers. However, a deep network always contains hundreds of such indicators, and training them one by one would lead to an excessive time cost. To overcome this issue, we propose a joint training scheme that can obtain all indicators at once. It considerably speeds up the indicators training process by parallelizing the original sequential training processes. With these learned importance indicators, we formulate the MPQ search problem as a one-time integer linear programming (ILP) problem. That avoids the iterative search and significantly reduces search time without limiting the bit-width search space. For example, MPQ search on ResNet18 with our indicators takes only 0.06 s, which improves time efficiency exponentially compared to iterative search methods. Also, extensive experiments show our approach can achieve SOTA accuracy on ImageNet for far-ranging models with various constraints (e.g., BitOps, compress rate). Code is available on https://github.com/1hunters/LIMPQ.

연구 동기 및 목표

  • 혼합 정밀도 양자화(MPQ)에서 기하급수적으로 큰 검색 공간으로 인해 전통적인 반복적 검색 방법이 비용이 너무 많이 들기 때문에 이를 해결하기 위해.
  • 기존의 기준 기반 MPQ 방법에서 전체 정밀도 헤시안 근사에 의존함으로써 발생하는 편향을 해결하기 위해, 양자화 전용 수치적 행동을 포착하지 못함.
  • MPQ에서 수동적인 비트 폭 할당 또는 제약된 검색 공간이 필요 없도록 하여 가중치와 활성화에 대해 비트 폭 선택에 대한 완전한 유연성을 제공하기 위해.
  • 반복적인 훈련 데이터 평가를 피하고 시간 소모를 극도로 줄이는 한 번만 실행되는 빠른 MPQ 정책 검색 방법을 개발하기 위해.
  • 양자화 인식 훈련 중에 계층 민감도를 반영하는 학습 가능한 종단 간 중요도 지표를 수립하기 위해.

제안 방법

  • 특정 비트 폭에서 양자화에 대한 계층 민감도를 반영하는 종단 간 중요도 지표로 양자화기 내의 학습 가능한 스케일 요소를 활용한다.
  • 모든 계층별 중요도 지표를 병렬화된 공동 훈련 방식을 통해 동시에 훈련시켜 순차적 훈련을 피하고 시간 소모를 줄인다.
  • 학습된 중요도 지표를 사용하여 MPQ 검색 문제를 한 번만 실행하는 정수 선형 프로그래밍(ILP) 문제로 공식화하여 각 계층에 최적의 비트 폭을 할당한다.
  • ILP 해를 사용하여 가중치와 활성화 모두에 대해 혼합 정밀도 비트 폭을 할당함으로써 세밀하고도 민감한 정확도-효율성 트레이드오프를 가능하게 한다.
  • 학습된 지표를 전체 양자화 파이프라인에 통합한다: 중요도 훈련, ILP 기반 정책 검색, 모델 미세조정.
  • 가중치와 활성화 모두에 대해 4비트, 8비트 등 전체 검색 공간을 제약 없이 탐색 가능하도록 보장한다.

실험 결과

연구 질문

  • RQ1양자화기 내의 학습 가능한 스케일 요소가 계층 양자화 민감도에 대한 신뢰할 수 있고 종단 간 지표로 기능할 수 있는가?
  • RQ2중요도 지표에 대한 공동 훈련 방식이 순차적 훈련에 비해 훈련 시간을 크게 줄이는가?
  • RQ3ILP 기반 MPQ 정책 검색이 근사적으로 0초에 가까운 검색 시간을 유지하면서도 SOTA 정확도를 달성할 수 있는가?
  • RQ4반복적 검색 기반 및 헤시안 기반 기준 방법에 비해 정확도 및 효율성 측면에서 성능이 어떻게 비교되는가?
  • RQ5스케일 요소 크기 기반의 비트 폭 할당을 뒤집었을 때 성능 저하가 발생하는가로 인해 제안된 중요도 지표의 타당성이 확인되는가?

주요 결과

  • 이 방법은 ResNet18에서 MPQ 정책 검색을 0.06초 내에 완료하여 AutoQ와 같이 반복적 방법이 1000개 이상의 GPU 시간이 소요되는 것에 비해 기하급수적인 속도 향상을 달성한다.
  • ResNet50에서는 중요도 훈련을 50분(3.3 GPU 시간) 내에 완료하고 ILP 검색을 0.35초 내에 수행하여 AutoQ 대비 여러 배포 장치에서 330배의 속도 향상을 달성한다.
  • HAWQv2에 비해 ResNet50에서 상위 1 정확도를 1.1% 향상시켰으며, 가중치와 활성화 모두에 대해 전체 검색 공간의 자유로운 유연성을 유지한다.
  • 절단 실험 결과, 스케일 요소 기반 비트 폭 할당을 뒤집었을 때 상위 1 정확도가 6.59% 감소함으로써 제안된 중요도 기반 할당의 타당성이 확인된다.
  • 9.68 G BitOps 제약 조건 하에서, 이 방법은 4비트 가중치와 활성화를 사용해 71.84%의 상위 1 정확도를 달성했고, 반대 할당 시에는 65.25%로 떨어지며 학습된 지표의 강건성을 입증한다.
  • 이 방법은 검색 공간을 제한하지 않고 BitOps 및 압축률 등의 다양한 모델과 제약 조건 하에서 ImageNet에서 최고 성능의 정확도를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.