Skip to main content
QUICK REVIEW

[논문 리뷰] Generative Low-bitwidth Data Free Quantization

Shoukai Xu, Haokun Li|arXiv (Cornell University)|2020. 03. 07.
Advanced Neural Network Applications참고 문헌 54인용 수 14
한 줄 요약

이 논문은 실제 학습 데이터가 필요하지 않은 4비트 신경망 양자화를 위한 새로운 방법인 생성적 저비트폭 데이터 프리 퀀티제이션(GDFQ)을 제안한다. 사전 훈련된 모델의 배치 정규화 통계에서 도출된 분류 경계 및 활성화 분포 지식을 활용하여, 고품질의 가짜 데이터를 합성하는 지식 매칭 생성자(GDFQ)를 훈련시켜 효과적인 양자화와 최적화를 가능하게 한다. 이 방법은 기존의 데이터 프리 접근 방식인 ZeroQ와 DFQ보다 뛰어난 성능을 보이며, 4비트 양자화에서 최신 기술 수준(SOTA)의 정확도를 달성한다.

ABSTRACT

Neural network quantization is an effective way to compress deep models and improve their execution latency and energy efficiency, so that they can be deployed on mobile or embedded devices. Existing quantization methods require original data for calibration or fine-tuning to get better performance. However, in many real-world scenarios, the data may not be available due to confidential or private issues, thereby making existing quantization methods not applicable. Moreover, due to the absence of original data, the recently developed generative adversarial networks (GANs) cannot be applied to generate data. Although the full-precision model may contain rich data information, such information alone is hard to exploit for recovering the original data or generating new meaningful data. In this paper, we investigate a simple-yet-effective method called Generative Low-bitwidth Data Free Quantization (GDFQ) to remove the data dependence burden. Specifically, we propose a knowledge matching generator to produce meaningful fake data by exploiting classification boundary knowledge and distribution information in the pre-trained model. With the help of generated data, we can quantize a model by learning knowledge from the pre-trained model. Extensive experiments on three data sets demonstrate the effectiveness of our method. More critically, our method achieves much higher accuracy on 4-bit quantization than the existing data free quantization method. Code is available at https://github.com/xushoukai/GDFQ.

연구 동기 및 목표

  • 실제 학습 데이터가 확보되지 않은 환경이나 개인정보 보호 제약이 있는 환경에서 저비트폭 모델 양자화의 과제를 해결하기 위해.
  • 후기 훈련 양자화에서 校정 또는 최적화를 위해 실제 데이터에 의존하지 않는 방법을 개발하기 위해.
  • 특히 분류 경계와 활성화 분포 정보를 포함한 사전 훈련된 모델 내 숨겨진 지식을 활용하여 의미 있는 합성 데이터를 생성하기 위해.
  • 기존의 데이터 프리 양자화 방법보다 4비트 정밀도에서 뛰어난 양자화 정확도를 달성하기 위해.

제안 방법

  • 전체 정밀도 모델의 배치 정규화 통계(BNS)에서 추출한 분류 경계 및 활성화 분포 정보와 일치하도록 지식 매칭 생성자를 훈련시어, 가짜 데이터를 생성한다.
  • 생성된 샘플에서 전체 정밀도 모델의 분류 정확도를 최대화하도록 생성자를 최적화하여 의미적 관련성과 분포의 정밀도를 확보한다.
  • 생성된 가짜 데이터를 사용하여 양자화된 모델을 최적화하며, 생성자와 양자화된 모델의 교차 훈련을 통해 데이터 다양성과 모델 성능을 향상시킨다.
  • 분류 정확도 임계값 기반의 정지 조건을 사용하여 생성자 훈련 기간을 제어하며, 제거 분석 결과에서 더 긴 훈련 기간이 성능 향상에 기여함을 확인했다.
  • 두 단계의 손실을 사용한다: 하나는 가짜 데이터가 BNS와 일치하도록 하는 지식 매칭 손실이며, 다른 하나는 가짜 데이터에서의 교차 엔트로피 손실을 통한 모델 최적화 손실이다.
  • 전체 과정은 엔드 투 엔드로 적용된다: 가짜 데이터 생성 → 모델 양자화 → 가짜 데이터를 사용한 최적화, 실제 데이터에 접근하지 않고도 수행된다.

실험 결과

연구 질문

  • RQ1실제 학습 데이터에 접근할 수 없는 조건에서, 고품질의 의미적으로 유의미한 데이터를 생성할 수 있는 생성자를 훈련시킬 수 있는가?
  • RQ2배치 정규화 통계에서 유도된 분류 경계 및 활성화 분포 지식을 효과적으로 활용하여 데이터 프리 양자화에서 데이터 생성을 이끌 수 있는가?
  • RQ3생성자와 양자화된 모델을 번갈아가며 훈련하는 것이 별도의 훈련보다 양자화 정확도를 향상시키는가?
  • RQ4특히 4비트에서 감소하는 비트 폭에 따라 데이터 프리 양자화의 성능은 어떻게 변화하는가?
  • RQ5제안된 방법이 ZeroQ 및 DFQ와 같은 기존의 데이터 프리 양자화 기준선을 저비트폭 환경에서 초월할 수 있는가?

주요 결과

  • ImageNet에서 ResNet-50의 W4A4 양자화에 대해 GDFQ는 55.65%의 Top-1 정확도를 달성하였으며, ZeroQ의 0.12% 및 DFQ의 0.11%보다 뚜렷이 뛰어나다.
  • MobileNetV2에 대해 GDFQ는 4비트에서 51.30%의 Top-1 정확도를 기록했으며, ZeroQ의 3.31% 및 DFQ의 0.11%보다 뚜렷한 성능 향상을 보였다.
  • 생성자와 양자화된 모델의 교차 훈련은 별도 훈련(61.81%)보다 63.91%의 정확도를 기록하여 공동 최적화의 이점이 있음을 입증했다.
  • 생성자 훈련을 조기에 정지(예: 99% 임계값)할 경우 최적의 결과를 얻을 수 없으며, 수렴할 때까지 훈련이 이루어져야 최고의 성능이 달성된다.
  • 이 방법은 4비트 양자화에서 최신 기술 수준의 성능을 달성하여, 데이터 프리 저비트폭 양자화 분야에서 새로운 SOTA를 수립했다.
  • 성능 향상은 특히 저비트폭에서 두드러지며, GDFQ는 4비트에서 6비트나 8비트보다 기존 기준선 대비 더 큰 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.