Skip to main content
QUICK REVIEW

[논문 리뷰] Diversifying Sample Generation for Accurate Data-Free Quantization

Xiangguo Zhang, Haotong Qin|arXiv (Cornell University)|2021. 03. 01.
Advanced Neural Network Applications참고 문헌 37인용 수 9
한 줄 요약

이 논문은 데이터 없는 양자화에서 합성 데이터의 균일화로 인한 성능 저하를 완화하기 위한 새로운 데이터 생성 방법인 다각도 샘플 생성(Diverse Sample Generation, DSG)을 제안한다. 배치 정규화 통계의 일치를 완화하고 계층별 샘플 강화를 적용함으로써 DSG는 양자화 모델의 정확도를 크게 향상시켜 W4A4 양자화에서 최대 22%의 정확도 향상을 달성하며, 실데이터 캘리브레이션과 이전 최고 성능 방법들을 모두 능가한다.

ABSTRACT

Quantization has emerged as one of the most prevalent approaches to compress and accelerate neural networks. Recently, data-free quantization has been widely studied as a practical and promising solution. It synthesizes data for calibrating the quantized model according to the batch normalization (BN) statistics of FP32 ones and significantly relieves the heavy dependency on real training data in traditional quantization methods. Unfortunately, we find that in practice, the synthetic data identically constrained by BN statistics suffers serious homogenization at both distribution level and sample level and further causes a significant performance drop of the quantized model. We propose Diverse Sample Generation (DSG) scheme to mitigate the adverse effects caused by homogenization. Specifically, we slack the alignment of feature statistics in the BN layer to relax the constraint at the distribution level and design a layerwise enhancement to reinforce specific layers for different data samples. Our DSG scheme is versatile and even able to be applied to the state-of-the-art post-training quantization method like AdaRound. We evaluate the DSG scheme on the large-scale image classification task and consistently obtain significant improvements over various network architectures and quantization methods, especially when quantized to lower bits (e.g., up to 22% improvement on W4A4). Moreover, benefiting from the enhanced diversity, models calibrated by synthetic data perform close to those calibrated by real data and even outperform them on W4A4.

연구 동기 및 목표

  • 합성 데이터의 분포 및 샘플 수준에서의 균일성이 데이터 없는 양자화의 성능 저하를 유발하는 문제를 해결하기 위해.
  • 실제 학습 데이터를 요구하지 않고도 생성된 합성 데이터의 다양성을 향상시키기 위해.
  • AdaRound와 같은 다양한 후기 양자화 기법과 호환되는 유연한 방법을 개발하기 위해.
  • 실제 데이터 없이도 저비트 양자화(예: W4A4)에서 높은 정확도를 달성하기 위해.
  • 다양한 합성 데이터가 실데이터로 캘리브레이션된 모델을 초월할 수 있음을 입증하기 위해.

제안 방법

  • 배치 정규화 통계 일치를 완화함으로써 분포 수준의 균일성을 줄이는 슬랙 분포 일치(Slack Distribution Alignment, SDA)를 도입한다.
  • 특정 네트워크 계층에 대해 서로 다른 데이터 샘플을 강화함으로써 샘플 수준의 균일성을 감소시키는 계층별 샘플 강화(Layerwise Sample Enhancement, LSE)를 제안한다.
  • SDA와 LSE를 포함한 손실 함수를 최적화하여, 다양한 샘플 간의 특징 분포가 다양해지도록 합성 데이터를 생성한다.
  • DSG로 생성된 데이터를 재학습 없이 표준 후기 양자화 파이프라인을 사용해 양자화 모델 캘리브레이션에 적용한다.
  • 가중치 양자화를 위한 고품질의 다양한 합성 데이터를 제공함으로써 AdaRound와 같은 고급 양자화 방법과의 통합을 지원한다.
  • 이미지 사전 지식과 레이블 가이던스를 DSG와 함께 활용하여 샘플의 현실성과 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1데이터 없는 양자화를 통해 생성된 합성 데이터는 분포 수준의 균일성이 발생하여 모델 정확도에 악영향을 미치는가?
  • RQ2합성 데이터의 샘플 수준 균일성이 양자화 모델의 성능을 제한하는가?
  • RQ3합성 데이터의 다양성을 향상시키면 실데이터 캘리브레이션을 능가하는 더 나은 양자화 모델 정확도를 달성할 수 있는가?
  • RQ4DSG 기법은 다양한 네트워크 아키텍처와 저비트 양자화 설정에서 효과적인가?
  • RQ5AdaRound와 같은 최첨단 후기 양자화 방법과 DSG를 원활하게 통합할 수 있는가?

주요 결과

  • ResNet-18의 W4A4 양자화에서 DSG는 34.53%의 상위-1 정확도를 달성하여 ZeroQ 대비 22.89% 향상되었고, 실데이터 캘리브레이션 대비 2.67% 향상되었다.
  • InceptionV3의 W4A4 양자화에서 DSG는 34.89%의 정확도를 기록하여 ZeroQ 대비 22.89% 향상되었고, 실데이터 대비 11.66% 향상되었다.
  • AdaRound와 결합했을 때, ResNet-18의 3비트 가중치에서 DSG는 61.32%의 상위-1 정확도를 달성하여 동일 조건에서 ZeroQ 대비 11.43% 향상되었다.
  • DSG는 ResNet-18, ResNet-50, ShuffleNet, SqueezeNet, InceptionV3 등 여러 아키텍처와 Percentile, EMA, MSE, AdaRound 등 다양한 양자화 방법에서 일관되게 성능을 향상시켰다.
  • DSG의 성능 향상은 초저비트 폭 설정에서 가장 두드러지게 나타나, 저정밀도 양자화에서 데이터 다양성이 핵심 요소임을 확인한다.
  • W4A4에서 DSG로 생성된 데이터는 실데이터로 캘리브레이션된 모델보다 더 높은 정확도를 달성하여, 이 영역에서 다양성은 데이터 충실도를 초월하는 우월성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.