Skip to main content
QUICK REVIEW

[논문 리뷰] Diverse Sample Generation: Pushing the Limit of Generative Data-free Quantization

Haotong Qin, Yifu Ding|arXiv (Cornell University)|2021. 09. 01.
Advanced Neural Network Applications참고 문헌 56인용 수 6
한 줄 요약

이 논문은 생성형 데이터 프리 퀀티제이션의 성능을 햖스키기 위해 합성 데이터의 다양성을 향상시켜 엄격한 배치 정규화(BN) 통계 정렬로 인한 동질화를 완화하는 새로운 기법인 다각적 샘플 생성(DSG)을 제안한다. DSG는 다양한 네트워크와 비트 폭에서 성능을 향상시키며, 특히 초저비트 환경에서 뛰어난 성능을 보이며, W3A3에서 MobileNetV2에서 ZeroQ 대비 34.33%의 정확도 향상을 달성하여 최신 기술 수준(SOTA)을 확립한다.

ABSTRACT

Generative data-free quantization emerges as a practical compression approach that quantizes deep neural networks to low bit-width without accessing the real data. This approach generates data utilizing batch normalization (BN) statistics of the full-precision networks to quantize the networks. However, it always faces the serious challenges of accuracy degradation in practice. We first give a theoretical analysis that the diversity of synthetic samples is crucial for the data-free quantization, while in existing approaches, the synthetic data completely constrained by BN statistics experimentally exhibit severe homogenization at distribution and sample levels. This paper presents a generic Diverse Sample Generation (DSG) scheme for the generative data-free quantization, to mitigate detrimental homogenization. We first slack the statistics alignment for features in the BN layer to relax the distribution constraint. Then, we strengthen the loss impact of the specific BN layers for different samples and inhibit the correlation among samples in the generation process, to diversify samples from the statistical and spatial perspectives, respectively. Comprehensive experiments show that for large-scale image classification tasks, our DSG can consistently quantization performance on different neural architectures, especially under ultra-low bit-width. And data diversification caused by our DSG brings a general gain to various quantization-aware training and post-training quantization approaches, demonstrating its generality and effectiveness.

연구 동기 및 목표

  • 실제 데이터 없이 생성된 합성 데이터의 동질화 문제로 인한 모델 정확도 저하라는 핵심 문제를 해결한다.
  • 이론적 및 실험적으로 실데이터 접근 없이 효과적인 퀀티제이션을 위해 샘플 다양성이 필수적임을 입증한다.
  • BN 통계 정렬을 유지하면서도 합성 데이터 생성의 다양성을 향상시키는 일반적인 DSG 프레임워크를 제안한다.
  • 특히 초저비트 환경에서 다양한 아키텍처와 비트 폭에서 일관된 성능 향상을 달성한다.
  • 기존의 데이터 프리 퀀티제이션 방법과의 호환성과 상호보완성을 확보하며, 후기 훈련 및 퀀티제이션 인식 훈련 모두에 적용 가능하다.

제안 방법

  • 특성 맵의 엄격한 BN 통계 정렬을 완화하여 분포 과적합을 줄이고 입력 공간의 다양성을 향상시킨다.
  • 개별 샘플의 영향을 증폭시키기 위해 샘플별 손실 가중치를 도입하여 공간적 다양성을 향상시킨다.
  • 상호 샘플 유사도를 최소화하기 위해 상관관계 감소 기법을 적용하여 생성된 데이터 분포의 다양성을 더욱 증진시킨다.
  • DSG를 플러그인 모듈로 통합하여 기존의 데이터 프리 퀀티제이션 파ip라인과 호환성을 유지한다.
  • 추가적인 데이터 생성 기법(예: 레이블 사전 정보, 이미지 사전 정보)과 함께 프레임워크를 활용하여 성능을 추가로 향상시킨다.
  • BN 통계와 다양성 증진 목적에 기반한 반복적 개선을 통해 합성 데이터 생성을 최적화한다.

실험 결과

연구 질문

  • RQ1기존의 생성형 데이터 프리 퀀티제이션 방법이 왜 합성 데이터의 동질화로 인해 성능 저하를 겪는가?
  • RQ2실제 데이터에 접근하지 않고 데이터 프리 퀀티제이션에서 합성 데이터 다양성을 이론적·실증적으로 어떻게 향상시킬 수 있는가?
  • RQ3향상된 데이터 다양성이 다양한 네트워크 아키텍처와 비트 폭에서 정확도 향상에 얼마나 기여하는가?
  • RQ4제안된 DSG 기법은 후기 훈련 및 퀀티제이션 인식 훈련 모두에 일반적으로 적용 가능한가?
  • RQ5초저비트 환경 제약 하에서 DSG는 최신 기술 수준(SOTA)의 데이터 프리 퀀티제이션 방법보다 어떻게 비교되는가?

주요 결과

  • 활성화 분포 및 주성분 분석(PCA) 시각화를 통해 DSG가 분포 수준과 샘플 수준에서 합성 데이터의 동질화를 크게 감소시킴을 확인했다.
  • ResNet18에서 ImageNet을 대상으로 W4A4 설정에서 DSG가 ZeroQ 대비 상위-1 정확도를 6.46% 향상시켜 초저비트 환경에서의 뛰어난 성능을 입증했다.
  • W3A3에서 MobileNetV2를 대상으로 DSG는 ZeroQ 대비 34.33%의 정확도 향상을 달성하여 극단적인 저비트 환경에서의 효과성을 입증했다.
  • 레이블 사전 정보와 이미지 사전 정보를 결합한 DSG는 ResNet18에서 W5A32 설정에서 상위-1 정확도 69.16%를 달성하여 실데이터 성능(69.21%)에 근접했다.
  • AdaRound와 같은 다양한 퀀티제이션 방법과의 조합에서도 DSG는 일관된 성능 향상을 보이며 일반화 능력과 호환성을 입증했다.
  • 무거운 8비트로 가중치와 활성화를 모두 퀀티제이션할 경우에도 DSG는 ResNet18에서 ZeroQ 대비 6.06% 높은 성능을 유지하며 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.