Skip to main content
QUICK REVIEW

[논문 리뷰] Sharpness-aware Quantization for Deep Neural Networks

Jing Liu, Jianfei Cai|arXiv (Cornell University)|2021. 11. 24.
Advanced Neural Network Applications참고 문헌 61인용 수 8
한 줄 요약

이 논문은 정량화 노이즈와 적대적 편향을 통합된 공식으로 표현함으로써 정량화와 손실 지형의 매끄러움을 동시에 최적화하는 새로운 방법인 Sharpness-Aware Quantization (SAQ)을 제안한다. SAQ는 저비트 정량화 모델의 일반화 성능을 향상시켜, 4비트 ViT-B/16에서 Top-1 정확도가 1.2% 향상되고, 4비트 ResNet-50에서 0.9% 향상되는 등 최신 기준(SOTA) 성능을 달성하며, AdamW와 유사한 훈련 효율성을 유지한다.

ABSTRACT

Network quantization is a dominant paradigm of model compression. However, the abrupt changes in quantized weights during training often lead to severe loss fluctuations and result in a sharp loss landscape, making the gradients unstable and thus degrading the performance. Recently, Sharpness-Aware Minimization (SAM) has been proposed to smooth the loss landscape and improve the generalization performance of the models. Nevertheless, directly applying SAM to the quantized models can lead to perturbation mismatch or diminishment issues, resulting in suboptimal performance. In this paper, we propose a novel method, dubbed Sharpness-Aware Quantization (SAQ), to explore the effect of SAM in model compression, particularly quantization for the first time. Specifically, we first provide a unified view of quantization and SAM by treating them as introducing quantization noises and adversarial perturbations to the model weights, respectively. According to whether the noise and perturbation terms depend on each other, SAQ can be formulated into three cases, which are analyzed and compared comprehensively. Furthermore, by introducing an efficient training strategy, SAQ only incurs a little additional training overhead compared with the default optimizer (e.g., SGD or AdamW). Extensive experiments on both convolutional neural networks and Transformers across various datasets (i.e., ImageNet, CIFAR-10/100, Oxford Flowers-102, Oxford-IIIT Pets) show that SAQ improves the generalization performance of the quantized models, yielding the SOTA results in uniform quantization. For example, on ImageNet, SAQ outperforms AdamW by 1.2% on the Top-1 accuracy for 4-bit ViT-B/16. Our 4-bit ResNet-50 surpasses the previous SOTA method by 0.9% on the Top-1 accuracy.

연구 동기 및 목표

  • 이산적 가중치 갱신으로 인해 발생하는 날카운 손실 지형으로 인한 저정밀도 정량화 모델의 불안정성과 성능 저하 문제를 해결하기 위해.
  • 기존에 모델 압축 분야에서 다루지 않은, Sharpness-Aware Minimization (SAM)과 네트워크 정량화의 통합을 탐색하기 위해.
  • 정량화와 적대적 편향을 모두 모델 가중치 상의 노이즈 원천으로 간주함으로써 상호작용을 체계적으로 분석할 수 있는 통합 프레임워크를 개발하기 위해.
  • 추가적인 계산 비용을 최소화하면서도 정량화 환경에서 SAM의 이점을 유지할 수 있는 효율적인 훈련 전략을 설계하기 위해.
  • 다양한 아키텍처(CNN 및 트랜스포머)와 데이터셋에서 SAQ의 실증적 검증을 통해 표준 및 전이 학습 환경 모두에서 일관된 성능 향상을 입증하기 위해.

제안 방법

  • 정량화와 SAM이 각각 모델 가중치에 정량화 노이즈와 적대적 편향을 도입한다고 보고, 이들의 상호작용을 통합된 관점에서 분석할 수 있도록 한다.
  • 정량화 노이즈와 적대적 편향 간의 종속성에 따라 세 가지 사례(독립, 종속, 하이브리드)를 정의하고, 이론적 및 실증적 비교를 수행한다.
  • 기존의 기울기 정보를 재사용함으로써 적대적 편향 계산의 계산 오버헤드를 줄이는 효율적인 훈련 전략을 도입하여, SGD 또는 AdamW 수준의 훈련 속도를 확보한다.
  • 정량화된 모델의 엔드 투 엔드 훈련 중에, 가중치 정량화와 편향 기반의 날카움 최소화를 함께 최적화한다.
  • 두 단계 최적화 루프를 적용한다: 먼저 반경 내에서 손실을 최대화하는 편향을 계산하고, 그 다음에 편향된 손실을 최소화하도록 가중치를 갱신하며, 이는 정량화된 가중치 공간에 적응시킨다.
  • 표준 최적화기(예: AdamW)를 사용하여 구현하고, 다양한 벤치마크에서 합성곱 네트워크와 비전 트랜스포머 모두에 적용한다.

실험 결과

연구 질문

  • RQ1Sharpness-Aware Minimization (SAM)은 정량화된 신경망에 효과적으로 적용될 수 있으며, 정량화와 적대적 편향 간의 상호작용으로 인해 발생하는 도전 과제는 무엇인가?
  • RQ2정량화 노이즈와 적대적 편향 간의 종속성은 정량화된 모델의 일반화 성능에 어떤 영향을 미치는가?
  • RQ3SAQ의 최적의 공식은 무엇인가? 즉, 유도된 세 가지 사례(독립, 종속, 하이브리드) 중에서 성능과 훈련 효율성 사이의 최적의 트레이드오프를 이루는 것은 무엇인가?
  • RQ4SAQ는 최소한의 추가 훈련 비용으로 균일 정량화에서 최신 기준(SOTA) 성능을 달성할 수 있는가?
  • RQ5손실 지형의 평탄함과 정량화를 동시에 최적화하는 것이, SAM을 먼저 적용한 후 정량화하는 순차적 접근 방식(SAM → SGD)에 비해 더 나은 일반화 및 전이 학습 성능을 제공하는가?

주요 결과

  • ImageNet에서 4비트 ViT-B/16에 대해 SAQ는 AdamW 대비 Top-1 정확도가 1.2% 향상되어 균일 정량화에서 최신 기준(SOTA) 성능을 입증한다.
  • 4비트 ResNet-50에 대해 SAQ는 이전 SOTA 방법보다 Top-1 정확도가 0.9% 높아져 합성곱 아키텍처에서의 효과를 확인한다.
  • 전이 학습에서, SAQ는 Oxford-IIIT Pets에서 SGD로 훈련한 정량화 모델 대비 Top-1 정확도를 1.0% 향상시키고, CIFAR-100에서는 0.7% 향상시켰다.
  • 효율적인 훈련 전략 덕분에 SAQ의 훈련 시간은 SGD의 11% 이내로 단축되어, 추가 편향 계산에도 불구하고 대규모 모델에 적용 가능한 확장성을 확보한다.
  • 2비트 ResNet-18에서 SAQ는 SAM을 먼저 적용한 후 정량화하는 순차적 접근(SAM → SGD)보다 Top-1 정확도에서 0.4% 높아, 공동 최적화의 이점을 입증한다.
  • 포괄적인 추론 분석 결과, 편향이 정량화 노이즈에 종속되는 하이브리드 사례가 가장 뛰어난 성능을 보였으며, 이는 두 노이즈 원천 간의 상호작용을 모델링하는 것이 중요하다는 점을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.