Skip to main content
QUICK REVIEW

[논문 리뷰] Quantization Variation: A New Perspective on Training Transformers with Low-Bit Precision

Xijie Huang, Zhiqiang Shen|arXiv (Cornell University)|2023. 07. 01.
CCD and CMOS Imaging Sensors인용 수 4
한 줄 요약

이 논문은 저비트 양자화 인식 훈련(QAT) 중 매개변수 변동(변동성)으로 인한 훈련 불안정성 문제를 해결하기 위해 변동성 인식 양자화 프레임워크를 제안한다. 다중 컷 지식 정착, 모듈별 스케일링, 진동 인식 빈 정규화 기법을 활용하여 훈련을 안정화시키고, 2비트 Swin-T로 ImageNet-1K에서 77.66%의 Top-1 정확도를 달성하여 이전 최고 성능(SOTA)보다 3.35% 향상시켰다.

ABSTRACT

Despite the outstanding performance of transformers in both language and vision tasks, the expanding computation and model size have increased the demand for efficient deployment. To address the heavy computation and parameter drawbacks, quantization is frequently studied in the community as a representative model compression technique and has seen extensive use on ConvNets. However, due to the unique properties of transformers, the low-bit quantization applications are still limited and underexplored. In this paper, we identify the difficulty of transformer low-bit quantization-aware training on its unique variation behaviors, which significantly differ from ConvNets. Based on comprehensive quantitative analysis, we observe variation in three hierarchies: various module quantization sensitivities, outliers in static weight and activation distribution, and oscillation in dynamic parameter fluctuations. These variations of transformers bring instability to the quantization-aware training (QAT) and negatively influence the performance. We explore the best practices to alleviate the variation's influence during low-bit transformer QAT and propose a variation-aware quantization scheme for both vision and language transformers. We extensively verify and show our scheme can alleviate the variation and improve the performance of transformers across various models and tasks. Our solution substantially improves the 2-bit Swin-T and binary BERT-base, achieving a 3.35% and 1.4% accuracy improvement over previous state-of-the-art methods on ImageNet-1K and GLUE. Codes and models are available at https://github.com/HuangOwen/Quantization-Variation.

연구 동기 및 목표

  • 저비트 양자화된 비전 트랜스포머에서 훈련 불안정성의 근본 원인을 규명하고 해결하기.
  • CNN과 다름을 보이는 ViT에서의 고유한 변동 행동을 분석하여 양자화 성능 저하 원인을 규명하기.
  • 극도로 낮은 비트폭(2–4비트)에서 ViT의 양자화 인식 훈련(QAT)의 효율성과 안정성을 향상시키기.
  • 모듈 인식형, 변동성에 강건한 양자화 프레임워크를 개발하여 수렴성과 정확도 향상시키기.
  • 2비트 ViT 모델로 ImageNet-1K에서 최고 성능을 입증하기.

제안 방법

  • 미니배치 내 데이터 변동을 줄이기 위해 다중 컷 지식 정착 기법을 도입하여 QAT의 안정성과 속도를 향상시켰다.
  • 다양한 가중치 분포 변동성을 수용하기 위해 각 모듈에 대해 다른 스케일 요소를 적용하는 모듈별 스케일링 전략을 제안했다.
  • 진동 행동을 고려한 빈 정규화(Oscillation-aware Bin Regularization, OBR)를 설계하여 코사인 스케줄을 활용해 정규화 계수를 동적으로 조정함으로써 가중치 진동을 감소시켰다.
  • QAT 동안 불안정한 가중치 갱신을 억제하기 위해 변동성 인식 정규화 항을 도입하여 수렴성을 향상시켰다.
  • 기본적으로 LSQ+를 사용하는 미분 가능 양자화 기법에 기반하여 기울기 스케일링과 분포 인식 정규화를 추가로 적용했다.
  • 주의 맵을 시각화하여 양자화된 모델이 특히 2비트 정밀도에서도 표현 능력을 유지하고 있음을 검증했다.

실험 결과

연구 질문

  • RQ1왜 비전 트랜스포머(ViTs)는 CNN보다 저비트 양자화에서 성능이 열 劣하는가?
  • RQ2ViT의 양자화 인식 훈련 중 훈련 불안정성의 원인은 무엇인가?
  • RQ3ViT에서의 매개변수 변동은 QAT 동안 가중치 진동과 수렴성에 어떤 영향을 미치는가?
  • RQ4지식 정착과 모듈별 스케일링은 저비트 ViT 양자화의 안정성과 정확도를 향상시킬 수 있는가?
  • RQ5진동 인식 정규화는 저비트 ViT 훈련에서 가중치 진동을 어느 정도 억제하고 정확도 향상에 기여하는가?

주요 결과

  • 제안된 방법은 2비트 Swin-T로 ImageNet-1K에서 77.66%의 Top-1 정확도를 달성하여 이전 SOTA보다 3.35% 높게 기록했다.
  • 진동 인식 빈 정규화(Oscillation-aware Bin Regularization, OBR)는 훈련 종료 시 진동하는 가중치 비율을 기준선의 7.33%에서 0.23%로 감소시켜 정확도 향상과 관련이 있음을 확인했다.
  • 다중 컷 지식 정착 기법은 훈련을 안정화시키고 데이터 변동을 감소시켜 더 빠른 수렴과 높은 정확도 기여했다.
  • 제안된 방법의 손실 경로는 기준선보다 더 매끄럽고 중심에 집중되어 있어 훈련 안정성이 향상되었음을 시사한다.
  • 주의 맵 시각화 결과, 2비트 양자화된 Swin-T는 기준선과 달리 주요 객체에 강한 주의를 기울이며 표현 능력을 유지하고 있음을 확인했다.
  • 다양한 ViT 아키텍처(DeiT-T, SReT-T, Swin-T)에서 2–4비트 정밀도로도 최고 성능을 달성하여 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.