Skip to main content
QUICK REVIEW

[논문 리뷰] Q-ViT: Fully Differentiable Quantization for Vision Transformer

Zhexin Li, Tong Yang|arXiv (Cornell University)|2022. 01. 19.
CCD and CMOS Imaging SensorsEngineering인용 수 17
한 줄 요약

Q-ViT는 비전 트랜스포머를 위한 완전히 미분 가능한 양자화 방법을 제안하며, 최적의 양자화 스케일과 비트 폭을 동시에 학습하고, 헤드별 비트 폭 할당과 스위치 가능한 스케일 기법을 통해 훈련을 안정화시킨다. 3비트 양자화에서 최신 기술 수준의 성능을 달성하며, DeiT-Tiny에서 균일 양자화보다 1.5% 높은 정확도를 기록하면서 정확도 저하를 최소화한다.

ABSTRACT

In this paper, we propose a fully differentiable quantization method for vision transformer (ViT) named as Q-ViT, in which both of the quantization scales and bit-widths are learnable parameters. Specifically, based on our observation that heads in ViT display different quantization robustness, we leverage head-wise bit-width to squeeze the size of Q-ViT while preserving performance. In addition, we propose a novel technique named switchable scale to resolve the convergence problem in the joint training of quantization scales and bit-widths. In this way, Q-ViT pushes the limits of ViT quantization to 3-bit without heavy performance drop. Moreover, we analyze the quantization robustness of every architecture component of ViT and show that the Multi-head Self-Attention (MSA) and the Gaussian Error Linear Units (GELU) are the key aspects for ViT quantization. This study provides some insights for further research about ViT quantization. Extensive experiments on different ViT models, such as DeiT and Swin Transformer show the effectiveness of our quantization method. In particular, our method outperforms the state-of-the-art uniform quantization method by 1.5% on DeiT-Tiny.

연구 동기 및 목표

  • 비전 트랜스포머(ViT)에서 4비트 이하의 저비트 양자화 문제를 해결하며, 기존 방법이 4비트 이하에서 심한 정확도 저하를 겪는 문제를 다룬다.
  • ViT 내 구성 요소 수준의 양자화에 대한 내성에 대해 분석하여 민감한 레이어와 구성 요소를 규명한다.
  • 모델 크기와 정확도 제약 조건 하에 양자화 스케일과 비트 폭을 동시에 최적화하는 완전히 미분 가능한 양자화 프레임워크를 개발한다.
  • 특히 다중 헤드 자기주의(MSA) 및 GELU 레이어에서 비틀린 아키텍처 특성에 맞는 혼합 정밀도 양자화를 가능하게 한다.
  • 3비트 정밀도에서 안정적인 훈련과 높은 성능을 달성하여 ViT 양자화의 한계를 극복한다.

제안 방법

  • 양자화 스케일과 비트 폭 모두를 미분 가능하고 학습 가능한 파라미터로 삼는 완전히 미분 가능한 양자화 프레임워크를 도입한다.
  • 헤드별 비트 폭 할당 기법을 제안하여 MSA 내 각 주의 헤드가 양자화에 대한 내성에 따라 개별적으로 다른 비트 폭을 학습할 수 있도록 한다.
  • 스케일과 비트 폭의 공동 최적화를 안정화하기 위해 스위치 가능한 스케일 메커니즘을 설계하여 훈련 중 수렴 문제를 해결한다.
  • 실험적 내성 분석에 기반해 민감한 구성 요소(특히 GELU 및 일부 MSA 헤드)에 더 높은 비트 폭을 할당함으로써 혼합 정밀도 양자화를 적용한다.
  • 정확도와 계산 제약 조건(BitOPs) 간 균형을 이루기 위해 정규화 항을 포함한 최적화 목표 함수를 제안한다.
  • 훈련 중 균일한 비트 폭에서 학습된 비트 폭으로 점진적으로 전이되는 온도 제어 전략(σ)을 사용하여 최적화 안정성을 향상시킨다.

실험 결과

연구 질문

  • RQ1비전 트랜스포머 내에서 양자화 노이즈에 가장 민감한 구성 요소는 무엇이며, 이들의 내성은 레이어 및 헤드 간에 어떻게 다를까?
  • RQ2다양한, 종단 간 훈련 방식을 사용할 때, 스케일과 비트 폭을 동시에 최적화하는 것이 ViT에서 안정적으로 이루어질 수 있을까?
  • RQ3균일한 비트 폭 대비 헤드별 비트 폭 할당이 저비트 ViT 양자화에서 성능 향상에 기여할 수 있을까?
  • RQ43비트 양자화된 ViT가 심각한 성능 저하 없이 경쟁 가능한 정확도를 달성할 수 있을까?
  • RQ5스위치 가능한 스케일 기법은 혼합 정밀도 ViT 양자화에서 수렴성과 성능을 어떻게 향상시키는가?

주요 결과

  • GELU 활성화 레이어는 긴 尾部 분포를 가지므로 양자화에 매우 민감하여 안정적인 성능을 확보하기 위해 더 높은 비트 폭이 필요하다.
  • MSA 내 주의 헤드들은 양자화에 대한 내성에서 크게 차이를 보이며, 일부 헤드(예: DeiT-Small의 인덱스 1 및 2)는 2비트로 양자화될 경우 심각한 정확도 저하를 초래한다.
  • Q-ViT는 DeiT-Tiny에서 3비트 양자화 시 ImageNet에서 69.15%의 상위-1 정확도를 달성하며, 최신 기술 수준의 균일 양자화 방법인 LSQ+보다 1.5% 높은 성능을 기록한다.
  • 스위치 가능한 스케일 기법은 수렴에 필수적이다: 이 기법 없이선 3비트 및 4비트 설정 모두에서 균일 양자화보다 성능이 열 劣하다.
  • 헤드별 비트 폭 할당은 다양한 ViT 아키텍처에서 성능을 0.5% 향상시키며, 각 헤드의 정밀도 적응의 중요성을 입증한다.
  • GELU 레이어는 3비트 제약 조건 하에서도 일관되게 높은 비트 폭(일반적으로 ≥4비트)을 학습하며, 이는 민감성과 적응형 할당의 효과를 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.