Skip to main content
QUICK REVIEW

[논문 리뷰] FQ-ViT: Fully Quantized Vision Transformer without Retraining

Yang Lin, Tianyu Zhang|arXiv (Cornell University)|2021. 11. 27.
Advanced Neural Network Applications참고 문헌 45인용 수 10
한 줄 요약

이 논문은 FQ-ViT를 소개하며, 재학습 없이도 최신 기술 수준의 성능을 달성하는 완전 양자화된 비전 트랜스포머를 위한 방법을 제안한다. 하드웨어 우수한 정규화를 위해 '2의 거듭제곱 스케일(PTS)'을, 효율적인 4비트 어텐션 맵 양자화를 위해 '로그 정수 소프트맥스(LIS)'를 제안한다. ViT-L을 사용해 ImageNet에서 85.17% Top-1 정확도를 기록했으며, Cascade Mask R-CNN(Swin-S)를 사용해 COCO에서 51.4 mAP를 달성하여, 재학습 없이도 완전 양자화된 트랜스포머에서 새로운 SOTA를 수립했다. 전체 정확도 손실은 약 1%에 불과하다.

ABSTRACT

Network quantization significantly reduces model inference complexity and has been widely used in real-world deployments. However, most existing quantization methods have been developed and tested mainly on Convolutional Neural Networks (CNN), and suffer severe degradation when applied to Transformer-based architectures. In this work, we present a systematic method to reduce the performance degradation and inference complexity of Quantized Transformers. In particular, we propose Powers-of-Two Scale (PTS) to deal with the serious inter-channel variation of LayerNorm inputs in a hardware-friendly way. In addition, we propose Log-Int-Softmax (LIS) that can sustain the extreme non-uniform distribution of the attention maps while simplifying inference by using 4-bit quantization and the BitShift operator. Comprehensive experiments on various Transformer-based architectures and benchmarks show that our methods outperform previous works in performance while using even lower bit-width in attention maps. For instance, we reach 85.17% Top-1 accuracy with ViT-L on ImageNet and 51.4 mAP with Cascade Mask R-CNN (Swin-S) on COCO. To our knowledge, we are the first to achieve comparable accuracy degradation (~1%) on fully quantized Vision Transformers. Code is available at https://github.com/linyang-zhh/FQ-ViT.

연구 동기 및 목표

  • 기존의 양자화 방법을 비전 트랜스포머에 적용할 경우 관찰되는 심각한 성능 저하 문제를 해결하기 위해.
  • 하드웨어 우수한 양자화 기법을 통해 트랜스포머 기반 모델의 추론 복잡도를 감소시키기 위해.
  • 재학습 없이도 엔드 투 엔드로 비전 트랜스포머를 양자화할 수 있도록 하기 위해.
  • 저비트 양자화 하에서 극도로 비균일한 어텐션 맵 분포가 존재하는 상황에서도 높은 모델 정확도를 유지하기 위해.
  • 어 attention 맵에 대해 4비트 정밀도를 사용함으로써 완전 양자화된 비전 트랜스포머에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 레이어노멀라이제이션 입력의 채널 간 변동성을 다루기 위해 2의 거듭제곱 스케일링 인자(PTS)를 도입함으로써 효율적인 하드웨어 구현을 가능하게 한다.
  • 로그arithmic 정수 근사와 비트시프트 연산을 사용해 4비트 추론을 단순화하는 양자화 우수한 어텐션 메커니즘인 '로그 정수 소프트맥스(LIS)'를 제안한다.
  • 키-밸류 프로젝션과 어텐션 맵에 모두 4비트 양자화를 적용하여 모델 크기와 계산 비용을 크게 감소시킨다.
  • 다양한 비전 트랜스포머 아키텍처에 걸쳐 정확도를 유지하는 양자화 인식 훈련 없음 파이프라인을 설계한다.
  • 비싼 부동소수점 연산을 효율적인 비트 시프트로 대체함으로써 추론 속도를 향상시키기 위해 비트시프트 연산자를 사용한다.
  • 동적 범위 적응을 갖춘 대칭 양자화 방식을 사용해 어텐션 맵의 분포 특성을 유지한다.

실험 결과

연구 질문

  • RQ1재학습 없이도 완전 양자화된 비전 트랜스포머를 4비트 정밀도로 유지하면서도 높은 정확도를 달성할 수 있는가?
  • RQ2하드웨어 제약이 있는 양자화 하에서 레이어노멀라이제이션 입력의 채널 간 변동성을 효과적으로 관리할 수 있는가?
  • RQ3극도로 비균일한 어텐션 맵 분포를 유지하면서도 효율적인 추론을 가능하게 하는 양자화 방법은 가능한가?
  • RQ4저비트 정밀도 하에서 완전 양자화된 비전 트랜스포머의 성능 한계는 어디까지인가?
  • RQ5최소한의 정확도 손실로 완전 양자화된 트랜스포머에서 최신 기술 수준의 정확도를 달성하는 것이 가능한가?

주요 결과

  • FQ-ViT는 재학습 없이도 ViT-L을 사용해 전체 4비트 양자화로 ImageNet에서 85.17% Top-1 정확도를 달성했다.
  • Cascade Mask R-CNN를 사용해 Swin-S를 활용해 COCO에서 51.4 mAP를 기록하여 객체 검출에서 뛰어난 성능을 입증했다.
  • 완전 양자화된 비전 트랜스포머에서 약 1%의 정확도 손실만을 보이며, 이는 새로운 SOTA를 수립했다.
  • 로그 정수 소프트맥스는 비트시프트 연산을 통해 효율적인 4비트 추론을 가능하게 하면서도 어텐션 맵 품질을 유지한다.
  • 2의 거듭제곱 스케일은 최소한의 계산 오버헤드로 레이어노멀라이제이션 입력의 채널 간 변동성을 효과적으로 완화한다.
  • 다양한 비전 트랜스포머 아키텍처와 벤치마크에서 이전의 연구들보다 정확도와 비트 폭 효율성 측면에서 뛰어난 성능을 발휘한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.