Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding INT4 Quantization for Transformer Models: Latency Speedup, Composability, and Failure Cases

Xiaoxia Wu, Cheng Li|arXiv (Cornell University)|2023. 01. 27.
Ferroelectric and Negative Capacitance Devices인용 수 6
한 줄 요약

이 논문은 트랜스포머 기반 언어 모델을 위한 INT4 양자화(W4A4)를 조사하며, 인코더 전용(BERT) 및 인코더-디코더(BART) 모델에서는 거의 0에 가까운 정확도 손실을 보이며, 디코더 전용(GPT) 모델에서는 심각한 성능 저하를 보인다. 또한, 지연 시간 최적화 및 처리량 최적화를 모두 지원하는 고도로 최적화된 엔드 투 엔드 INT4 추론 파이프라인을 도입하여 FP16 대비 최대 8.5배의 지연 시간 감소와 기존 SOTA INT8 추론 대비 1.7배 향상을 달성하였으며, 실패 케이스 분석과 함께 프루닝 및 레이어 감소와의 조합 가능성도 분석하였다.

ABSTRACT

Improving the deployment efficiency of transformer-based language models has been challenging given their high computation and memory cost. While INT8 quantization has recently been shown to be effective in reducing both the memory cost and latency while preserving model accuracy, it remains unclear whether we can leverage INT4 (which doubles peak hardware throughput) to achieve further latency improvement. In this study, we explore the feasibility of employing INT4 weight and activation (W4A4) quantization for language models. Our findings indicate that W4A4 quantization introduces no to negligible accuracy degradation for encoder-only and encoder-decoder models, but causes a significant accuracy drop for decoder-only models. To materialize the performance gain using W4A4, we develop a highly optimized end-to-end W4A4 encoder inference pipeline supporting different quantization strategies. Our INT4 pipeline is $8.5 imes$ faster for latency-oriented scenarios and up to $3 imes$ for throughput-oriented scenarios compared to the inference of FP16, and improves the SOTA BERT INT8 performance from FasterTransformer by up to $1.7 imes$. We provide insights into the failure cases when applying W4A4 to decoder-only models, and further explore the compatibility of INT4 quantization with other compression methods, like pruning and layer reduction.

연구 동기 및 목표

  • 트랜스포머 기반 언어 모델에 대해 4비트 가중치와 활성화를 사용하는 W4A4 양자화의 실현 가능성을 평가하며, 특히 정확도 저하 여부를 중심으로 분석한다.
  • 지연 시간과 처리량에 최적화된 인코더 모델을 대상으로 고성능, 고도로 최적화된 엔드 투 엔드 INT4 추론 파이프라인을 개발한다.
  • W4A4 양자화 하에서 디코더 전용 모델(GPT 등)에서 발생하는 정확도 저하의 근본 원인을 분석한다.
  • 프루닝 및 레이어 감소와 같은 다른 압축 기법과의 조합 가능성(컴포저빌리티)을 연구한다.
  • 현존하는 SOTA INT8 추론 성능을 초월하기 위해 현대 GPU에서 INT4 연산의 높은 처리량을 활용한다.

제안 방법

  • BERT 및 BART 모델에 대해 W4A4 양자화를 가능하게 하기 위해 계층별 지식 정복과 양자화 인식 훈련(QAT)을 활용한다.
  • 정확도 손실을 최소화하기 위해 동적 범위 校정과 클리핑을 활용한 후행 양자화 기법을 적용한다.
  • CUDA 커널과 텐서 코어를 활용한 모듈식 고도 최적화된 INT4 추론 파이프라인을 설계하여 지연 시간 또는 처리량 최적화를 위한 다양한 양자화 전략을 지원한다.
  • 잔차 연결을 위한 전체 FP16 정밀도 유지와 함께, 어텐션 및 피드포워드 네트워크를 포함한 모든 선형 레이어에 양자화를 적용한다.
  • 디코더 모델의 실패 모드를 분리하기 위해 레이어 정규화, 미세튜닝 영향, 어텐션 메커니즘에 대한 분석적 연구를 수행한다.
  • W4A4와 50% 가중치 희소성(Ampere 아키텍처 기반) 및 25% 레이어 감소를 조합하여 성능 및 정확도의 상호 교환 관계를 측정함으로써 조합 가능성 평가를 수행한다.
Understanding INT4 Quantization for Transformer Models: Latency Speedup, Composability, and Failure Cases

실험 결과

연구 질문

  • RQ1W4A4 양자화는 인코더 전용(BERT), 인코더-디코더(BART), 디코더 전용(GPT) 트랜스포머 모델에 대해 수용 가능한 정확도 손실로 적용 가능한가?
  • RQ2W4A4 양자화 하에서 디코더 전용 모델에서 심각한 정확도 저하가 발생하는 주요 원인은 무엇인가?
  • RQ3현대 GPU 하드웨어에서 지연 시간과 처리량 향상을 극대화하기 위해 고도로 최적화된 엔드 투 엔드 INT4 추론 파이프라인을 어떻게 설계할 수 있는가?
  • RQ4INT4 양자화는 프루닝 및 레이어 감소와 같은 다른 압축 기법과의 조합에서 성능 저하 없이 어느 정도까지 가능할 수 있는가?
  • RQ5제안된 INT4 파이프라인은 기존 SOTA INT8 구현 대비 우수한 추론 성능을 달성할 수 있는가?

주요 결과

  • 분류 및 요약 작업에서 BERT(인코더 전용) 및 BART(인코더-디코더) 모델에 대해 W4A4 양자화는 정확도 손실가 없거나 무시할 만큼 미미한 수준이다.
  • 디코더 전용 모델(GPT 등)은 W4A4 양자화 하에서 자동 회귀 생성 작업에서 심각한 정확도 저하를 경험한다.
  • 제안된 INT4 추론 파이프라인은 HuggingFace FP16 추론 대비 지연 시간 최적화 시나리오에서 최대 8.5배의 속도 향상을, 처리량 최적화 시나리오에서는 최대 3배 향상을 달성한다.
  • 파이프라인은 FasterTransformer의 SOTA BERT INT8 성능을 최대 1.7배 향상시켜, INT4가 INT8보다 성능 향상에 유리함을 입증한다.
  • 레이어 감소 실험 결과, 9층 W4A4 BART 모델(6개 인코더, 3개 디코더)이 CNNDailyMail 데이터셋에서 전체 12층 모델의 99.4% 성능을 유지한다.
  • 조합 가능성 실험 결과, W4A4와 50% 희소성 조합 시 약 0.5 GLUE 포인트의 정확도 저하만 발생하며, 25% 레이어 감소 조합 시 요약 작업에서 정확도는 거의 유지된다.
Understanding INT4 Quantization for Transformer Models: Latency Speedup, Composability, and Failure Cases

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.