[논문 리뷰] FP8 Quantization: The Power of the Exponent
이 논문은 신경망 추론을 위한 INT8보다 우수한 대안으로 FP8 양자화를 제안하며, 지수의 유연성을 활용해 외곽치를 더 잘 처리한다. 다양한 기반의 FP8 시뮬레이션 프레임워크를 도입하여 최적의 지수 바이어스와 가수/지수 비트 할당을 함께 학습하며, 특히 고외곽치 네트워크에서의 후기훈련 양자화(PTQ)에서 FP8이 INT8을 능가함을 보여주며, QAT는 두 형식 간 격차를 줄인다.
When quantizing neural networks for efficient inference, low-bit integers are the go-to format for efficiency. However, low-bit floating point numbers have an extra degree of freedom, assigning some bits to work on an exponential scale instead. This paper in-depth investigates this benefit of the floating point format for neural network inference. We detail the choices that can be made for the FP8 format, including the important choice of the number of bits for the mantissa and exponent, and show analytically in which settings these choices give better performance. Then we show how these findings translate to real networks, provide an efficient implementation for FP8 simulation, and a new algorithm that enables the learning of both the scale parameters and the number of exponent bits in the FP8 format. Our chief conclusion is that when doing post-training quantization for a wide range of networks, the FP8 format is better than INT8 in terms of accuracy, and the choice of the number of exponent bits is driven by the severity of outliers in the network. We also conduct experiments with quantization-aware training where the difference in formats disappears as the network is trained to reduce the effect of outliers.
연구 동기 및 목표
- 저해상도 부동소수점 형식인 FP8이 신경망 양자화에서 INT8보다 우월한지 조사한다.
- FP8의 지수와 가수 비트 선택이 다양한 데이터 분포 하에서 모델 정확도에 미치는 영향을 분석한다.
- 스케일링 인자와 비트 할당을 동시에 최적화할 수 있는 효율적이고 미분 가능한 FP8 시뮬레이션 프레임워크를 개발한다.
- 다양한 네트워크에서 후기훈련 양자화(PTQ) 및 양자화 인식 훈련(QAT) 환경에서 FP8 성능을 평가한다.
- 실세계 모델을 위한 최적의 FP8 형식과 바이어스 설정을 규명함으로써 하드웨어 설계를 안내한다.
제안 방법
- FP32 하드웨어에서 미분 가능한 FP8 양자화 시뮬레이션을 제안하여 스케일링 인자와 비트 할당의 기울기 기반 최적화를 가능하게 한다.
- 각 레이어별로 학습 가능한 지수 바이어스를 도입하여 분포 특성에 맞게 동적으로 조정할 수 있도록 한다.
- 반올림 연산을 통한 역전파를 위해 직선통과 추정기(STE)를 활용하여 가수와 지수 비트 수의 공동 최적화를 가능하게 한다.
- 서브넷, 지수, 가수 비트를 구성할 수 있는 유연한 FP8 형식을 설계하여 3M4E, 4M3E, 5M2E, 2M5E 구성 지원.
- 다양한 네트워크와 데이터 모odal리티에서 PTQ 및 QAT를 통해 방법을 검증하며, 다양한 형식 간 정확도를 비교한다.
- 로그 간격 히스토그램 분석을 통해 FP8 및 INT8 형식 간 동적 범위 대 정밀도의 상충 관계를 시각화한다.
실험 결과
연구 질문
- RQ1후기훈련 양자화에서 FP8 양자화가 정확도 측면에서 INT8을 능가하는가?
- RQ2FP8의 가수 및 지수 비트 구성이 다양한 네트워크 유형에서 모델 성능에 미치는 영향은 어떠한가?
- RQ3가수와 지수 간 비트 할당 및 지수 바이어스를 역전파를 통해 함께 학습할 수 있는가?
- RQ4양자화 인식 훈련(QAT)을 사용할 경우 FP8의 이점은 어느 정도 감소하는가?
- RQ5활성화 및 가중치의 외곽치 분포가 최적의 FP8 형식 선택에 미치는 영향은 어떠한가?
주요 결과
- 외곽치가 존재할 경우, 다양한 네트워크에서 후기훈련 양자화에서 FP8 양자화가 INT8을 능가한다.
- 5M2E 및 4M3E FP8 형식이 가장 높은 정확도를 달성하며, 트랜스포머와 같은 극단적인 외곽치를 가진 네트워크에서는 높은 지수 비트 수(예: 4 또는 5)가 최적임을 확인하였다.
- 지수 비트 수의 선택은 외곽치 심각도에 의해 결정되며, 더 많은 지수 비트 수는 극단적 값의 동적 범위를 증가시키고 양자화 오차를 감소시킨다.
- 양자화 인식 훈련(QAT)에서는 FP8과 INT8 간 성능 격차가 사라지며, 네트워크가 INT8 양자화 격자에 적응하기 때문이다.
- 제안된 미분 가능한 FP8 시뮬레이션은 스케일링 인자와 가수 및 지수 간 최적 비트 할당을 효율적으로 종단 간(end-to-end) 학습할 수 있도록 한다.
- 본 연구는 FP8의 추가 자유도(지수를 통한)가 활성화 및 가중치의 동적 범위를 더 잘 유지함으로써 INT8보다 의미 있는 이점을 제공함을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.