[논문 리뷰] Integer or Floating Point? New Outlooks for Low-Bit Quantization on Large Language Models
이 논문은 대규모 언어 모델의 저비트 양자화를 최적화하기 위해 동일한 비트 폭(예: INT8/FP8)에서 INT 및 FP 형식을 동적으로 선택하는 계층별 접근 방식인 혼합 형식 양자화(MoFQ)를 제안한다. MoFQ는 하드웨어 오버헤드 없이 8비트 WA 양자화에서 정밀도 기반 정밀도를 유지하면서도 4비트 W-only 양자화에서 GPTQ를 능가하는 10배 빠른 속도로 최신 기술 성능을 달성한다.
Efficient deployment of large language models (LLMs) necessitates low-bit quantization to minimize model size and inference cost. While low-bit integer formats (e.g., INT8/INT4) have been the conventional choice, emerging low-bit floating-point formats (e.g., FP8/FP4) offer a compelling alternative and are gaining support from cutting-edge hardware, such as NVIDIA's H100 GPU. However, the superiority of low-bit INT versus FP formats for quantization on LLMs remains unclear. In this study, we conduct a comparative analysis of INT and FP quantization with the same bit-width, revealing that the optimal quantization format varies across different layers due to the complexity and diversity of tensor distribution. Consequently, we advocate the Mixture of Formats Quantization (MoFQ), which selects the optimal format on a layer-wise basis. This simple yet effective approach achieves state-of-the-art results in both weight-only (W-only) and weight-activation (WA) post-training quantization scenarios when tested on LLaMA across various tasks. In 4-bit W-only quantization, MoFQ surpasses GPTQ without complex hyperparameter tuning and with an order of magnitude faster quantization speed. While in 8-bit WA quantization, MoFQ significantly outperforms INT/FP-only methods, achieving performance close to the full precision model. Notably, MoFQ incurs no hardware overhead compared to INT/FP-only quantization, as the bit-width remains unchanged.
연구 동기 및 목표
- 대규모 언어 모델의 저비트 양자화에서 INT 또는 FP 형식 중 어느 것이 우월한지 조사한다.
- 다양한 텐서 분포로 인해 다양한 계층에서 INT 또는 FP 형식 간에 일관된 우월성이 나타나지 않는 문제를 해결한다.
- 최적의 형식을 계층별로 선택하여 양자화 오차를 최소화하는 실용적이고 하드웨어 호환성 있는 방법을 개발한다.
- 하드웨어 비용을 증가시키지 않고도 웨이트 오직 양자화와 웨이트-활성화 양자화 양쪽 모두에서 최신 기술 성능을 달성한다.
제안 방법
- 양자화 오차는 텐서 MSE, 계층 출력 MSE 또는 모델 출력 MSE 등의 지표를 사용하여 평가하며, 이를 바탕으로 각 계층에서 최적의 형식을 선택한다.
- MoFQ는 동일한 비트 폭(예: INT8 대비 FP8)의 INT 및 FP 형식을 계층별로 선택하여, 각 계층에서 일관된 데이터 타입과 비트 폭을 유지한다.
- 형식 선택은 경험적 오차 최소화에 기반하며, 복잡한 하이퍼파라미터 튜닝이나 두 번째 차수 최적화가 필요하지 않다.
- MoFQ는 기존의 INT 전용 양자화 하드웨어와 호환되며, NVIDIA H100과 같은 신형 FP8 호환 하드웨어와도 원활하게 통합된다.
- 이 방법은 각 계층에서 동일한 비트 폭과 데이터 타입을 유지하므로 추가적인 하드웨어나 메모리 오버헤드가 없다.
- 웨이트 오직 양자화(모델 압축용)와 웨이트-활성화 양자화(추론 가속용) 양쪽 모두를 지원한다.
실험 결과
연구 질문
- RQ1대규모 언어 모델의 모든 계층에서 동일한 비트 폭(예: 8비트)을 가진 INT 또는 FP 양자화 형식이 일관되게 다른 형식을 능가하는가?
- RQ2다이나믹 대비 스태틱, 아웃라이어 존재 여부, 값 범위와 같은 텐서 분포 특성이 INT 및 FP 양자화의 상대적 성능에 미치는 영향은 무엇인가?
- RQ3각 계층에서 최적의 형식을 선택하는 혼합 형식 전략이 균일한 INT 또는 FP 양자화보다 더 높은 양자화 정확도를 달성할 수 있는가?
- RQ44비트 및 8비트와 같은 저비트 폭에서 INT 및 FP 곱셈-합산 유닛 간의 하드웨어 효율성 트레이드오프는 어떠한가?
- RQ5GPTQ와 같이 하이퍼파라미터에 민감한 복잡한 방법보다 단순하고 오버헤드가 낮은 형식 선택 전략이 4비트 웨이트 오직 양자화에서 더 뛰어난 성능을 낼 수 있는가?
주요 결과
- 4비트 웨이트 오직 양자화에서 MoFQ는 GPTQ와 비슷하거나 뛰어난 성능을 보이며, 양자화 속도가 10배 빠르다.
- 8비트 웨이트-활성화 양자화에서 MoFQ는 순수한 INT8 및 FP8 방법을 크게 능가하며, 전체 정밀도 FP16 기준 기준에 가까운 모델 정확도를 달성한다.
- MoFQ는 LLaMA 및 OPT 모델의 다양한 크기에서 여러 벤치마크(WikiText-2, LAMBADA, PIQA, HellaSwag)에서 최신 기술 성능을 달성한다.
- WikiText-2에서 MoFQ8는 LLaMA-13B에서 퍼플렉서티 5.41을 기록했으며, FP8(5.41)와 유사하고 INT8(637.95)를 능가했다. 선택된 형식 중 92.7%가 FP8이었다.
- 모델 간 정확도 손실이 최소화되었다. LLaMA-33B의 경우 MoFQ8는 LAMBADA에서 평균 정확도 0.859를 기록했으며, FP16 기준 0.862와 유사했고, 90.0%의 계층이 FP8을 사용했다.
- MoFQ는 INT 전용 양자화와 비교해 하드웨어 오버헤드가 없으며, 각 계층의 비트 폭과 데이터 타입이 그대로 유지되기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.