[논문 리뷰] Outlier Suppression+: Accurate quantization of large language models by equivalent and optimal shifting and scaling
Outlier Suppression+ (OS+)는 대규모 언어 모델을 위한 새로운 후학습 양자화 프레임워크를 제안하며, 활성화에서 비대칭적이고 집중된 이상치를 억제하기 위해 채널별 이동과 스케일링을 사용한다. 이러한 연산을 후속 레이어로 등가적으로 이관하고 출력 변화를 최소화하도록 이동/스케일링 값 최적화를 통해 OS+는 8비트 및 6비트에서 거의 부동소수점 성능을 달성하며, 4비트 BERT에서 15.5%의 정확도 향상을 이룩하여 새로운 SOTA를 수립한다.
Post-training quantization~(PTQ) of transformer language models faces significant challenges due to the existence of detrimental outliers in activations. We observe that these outliers are concentrated in specific channels and are asymmetric across channels. To address this issue, we propose the Outlier Suppression+~(OS+) framework, which contains the channel-wise shifting for asymmetry and channel-wise scaling for concentration. We show that these operations can be seamlessly migrated into subsequent modules while maintaining equivalence. Second, we propose a fast and stable scheme to calculate effective shifting and scaling values. The channel-wise shifting aligns the center of each channel for removal of outlier asymmetry. The channel-wise scaling quantitatively evaluates changes brought by migration and quantization for better quantization burden balance. We validate our OS+ under both standard and fine-grained quantization settings with models including BERT, OPT, BLOOM, BLOOMZ, and LLaMA. Comprehensive results across various tasks demonstrate the superiority of our approach. Especially, with standard quantization, OS+ can achieve near-floating-point performance on both small models and large language models on 8-bit and 6-bit. Besides, we establish a new state-of-the-art for 4-bit BERT with 15.5\% improvement. Our code is available at \url{https://github.com/ModelTC/Outlier_Suppression_Plus}.
연구 동기 및 목표
- 대규모 언어 모델의 후학습 양자화에서 해로운 이상치가 모델 정확도를 떨어뜨리는 문제를 해결하기 위해.
- 이전에 간과되었던 특성인 채널 간 비대칭 이상치 분포를 식별하고 활용하기 위해.
- 최적화된 이동과 스케일링을 통해 전체 정밀도 등가성을 유지하면서 양자화 오차를 최소화하는 방법을 개발하기 위해.
- 추가 학습이나 추론 오버헤드 없이 효율적이고 하드웨어 우수한 양자화를 가능하게 하기 위해.
- 다양한 대규모 언어 모델에서 표준 및 세밀한 양자화 설정에서 최신 기술 성능을 달성하기 위해.
제안 방법
- 채널별 이동을 도입하여 채널 간 이상치 분포의 비대칭성을 제거하고 전체 텐서 범위를 줄인다.
- 채널별 스케일링을 적용하여 극단적인 이상치 값을 집중시키고 억제함으로써 양자화에 대한 영향을 최소화한다.
- 이동 및 스케일링 효과를 후속 레이어로 이관하는 통합된 이동 패턴을 설계하여 전체 정밀도 모델 출력을 유지한다.
- 출력 변화를 최소화하는 데 기반한 효과적인 이동 및 스케일링 값 계산을 위한 빠르고 안정적인 최적화 기법을 제안한다. 이는 활성화 또는 가중치 양자화 오차 최소화가 아닌 것이다.
- 양자화 부담을 레이어 간 균형 잡히게 하기 위해 정량적 목적 함수를 사용하여 종단 간 출력 이탈을 최소화한다.
- 이전 레이어의 파라미터 업데이트를 통해 변환을 구현함으로써 추가 계산이나 재학습 없이도 구현이 가능하다.
실험 결과
연구 질문
- RQ1왜 트랜스포머 활성화에서 이상치가 후학습 양자화에서 상당한 성능 저하를 초래하는가?
- RQ2채널 간 비대칭 이상치 분포는 어떻게 체계적으로 다루어져야 하며, 이를 통해 양자화 정확도를 향상시킬 수 있는가?
- RQ3이동 및 스케일링 연산을 전체 정밀도 등가성을 유지하면서 양자화 오차를 줄이는 방식으로 적용할 수 있는가?
- RQ4양자화된 모델에서 종단 간 출력 변화를 최소화하는 데 가장 효과적인 이동 및 스케일링 값 최적화 전략은 무엇인가?
- RQ5이 방법은 4비트, 6비트, 8비트와 같은 저비트 폭에서 다양한 대규모 언어 모델에서 최신 기술 성능을 달성할 수 있는가?
주요 결과
- OS+는 8비트 및 6비트 양자화에서 소형 및 대형 언어 모델 모두에서 거의 부동소수점 성능을 달성하며, 정확도 손실가 최소한이다.
- 4비트 BERT에서 OS+는 이전 방법 대비 15.5%의 정확도 향상을 기록하여 새로운 SOTA를 수립했다.
- 이 방법은 테스트된 레이어에서 출력 양자화 오차를 1334.89로 줄였으며, 이는 OS(6182.52) 및 SQ(3535.86)보다 현저히 낮다.
- OPT-175B의 캘리브레이션은 약 20분이면 완료되어 실용성에서 높은 효율성을 입증한다.
- 추론 지연 시간은 최대 1.5배 향상되었으며, 배포된 모델에서 추가 계산 오버헤드가 없었다.
- 저장 용량이 고정된 조건에서 양자화된 대규모 모델이 더 작은 FP16 모델보다 뛰어난 성능을 보이며, 이는 강건성과 확장성의 가능성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.