[논문 리뷰] Extreme Compression of Large Language Models via Additive Quantization
이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 파rameter당 2–3비트로 극한 압축하기 위한 새로운 수식적 양자화 방법인 AQLM을 소개한다. 인스턴스 인식형, 입력에 적응하는 코드북 최적화 및 레이어 블록 간 통합 튜닝을 통해 AQLM는 2비트 환경에서 최신 기술 수준의 정확도를 달성하며, 최대 8배 메모리 절감과 GPU에서는 최대 3.05배, CPU에서는 최대 4.07배의 속도 향상을 이룬다.
The emergence of accurate open large language models (LLMs) has led to a race towards performant quantization techniques which can enable their execution on end-user devices. In this paper, we revisit the problem of "extreme" LLM compression-defined as targeting extremely low bit counts, such as 2 to 3 bits per parameter-from the point of view of classic methods in Multi-Codebook Quantization (MCQ). Our algorithm, called AQLM, generalizes the classic Additive Quantization (AQ) approach for information retrieval to advance the state-of-the-art in LLM compression, via two innovations: 1) learned additive quantization of weight matrices in input-adaptive fashion, and 2) joint optimization of codebook parameters across each transformer blocks. Broadly, AQLM is the first scheme that is Pareto optimal in terms of accuracy-vs-model-size when compressing to less than 3 bits per parameter, and significantly improves upon all known schemes in the extreme compression (2bit) regime. In addition, AQLM is practical: we provide fast GPU and CPU implementations of AQLM for token generation, which enable us to match or outperform optimized FP16 implementations for speed, while executing in a much smaller memory footprint.
연구 동기 및 목표
- 기존 방법이 심각한 정확도 저하를 겪는 2–3비트 파라미터당 극한의 LLM 압축 문제를 해결하기 위해.
- 특히 수식적 양자화(AQ)를 포함한 다중 코드북 양자화(MCQ) 기법을 LLM 가중치의 사후 양자화에 확장하기 위해.
- 입력 인식 보정 및 블록 수준의 통합 최적화를 통합하여 저비트 환경에서 정확도-크기 파레토 최적화를 향상시키기 위해.
- 최소한의 지연 오버헤드를 유발하는 최적화된 GPU 및 CPU 추론 커널을 통해 압축된 LLM의 실용적 구현을 가능하게 하기 위해.
제안 방법
- 입력 토큰 분포 하에서 레이어 출력 오차를 최소화하는 방식으로 고전적 AQ 최적화 문제를 재구성한 학습된 수식적 양자화 프레임워크인 AQLM을 제안한다.
- 교정 데이터를 활용해 전체 레이어 블록을 통합적으로 최적화함으로써 인스턴스 인식형, 입력에 적응하는 코드북 학습을 도입한다.
- 코드북 학습 중 수렴 속도를 향상시키기 위해 잔차 K-means 초기화를 활용한다.
- 두 단계 학습 프로세스를 적용한다: 초기 코드북 학습 후 교정 기반 코드북 파aram터 보정.
- 더 작은 8비트 코드북을 활용해 캐시 활용도를 향상시키고 메모리 프로파일을 감소시키기 위해 AQLM 추론을 위한 효율적인 GPU 및 CPU 커널을 구현한다.
- 하이브리드 희소-양자화 구성 요소 없이도 균일한 양자화 포맷을 지원함으로써 배포를 단순화한다.
실험 결과
연구 질문
- RQ1다중 코드북 양자화(MCQ) 기법은 LLM 가중치의 사후 양자화에 효과적으로 적용될 수 있는가?
- RQ2기존의 직접 양자화 방식에 비해 인스턴스 인식형, 입력에 적응하는 코드북 최적화는 2비트 LLM 양자화에서 정확도를 크게 향상시키는가?
- RQ3레이어 블록 간 통합 최적화는 낮은 비트 폭 압축을 유지하면서도 모델 성능을 향상시킬 수 있는가?
- RQ4계산 복잡도를 감안할 때 AQLM은 일반 하드웨어에서 실시간 추론에 실용적으로 적용 가능한가?
- RQ5AQLM의 성능는 교정 데이터 크기와 코드북 구성(예: 코드 폭, 코드북 수)에 따라 어떻게 스케일링되는가?
주요 결과
- AQLM는 2비트 환경에서 최신 기술 수준의 성능을 달성하여 Llama 2 7B, 13B, 70B 모델에서 QuIP# 등 이전 방법들을 능가한다.
- Llama 2 70B 모델에서 AQLM는 2.07비트/파라미터로 Wiki2에서 퍼플렉서티 7.98을 달성하여 극한 압축에서도 높은 정확도를 확보했다.
- 70B 모델 추론에서 AQLM는 GPU(Nvidia RTX 3090)에서 FP16 대비 최대 3.05배 빠르며, CPU(Intel i9, 8코어)에서는 최대 4.07배 빠르게 작동한다.
- FP16 대비 최대 8배 메모리 프로파일을 감소시키면서도, FP16 추론 속도를 유지하거나 초월한다.
- 코드북 파aram터 보정이 정확도에 가장 큰 영향을 미치며, 교정 세트 크기가 4096개 시퀀스 이하일 경우 256개를 초과하면 수익 감소 효과가 나타난다.
- 여러 개의 작은 코드북(예: 2×8비트)을 사용하면 GPU 캐시 활용도가 향상되고 더 높은 속도 향상을 이룰 수 있으나, 약간의 정확도 손실이 수반된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.