Skip to main content
QUICK REVIEW

[논문 리뷰] PB-LLM: Partially Binarized Large Language Models

Yuzhang Shang, Zhihang Yuan|arXiv (Cornell University)|2023. 09. 29.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 부분적으로 이元화된 대규모 언어 모델인 PB-LLM을 제안하며, 주요 가중치를 더 높은 정밀도로 유지함으로써 극한의 1비트 양자화 조건에서도 높은 언어적 추론 능력을 유지한다. 사후 양자화에서 헤시안 기반 복원과 양자화 인식 훈련에서 유도된 스케일링 전략을 결합함으로써, PB-LLM는 4비트에서 최신 기술 수준의 성능을 달성하며 전체 1비트 LLM에 대한 강력한 잠재력을 보여준다.

ABSTRACT

This paper explores network binarization, a radical form of quantization, compressing model weights to a single bit, specifically for Large Language Models (LLMs) compression. Due to previous binarization methods collapsing LLMs, we propose a novel approach, Partially-Binarized LLM (PB-LLM), which can achieve extreme low-bit quantization while maintaining the linguistic reasoning capacity of quantized LLMs. Specifically, our exploration first uncovers the ineffectiveness of naive applications of existing binarization algorithms and highlights the imperative role of salient weights in achieving low-bit quantization. Thus, PB-LLM filters a small ratio of salient weights during binarization, allocating them to higher-bit storage, i.e., partially-binarization. PB-LLM is extended to recover the capacities of quantized LMMs, by analyzing from the perspective of post-training quantization (PTQ) and quantization-aware training (QAT). Under PTQ, combining the concepts from GPTQ, we reconstruct the binarized weight matrix guided by the Hessian matrix and successfully recover the reasoning capacity of PB-LLM in low-bit. Under QAT, we freeze the salient weights during training, explore the derivation of optimal scaling factors crucial for minimizing the quantization error, and propose a scaling mechanism based on this derived scaling strategy for residual binarized weights. Those explorations and the developed methodologies significantly contribute to rejuvenating the performance of low-bit quantized LLMs and present substantial advancements in the field of network binarization for LLMs.The code is available at https://github.com/hahnyuan/BinaryLLM.

연구 동기 및 목표

  • 극한의 저비트 양자화 조건에서 단순 이원화가 LLM의 추론 능력을 유지하지 못하는 데서 비롯되는 문제를 해결하기 위해.
  • 효율적인 저비트 양자화를 가능하게 하는 주요 가중치의 역할을 조사하기 위해.
  • 모델 압축과 성능 유지 사이의 균형을 맞추는 부분적으로 이원화된 프레임워크를 개발하기 위해.
  • 고도로 발전한 사후 양자화(PTQ) 및 양자화 인식 훈련(QAT) 기법을 통해 양자화된 LLM에서 추론 능력을 복원하기 위해.
  • 언어적 추론 성능을 유지하면서도 1비트 LLM의 효율적인 훈련과 배포를 가능하게 하기 위해.

제안 방법

  • 주요 가중치의 일부 비율을 더 높은 비트 정밀도로 저장하면서 나머지 부분은 이원화하는 부분적으로 이원화된 LLM(PB-LLM)을 도입한다.
  • 사후 양자화(PTQ)에서 헤시안 행렬 기반 복원을 적용하여 성능을 복구하며, 이는 GPTQ에서 영감을 받았다.
  • 이원화된 가중치에 대한 최적의 스케일링 인자를 유도하여 양자화 오차를 최소화하고, QAT에서 효과적인 스케일링을 가능하게 한다.
  • QAT 동안 주요 가중치를 동결하여 그 무결성을 유지하고 훈련의 안정성을 향상시킨다.
  • 주요 가중치 보존과 적응형 스케일링을 조합한 하이브리드 접근 방식을 사용하여 압축과 성능 사이의 균형을 맞춘다.
  • 효율적인 QAT를 위해 AdamW 옵timizer와 코시 감쇠 전략을 사용한 10,000회 반복 미세조정 스케줄을 적용한다.

실험 결과

연구 질문

  • RQ1왜 표준 이원화 방법이 LLM에 직접 적용되었을 때 실패하는가?
  • RQ2주요 가중치는 어떻게 하여 효율적인 저비트 양자화를 가능하게 하는가?
  • RQ3극한의 저비트 양자화된 LLM에서 추론 능력을 어떻게 복원할 수 있는가?
  • RQ4QAT 조건에서 이원화된 LLM의 양자화 오차를 최소화하는 최적의 스케일링 전략은 무엇인가?
  • RQ5PB-LLM는 최소한의 미세조정으로 4비트 및 근접 1비트 수준에서 경쟁 가능한 성능을 달성할 수 있는가?

주요 결과

  • PB-LLM 30% (주요 가중치의 30%를 유지)는 일반 지식 추론 작업에서 평균 0-샷 정확도 66.9를 기록하며, 동일한 4비트 설정에서 LLM-QAT를 능가한다.
  • PB-LLM 10%는 평균 60.6의 0-샷 정확도를 기록하며, 높은 정밀도로 유지되는 가중치 비율이 10%뿐이지만 1비트 LLM에 대한 강력한 잠재력을 보여준다.
  • PB-LLM는 QAT 조건에서 단 10,000회 반복 내에 수렴하며, LLM-QAT가 100,000회 반복을 필요로 한 것에 비해 훨씬 더 빠른 수렴 속도를 보인다.
  • C4 데이터셋에서 퍼즐리티가 PB-GPTQ 50% (50%의 주요 가중치를 유지) 조건에서 8.1466로 떨어지며, 성능 손실가능성을 관리하면서 효과적인 압축을 달성함을 보여준다.
  • 10%의 주요 가중치를 유지한 PB-GPTQ는 C4에서 퍼즐리티 72.1115로 급격한 성능 저하를 보이며, 충분한 주요 가중치 유지의 필요성을 강조한다.
  • QAT에서 유도된 스케일링 전략은 양자화 오차를 효과적으로 최소화하여, 치밀한 이원화 조건에서도 높은 성능을 달성할 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.