Skip to main content
QUICK REVIEW

[논문 리뷰] Any-Precision LLM: Low-Cost Deployment of Multiple, Different-Sized LLMs

Yeonhong Park, Jake Hyun|arXiv (Cornell University)|2024. 02. 16.
Advanced Surface Polishing Techniques인용 수 4
한 줄 요약

이 논문은 하나의 n비트 모델 내에서 임의의 비트 폭(3–8비트)으로 후기 훈련 정밀도 양자화를 가능하게 함으로써, 다양한 크기의 LLM을 저비용으로 배포할 수 있는 Any-Precision LLM을 제안한다. 이는 경량 정밀도 양자화 방법과 비트 간섭 메모리 레이아웃을 갖춘 전용 소프트웨어 엔진을 통해 달성되며, 메모리 사용량을 단일 n비트 모델 수준으로 줄이고도 최신 기술 수준의 모델 품질과 높은 추론 처리량을 유지한다.

ABSTRACT

Recently, considerable efforts have been directed towards compressing Large Language Models (LLMs), which showcase groundbreaking capabilities across diverse applications but entail significant deployment costs due to their large sizes. Meanwhile, much less attention has been given to mitigating the costs associated with deploying multiple LLMs of varying sizes despite its practical significance. Thus, this paper introduces \emph{any-precision LLM}, extending the concept of any-precision DNN to LLMs. Addressing challenges in any-precision LLM, we propose a lightweight method for any-precision quantization of LLMs, leveraging a post-training quantization framework, and develop a specialized software engine for its efficient serving. As a result, our solution significantly reduces the high costs of deploying multiple, different-sized LLMs by overlaying LLMs quantized to varying bit-widths, such as 3, 4, ..., $n$ bits, into a memory footprint comparable to a single $n$-bit LLM. All the supported LLMs with varying bit-widths demonstrate state-of-the-art model quality and inference throughput, proving itself to be a compelling option for deployment of multiple, different-sized LLMs. Our code is open-sourced and available online.

연구 동기 및 목표

  • 실세계 응용에서 다양한 크기의 LLM을 배포하는 데 드는 높은 비용을 해결하기 위해.
  • 단일 통합 모델 저장소를 사용하여 다양한 비트 폭(3–n비트)의 LLM을 효율적으로 추론할 수 있도록 하기 위해.
  • 기존의 양자화 방법이 재훈련이 필요하거나 낮은 비트 폭에서 메모리 대역폭을 줄이지 못하는 한계를 극복하기 위해.
  • 최소한의 성능 저하로 어떤 정밀도 추론도 지원하는 소프트웨어 엔진을 개발하기 위해.
  • Any-Precision LLM이 모든 비트 폭에서 최신 기술 수준의 정밀도와 추론 처리량을 달성하거나 초월할 수 있음을 입증하기 위해.

제안 방법

  • 고비트 모델에서 가장 중요도가 높은 비트(MSB)를 추출하여 저비트 모델을 생성하는 경량 후기 훈련 양자화(PTQ) 프레임워크로, 임의 정밀도 성질을 유지한다.
  • 추론 중에 필요한 비트 폭만 효율적으로 액세스할 수 있도록 하는 비트 간섭(비트플레인) 메모리 레이아웃을 통한 가중치 저장 방식.
  • 각 가중치의 비트 벡터에서 관련 부분만 로드하여 메모리 대역폭 사용을 줄이는 최적화된 GPU 커널로, 양자화된 행렬-벡터 곱셈을 처리한다.
  • 후기 훈련 양자화를 통해 저비트 양자화 모델을 점진적으로 고비트 폭으로 확장하면서도 모델 품질을 유지한다.
  • 임의 정밀도 양자화 파이프라인을 전용 서빙 엔진과 통합하여 추론 시에 비트 폭을 동적으로 선택할 수 있도록 한다.
  • 현재 LLM 추론 최적 실천 방식과 일관되게 가중치 전용 양자화를 채택하여 메모리 병목 현상을 줄인다.

실험 결과

연구 질문

  • RQ1단일 LLM이 최소한의 메모리 오버헤드로 다양한 비트 폭(3–n비트)의 모델을 효율적으로 제공할 수 있는가?
  • RQ2후기 훈련 양자화를 어떻게 조정하여 재훈련이나 미세조정 없이도 임의 정밀도 LLM을 구현할 수 있는가?
  • RQ3메모리 레이아웃과 커널 연산 최적화를 통해 전용 소프트웨어 엔진이 낮은 비트 폭 추론에서 메모리 대역폭 사용을 줄일 수 있는가?
  • RQ4임의 정밀도 LLM이 모든 지원 비트 폭에서 최신 기술 수준의 모델 품질을 유지하는가?
  • RQ5제안된 시스템은 비임의 정밀도 최신 기술 수준 엔진과 비교해도 높은 추론 처리량을 달성할 수 있는가?

주요 결과

  • 제안된 방법은 3–8비트로 양자화된 LLM을 단일 8비트 모델 수준의 메모리 사용량으로 압축하여 저장 및 메모리 비용을 크게 절감한다.
  • 임의 정밀도 LLM은 각 비트 폭에서 최신 기술 수준의 모델 품질을 달성하며, 기존의 양자화 기법과 비교해도 동등하거나 뛰어나다.
  • 비트 간섭 메모리 레이아웃을 사용함에도 불구하고, 임의 정밀도 LLM의 추론 처리량은 비임의 정밀도 최신 기술 수준 엔진과 동등하거나 뛰어나다.
  • 이 솔루션은 추론 시 동적 모델 선택을 가능하게 하여 사전 추론과 저지연 워크로드를 지원한다.
  • 기존 커널이 전체 비트 벡터를 로드하는 것과 달리, 이 방법은 필요한 비트 폭만 로드하여 메모리 대역폭 사용을 줄인다.
  • 이 방법은 하나의 모델 저장소만으로도 서로 다른 품질-지연 특성 트레이드오프를 가진 다수의 LLM을 구동할 수 있어 운영 비용을 절감한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.