[論文レビュー] Any-Precision LLM: Low-Cost Deployment of Multiple, Different-Sized LLMs
本稿では、1つのnビットモデル内で任意のビット幅(3〜8ビット)への微調整後量子化を可能にする低コストな手法、Any-Precision LLMを提案する。これは、軽量な量子化手法とビットインタリーブドメモリレイアウトを備えた特別なソフトウェアエンジンにより実現され、単一のnビットモデルとほぼ同等のメモリ使用量に抑えながら、最先端のモデル品質と高い推論スループットを維持する。
Recently, considerable efforts have been directed towards compressing Large Language Models (LLMs), which showcase groundbreaking capabilities across diverse applications but entail significant deployment costs due to their large sizes. Meanwhile, much less attention has been given to mitigating the costs associated with deploying multiple LLMs of varying sizes despite its practical significance. Thus, this paper introduces \emph{any-precision LLM}, extending the concept of any-precision DNN to LLMs. Addressing challenges in any-precision LLM, we propose a lightweight method for any-precision quantization of LLMs, leveraging a post-training quantization framework, and develop a specialized software engine for its efficient serving. As a result, our solution significantly reduces the high costs of deploying multiple, different-sized LLMs by overlaying LLMs quantized to varying bit-widths, such as 3, 4, ..., $n$ bits, into a memory footprint comparable to a single $n$-bit LLM. All the supported LLMs with varying bit-widths demonstrate state-of-the-art model quality and inference throughput, proving itself to be a compelling option for deployment of multiple, different-sized LLMs. Our code is open-sourced and available online.
研究の動機と目的
- 実世界の応用において、サイズが異なる複数のLLMを実行する際の高いデプロイコストを解消すること。
- 1つの統一されたモデルストレージを用いて、異なるビット幅(3–nビット)の複数のLLMを効率的に推論可能にする。
- 再訓練を要するか、低ビット幅でのメモリ帯域幅を削減できない既存の量子化手法の限界を克服すること。
- 最小限のパフォーマンス劣化で任意の精度推論をサポートするソフトウェアエンジンの開発。
- Any-Precision LLMが、モデル品質および推論スループットの両面で、現在の最先端の量子化モデルを同等または上回ることの実証。
提案手法
- 上位ビットモデルから最も有意義なビット(MSBs)を抽出することで、低ビットモデルを生成する軽量な微調整後量子化(PTQ)フレームワーク。これにより、任意精度の特性が維持される。
- 重みのためのビットインタリーブド(ビットプレーン)メモリレイアウト。これにより、推論時に必要なみなしビット幅のみを効率的にアクセス可能になる。
- 量子化された行列ベクトル積に最適化されたカスタムGPUカーネル。各重みのビットベクトルから関連する部分のみを読み込むことで、メモリ帯域幅の使用量を削減。
- 微調整後量子化を用いて、低ビット幅の量子化モデルを段階的に高ビット幅にスケーリングしながら、モデル品質を維持する。
- Any-Precision量子化パイプラインを特別なサービングエンジンと統合し、推論時にビット幅を動的に選択可能にする。
- 現在のLLM推論のベストプラクティスに準拠し、重みのみの量子化を採用することで、メモリバッファのボトルネックを軽減。
実験結果
リサーチクエスチョン
- RQ11つのLLMを、メモリオーバーヘッドを最小限に抑えつつ、3–nビットのさまざまなビット幅の複数のモデルに効率的に利用可能か?
- RQ2微調整後量子化をどのように変更すれば、再トレーニングやファインチューニングを必要とせずに任意精度LLMを実現できるか?
- RQ3最適化されたメモリレイアウトとカーネル操作により、カスタムソフトウェアエンジンが低ビット幅推論におけるメモリ帯域幅使用量を削減できるか?
- RQ4Any-Precision LLMは、すべての対応するビット幅で最先端のモデル品質を維持できるか?
- RQ5提案されたシステムは、非Any-Precisionの最先端エンジンと同等またはそれ以上の推論スループットを達成できるか?
主な発見
- 提案手法により、3〜8ビットに量子化されたLLMが、単一の8ビットモデルとほぼ同等のメモリ使用量に収納され、ストレージおよびメモリコストが顕著に削減された。
- Any-Precision LLMは、各ビット幅で最先端のモデル品質を達成しており、既存の量子化技術と同等またはそれを上回っている。
- ビットインタリーブドメモリレイアウトを採用しても、Any-Precision LLMの推論スループットは、非Any-Precisionの最先端エンジンと同等またはそれを上回っている。
- 推論時に動的モデル選択が可能となり、スペキュラティブデコードや低レイテンシワークロードをサポートできる。
- 既存のキーネルが全ビットベクトルを読み込むのに対し、本手法では必要なみなしビット幅のみを読み込むことで、メモリ帯域幅使用量を削減した。
- 1つのモデルストレージで、異なる品質-レイテンシトレードオフを持つ複数のLLMをデプロイ可能となり、運用コストが削減された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。