[論文レビュー] Compress, Then Prompt: Improving Accuracy-Efficiency Trade-off of LLM Inference with Transferable Prompt
本論文では、再訓練を伴わずに、圧縮された大規模言語モデル(LLMs)の精度を向上させるためのソフトプロンプト学習手法を提案する。この手法は、圧縮プロセス中に移植可能なプロンプトを学習することで、性能を向上させる。その結果、4ビット量子化と50%のプルーニングを適用した8倍圧縮されたLLaMA-7Bモデル(4ビット量子化と50%プルーニング)が、標準ベンチマークでフルモデルと同等の性能を達成し、データセット、タスク、圧縮レベルの間で強力なクロス圧縮移行性を示した。
While the numerous parameters in Large Language Models (LLMs) contribute to their superior performance, this massive scale makes them inefficient and memory-hungry. Thus, they are hard to deploy on commodity hardware, such as one single GPU. Given the memory and power constraints of such devices, model compression methods are widely employed to reduce both the model size and inference latency, which essentially trades off model quality in return for improved efficiency. Thus, optimizing this accuracy-efficiency trade-off is crucial for the LLM deployment on commodity hardware. In this paper, we introduce a new perspective to optimize this trade-off by prompting compressed models. Specifically, we first observe that for certain questions, the generation quality of a compressed LLM can be significantly improved by adding carefully designed hard prompts, though this isn't the case for all questions. Based on this observation, we propose a soft prompt learning method where we expose the compressed model to the prompt learning process, aiming to enhance the performance of prompts. Our experimental analysis suggests our soft prompt strategy greatly improves the performance of the 8x compressed LLaMA-7B model (with a joint 4-bit quantization and 50% weight pruning compression), allowing them to match their uncompressed counterparts on popular benchmarks. Also, we demonstrate that these learned prompts can be transferred across various datasets, tasks, and compression levels. Hence with this transferability, we can stitch the soft prompt to a newly compressed model to improve the test-time accuracy in an ``in-situ'' way.
研究の動機と目的
- 商品ハードウェアにデプロイされた圧縮されたLLMにおける推論効率と精度の間の重要なトレードオフを解消すること。
- 学習可能なプロンプトが、手動で設計されたハードプロンプトを上回る圧縮LLMの生成品質を向上させられるかどうかを調査すること。
- 学習されたプロンプトが、異なるデータセット、タスク、および圧縮レベル(例:スパarsity、量子化ビット幅)間でどれほど移行可能であるかを調査すること。
- 新しく圧縮されたモデルに対して、テスト時に事前に学習済みのプロンプトを接続するだけで、再訓練なしに即座に精度を向上させられる手法を開発すること。
提案手法
- 本手法では、圧縮プロセス中に圧縮されたLLM上で直接学習可能なプロンプトトークンを訓練するソフトプロンプト学習フレームワークを導入する。
- 本手法は、入力シーケンスに加法的なプロンプトトークンを適用し、勾配降下法を用いて下流タスクの生成品質を最適化する。
- プロンプト学習は、ターゲットデータセット(例:C4)の訓練セット上で実施され、その結果得られたプロンプトは推論時に圧縮モデルに適用される。
- 高い効率性を達成するため、本手法ではプロンプト学習の前段階として、4ビット重み量子化と50%の重みプルーニングといったモデル圧縮技術を組み合わせる。
- 移行性の評価は、ある圧縮レベルやタイプ(例:4ビット量子化)で学習されたプロンプトを、異なる圧縮設定(例:50%スパarsity、8ビット量子化)のモデルに適用することで実施する。
- 本手法により、再訓練なしに新しく圧縮されたモデルに即座に精度を向上させられる。具体的には、事前に学習済みのプロンプトを単に接続するだけで実現する。
実験結果
リサーチクエスチョン
- RQ1学習可能なプロンプトは、特に重度に圧縮されたLLMの生成品質を顕著に向上させることができるか?
- RQ2圧縮モデル上で学習されたプロンプトは、異なる圧縮レベルやタイプの他の圧縮モデルへ効果的に移行可能か?
- RQ3スパース化と量子化といった複数の圧縮技術を組み合わせた場合でも、提案手法のプロンプト学習は高い性能を維持できるか?
- RQ4再訓練なしに、学習済みプロンプトが多様なデータセットやタスクで性能向上をもたらすことができるか?
- RQ5学習済みプロンプトを適用した圧縮モデルの性能は、フルで非圧縮のモデルと同等か?
主な発見
- 50%スパarsityと4ビット量子化を適用した8倍圧縮されたLLaMA-7Bモデルに、学習済みプロンプトを適用したところ、C4バリデーションセットにおける perplexity(PPL)は7.38にまで低下し、フルモデルのPPL(7.59)と同等の性能を達成した。
- Wikitext-2では、プロンプトなしのPPLが9.67であったのを、プロンプトを適用することで7.31に低下させ、フルモデルの6.34に近づいた。
- PTBでは、プロンプトなしのPPLが17.39であったのを、プロンプトを適用することで10.64にまで低下させ、圧縮ベースラインよりも顕著に向上した。
- より高いスパarsity(例:62.5%)やより低いビット幅量子化(例:4ビット)から学習されたプロンプトは、スパarsityが低いか、ビット幅が高いモデルへも効果的に移行可能であり、性能向上をもたらした。
- スパースモデルから学習されたプロンプトは量子化モデルへ、逆に量子化モデルから学習されたプロンプトはスパースモデルへも移行可能であり、特に低圧縮レベルで顕著なクロス圧縮移行性を示した。
- 本手法により、即座の精度向上が可能である:新しく圧縮されたモデルに、再訓練なしに事前に学習済みのプロンプトを単に接続するだけで、テスト時の性能を向上させることができる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。