Skip to main content
QUICK REVIEW

[論文レビュー] LoRAShear: Efficient Large Language Model Structured Pruning and Knowledge Recovery

Tianyi Chen, Tianyu Ding|arXiv (Cornell University)|Oct 24, 2023
Topic Modeling被引用数 4
ひとこと要約

LoRAShearは、LoRAモジュールの依存関係グラフと、新規のLoRA半空間射影勾配(LHSPG)最適化手法を活用することで、リソース制限下でも効率的かつ知識を保持する構造的スパarsityを実現する、大規模言語モデル(LLM)のための限られたリソースにおける構造的プルーニングフレームワークを提案する。さらに、適応的プリトレーニングおよびインstructチューニングデータを用いた動的知識回復を導入し、LLAMA-v1で20%のモデル圧縮率においてわずか1.0%の性能低下を達成し、50%の圧縮率でも82%の性能維持を実現した。

ABSTRACT

Large Language Models (LLMs) have transformed the landscape of artificial intelligence, while their enormous size presents significant challenges in terms of computational costs. We introduce LoRAShear, a novel efficient approach to structurally prune LLMs and recover knowledge. Given general LLMs, LoRAShear at first creates the dependency graphs over LoRA modules to discover minimally removal structures and analyze the knowledge distribution. It then proceeds progressive structured pruning on LoRA adaptors and enables inherent knowledge transfer to better preserve the information in the redundant structures. To recover the lost knowledge during pruning, LoRAShear meticulously studies and proposes a dynamic fine-tuning schemes with dynamic data adaptors to effectively narrow down the performance gap to the full models. Numerical results demonstrate that by only using one GPU within a couple of GPU days, LoRAShear effectively reduced footprint of LLMs by 20% with only 1.0% performance degradation and significantly outperforms state-of-the-arts. The source code will be available at https://github.com/microsoft/lorashear.

研究の動機と目的

  • 実世界の展開環境において、大規模言語モデル(LLM)のプルーニングにかかる高い計算コストとリソース要件を解決すること。
  • 元のプリトレーニングデータにアクセスできない状況下でも、一般のLLMに対して構造的プルーニングを可能にすること。
  • LoRA適応モデルにおける重要な最小除去可能な構造を特定・保護することで、プルーニング中にモデル知識を保持すること。
  • キュレートされたデータセットを用いた適応的で段階的なファインチューニングにより、プルーニング後に失われた一般知識およびドメイン固有の知識を回復すること。
  • 1台のGPUと数日分のGPU時間のみを用いて、プルーディングされたLLMで最先端の性能を達成すること。

提案手法

  • LoRAモジュール上に依存関係グラフを構築し、最小限に除去可能な構造的ユニットを同定し、トレーニング可能パラメータを適切に分割する。
  • LoRA半空間射影勾配(LHSPG)を導入し、プログレッシブなプルーニング中に、余分な構造から重要なLoRA構造へと知識を転送する構造的スパarsity最適化手法を実現する。
  • 低感受性のLoRAモジュールを段階的に削除しながら、知識転送による性能維持を図ることで、プログレッシブな構造的プルーニングを実行する。
  • 性能分布に基づき、プリトレーニングコーパスからサブセットを適応的に選択する動的知識回復メカニズムを提案し、一般知識の回復を実現する。
  • 回復された一般知識と、Alpacaなどのデータセットを用いた標準的なインstructファインチューニングを組み合わせ、インストラクション従従性およびドメイン固有の能力を回復する。
  • 2段階のファインチューニングプロトコルを採用:まずキュレートされたプリトレーニングデータから一般知識を回復し、次にインストラクションチューニングデータで微調整する。
Figure 1 : Overview of LoRAShear. Given a general LLM, LoRAShear at first discovers the minimally removal structures, then analyzes the knowledge distribution to mark the crucial ones as unprunable, then performs progressive structurally pruning over the prunable structures via LHSPG , and finally r
Figure 1 : Overview of LoRAShear. Given a general LLM, LoRAShear at first discovers the minimally removal structures, then analyzes the knowledge distribution to mark the crucial ones as unprunable, then performs progressive structurally pruning over the prunable structures via LHSPG , and finally r

実験結果

リサーチクエスチョン

  • RQ1元のプリトレーニングデータにアクセスできない限られたリソース環境下でも、LLMの構造的プルーニングを効率的に行うことは可能か?
  • RQ2非トレーニング可能なLLM重みと補助的なLoRAモジュールをプルーニングする際、知識をどのように保持できるか?
  • RQ3プリトレーニングコーパスから動的データ選択が、プルーディングされたLLMにおける知識回復に与える影響は何か?
  • RQ4LHSPGによる知識転送は、LoRA適応LLMのプログレッシブプルーニングにおける性能低下をどの程度軽減できるか?
  • RQ51台のGPUのみを用いても、統合されたフレームワークが高圧縮率と最小限の性能損失を両立できるか?

主な発見

  • 20%のプルーニング比において、LoRAShearは完全なLLAMA-v1モデルと比較してわずか1.0%の性能低下に抑えられ、最先端の手法を大きく上回った。
  • 50%のプルーニング比において、複数のベンチマークで完全モデルの82%の性能を維持し、高い圧縮率下でも強固な性能を示した。
  • 同じ20%のプルーニング比において、LLM-Pruner、LoRAPrune、WANDAといった既存手法よりも2.2%から5.0%の精度向上を達成した。
  • キュレートされたプリトレーニングデータとインstructファインチューニングを組み合わせた動的知識回復ステージが、完全モデルとの性能ギャップを埋める上で不可欠であることがわかった。
  • 本手法は、1台のA100 GPUを数日間使用するだけでこれらの結果を達成しており、一般ユーザーおよびリソース制限下のユーザーにとって実用的である。
  • 知識分布解析の結果、最初および最後の数グループのLoRAノードが最も感受性が高く、プルーニングから除外すべきであることが裏付けられた。
(a) Dependency graph for MLP layers.
(a) Dependency graph for MLP layers.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。