Skip to main content
QUICK REVIEW

[논문 리뷰] LoRAShear: Efficient Large Language Model Structured Pruning and Knowledge Recovery

Tianyi Chen, Tianyu Ding|arXiv (Cornell University)|2023. 10. 24.
Topic Modeling인용 수 4
한 줄 요약

LoRAShear는 대규모 언어 모델(Large Language Models, LLMs)을 위한 효율적이고 자원 제한된 구조적 프루닝 프레임워크를 제안한다. 이는 LoRA 모듈 간 의존성 그래프와 새로운 LoRA 반평면 투영 경사하강법(LoRA Half-Space Projected Gradient, LHSPG) 최적화기를 활용하여 점진적이고 지식을 유지하는 프루닝을 가능하게 한다. 또한 적응형 사전 훈련 및 지시 테이닝 데이터를 사용한 동적 지식 복구 기법을 도입하여, LLAMA-v1에서 20% 모델 압축 시 성능 저하가 1.0%에 불과하고, 50% 압축 시 성능 유지율이 82%에 이르는 결과를 달성한다.

ABSTRACT

Large Language Models (LLMs) have transformed the landscape of artificial intelligence, while their enormous size presents significant challenges in terms of computational costs. We introduce LoRAShear, a novel efficient approach to structurally prune LLMs and recover knowledge. Given general LLMs, LoRAShear at first creates the dependency graphs over LoRA modules to discover minimally removal structures and analyze the knowledge distribution. It then proceeds progressive structured pruning on LoRA adaptors and enables inherent knowledge transfer to better preserve the information in the redundant structures. To recover the lost knowledge during pruning, LoRAShear meticulously studies and proposes a dynamic fine-tuning schemes with dynamic data adaptors to effectively narrow down the performance gap to the full models. Numerical results demonstrate that by only using one GPU within a couple of GPU days, LoRAShear effectively reduced footprint of LLMs by 20% with only 1.0% performance degradation and significantly outperforms state-of-the-arts. The source code will be available at https://github.com/microsoft/lorashear.

연구 동기 및 목표

  • 실세계 구현 환경에서 대규모 언어 모델(LLMs)의 프루닝에 따른 높은 계산 비용과 자원 요구량을 해결하기 위해.
  • 기존 사전 훈련 데이터셋에 접근할 필요 없이 일반 LLMs의 구조적 프루닝을 가능하게 하기 위해.
  • LoRA 적응 모델에서 비가역적인 핵심적인 구조를 식별하고 보호하여 프루닝 중 모델 지식을 유지하기 위해.
  • 정제된 데이터셋을 기반으로 적응형 다단계 훈련을 통해 프루닝 이후에 손실된 일반적이고 도메인 특화된 지식을 복구하기 위해.
  • 단일 GPU와 몇 일 분량의 GPU 시간만을 사용하여 최신 기술 수준의 성능을 달성하는 프루닝된 LLMs를 구현하기 위해.

제안 방법

  • LoRA 모듈 간 의존성 그래프를 구성하여 최소로 제거 가능한 구조적 단위를 식별하고, 이에 따라 훈련 가능한 파라미터를 분할한다.
  • LoRA 반평면 투영 경사하강법(LHSPG)을 도입하여, 점진적 프루닝 동안 부족한 구조에서 핵심 LoRA 구조로 지식을 이전하는 구조적 희소성 최적화 방법을 제안한다.
  • 낮은 중요도의 LoRA 모듈을 반복적으로 제거하면서 성능 유지를 위해 지식 이전을 통해 점진적 구조적 프루닝을 수행한다.
  • 성능 분포를 기반으로 사전 훈련 데이터의 부분집합을 적응형으로 선택하여 일반 지식을 복구하는 동적 지식 복구 메커니즘을 제안한다.
  • 수집된 일반 지식과 Alpaca와 같은 데이터셋에서의 표준 지시 훈련을 결합하여 지시 따르기 및 도메인 특화 능력을 복원한다.
  • 두 단계 훈련 프rotocol을 적용한다: 먼저 정제된 사전 훈련 데이터에서 일반 지식을 복구하고, 그 다음 지시 훈련 데이터로 정밀 조정한다.
Figure 1 : Overview of LoRAShear. Given a general LLM, LoRAShear at first discovers the minimally removal structures, then analyzes the knowledge distribution to mark the crucial ones as unprunable, then performs progressive structurally pruning over the prunable structures via LHSPG , and finally r
Figure 1 : Overview of LoRAShear. Given a general LLM, LoRAShear at first discovers the minimally removal structures, then analyzes the knowledge distribution to mark the crucial ones as unprunable, then performs progressive structurally pruning over the prunable structures via LHSPG , and finally r

실험 결과

연구 질문

  • RQ1기존 사전 훈련 데이터셋에 접근할 수 없는 자원 제한 환경에서 LLM의 구조적 프루닝을 효율적으로 수행할 수 있는가?
  • RQ2비가역적인 LLM 가중치와 보조 LoRA 모듈을 프루닝할 때, 지식을 어떻게 유지할 수 있는가?
  • RQ3사전 훈련 코퍼스에서의 동적 데이터 선택이 프루닝된 LLM의 지식 복구에 어떤 영향을 미치는가?
  • RQ4LHSPG를 통한 지식 이전은 LoRA 적응 LLM의 점진적 프루닝 중 성능 저하를 얼마나 줄일 수 있는가?
  • RQ5단일 GPU만을 사용하여도 통합 프레임워크가 고압축과 최소한의 성능 손실을 동시에 달성할 수 있는가?

주요 결과

  • 20% 프루닝 비율에서 LoRAShear는 전체 LLAMA-v1 모델 대비 성능 저하가 단 1.0%에 불과하여 최신 기술 수준의 방법들을 크게 능가한다.
  • 50% 프루닝 비율에서 LoRAShear는 여러 벤치마크에서 전체 모델 성능의 82%를 유지하여 고압축에서도 뛰어난 강건성을 입증한다.
  • 동일한 20% 프루닝 비율에서 LLM-Pruner, LoRAPrune, WANDA와 같은 기존 방법들보다 정확도에서 2.2%에서 5.0% 높은 성능을 기록한다.
  • 수집된 사전 훈련 데이터와 지시 훈련을 결합한 동적 지식 복구 단계는 전체 모델 성능에 도달하기 위한 성능 격차를 메우는 데 핵심적이다.
  • 이 방법은 단일 A100 GPU를 사용하여 몇 일 분량의 GPU 시간 내에 이러한 결과를 달성하여, 일반 사용자 및 자원 제한 환경에서의 실용성을 확보한다.
  • 지식 분포 분석 결과, 첫 번째 및 마지막 몇 개의 LoRA 노드 그룹이 가장 민감하므로 프루닝에서 제외하는 것이 타당하다.
(a) Dependency graph for MLP layers.
(a) Dependency graph for MLP layers.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.