Skip to main content
QUICK REVIEW

[논문 리뷰] LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning

Mingyang Zhang, Hao-Zhen|arXiv (Cornell University)|2023. 05. 28.
Sparse and Compressive Sensing Techniques인용 수 4
한 줄 요약

LoRAPrune는 대규모 사전 훈련된 모델에서 구조적 프루닝과 LoRA 기반 파rameter 효율적 미세조정을 통합적으로 수행하는 프레임워크를 제안한다. 사전 훈련된 가중치 기울기의 메모리 집약적인 계산을 피하기 위해 중요도 평가에 LoRA 기울기만을 사용한다. 50% 모델 크기 감소를 달성하며, WikiText2에서 퍼플렉서티를 8.0 감소시키고 PTB에서 16.05 감소시키며, 이전 방법 대비 메모리 사용량을 52.6% 절감한다.

ABSTRACT

Large Language Models (LLMs), such as LLaMA and T5, have shown exceptional performance across various tasks through fine-tuning. Although low-rank adaption (LoRA) has emerged to cheaply fine-tune these LLMs on downstream tasks, their deployment is still hindered by the vast model scale and computational costs. Post-training model pruning offers a way to compress LLMs. However, the current pruning methods designed for LLMs are not compatible with LoRA. This is due to their utilization of unstructured pruning on LLMs, impeding the merging of LoRA weights, or their dependence on the gradients of pre-trained weights to guide pruning, which can impose significant memory overhead. To this end, we propose LoRAPrune, a new framework that delivers an accurate structured pruned model in a highly memory-efficient manner. Specifically, we first design a LoRA-guided pruning criterion, which uses the weights and gradients of LoRA, rather than the gradients of pre-trained weights for importance estimation. We subsequently integrate this criterion into an iterative pruning process, effectively removing redundant channels and heads. Extensive experimental results demonstrate the superior performance of our LoRAPrune over existing approaches on the LLaMA series models. At a 50\% compression rate, LoRAPrune demonstrates superior performance over LLM-Pruner, achieving a reduction in perplexity by 4.81 on WikiText2 and 3.46 on PTB, while also decreasing memory usage by 52.6%. Besides, LoRAPrune also matches semi-structural pruning across multiple LLMs, proving its wide applicability. The code is available at https://github.com/aim-uofa/LoRAPrune.

연구 동기 및 목표

  • 비구조적 프루닝과 LoRA 간의 상호 호환성 문제를 해결하여 LoRA 가중치의 효율적 병합과 추론 지연을 줄인다.
  • 프루닝 중 사전 훈련된 가중치 기울기를 요구하는 기존 프루닝 방법의 높은 메모리 오버헤드를 해결한다.
  • LoRA와 호환되며 메모리 효율적인 구조적 프루닝 방법을 개발하여 프루닝 후 LoRA 가중치를 원활하게 병합할 수 있도록 한다.
  • 모델 성능을 유지하면서 별도의 미세조정 없이도 고압축 비율에서도 프루닝과 미세조정을 동시에 수행할 수 있도록 한다.
  • 사전 훈련된 가중치 기울기 계산 없이 오직 LoRA 기울기만을 사용해 파라미터 중요도를 추정하는 새로운 LoRA 가이드 프루닝 기준을 제안한다.

제안 방법

  • 사전 훈련된 가중치(W₀) 기울기가 아닌 LoRA 가중치(A) 기울기만을 기반으로 파라미터 중요도를 계산하는 LoRA 가이드 프루닝 기준을 도입하여 사전 훈련된 가중치 기울기가 필요 없도록 한다.
  • 사전 훈련된 모델과 LoRA 어댑터 양쪽에서 중복되는 채널과 어텐션 헤드를 동시에 제거하는 구조적 반복적 프루닝 절차를 설계한다.
  • LoRA 기울기의 프로베니우스 노름을 파라미터 중요도의 대체 지표로 사용하여, 큰 중간 텐서를 저장하지 않고도 효율적이고 정확한 프루닝을 가능하게 한다.
  • 프루닝과 LoRA 미세조정을 한 번의 훈련 루프에서 번갈아가며 수행하는 통합 프루닝 및 미세조정 파이프라인을 구현하여 성능을 유지한다.
  • 프루닝 후 LoRA 가중치(BA)가 프루닝된 사전 훈련된 가중치에 원활하게 병합되어 추가 계산 비용 없이 추론이 가능하도록 보장한다.
  • 모델 복구와 과적합의 균형을 고려해 프루닝 빈도를 최적화하며, 프루닝 반복 주기당 10회의 미세조정 스텝이 최적의 빈도로 확인되었다.

실험 결과

연구 질문

  • RQ1사전 훈련된 가중치 기울기 의존 기준 대비 기존 방법에 비해 성능이 유사하거나 우수하면서도 메모리 사용을 극도로 줄일 수 있는가?
  • RQ2프루닝과 미세조정을 별도로 수행하는 것과 비교해, 대규모 사전 훈련된 모델에서 통합 프루닝 및 미세조정이 성능과 효율성 측면에서 어떻게 다른가?
  • RQ3LoRA 미세조정과 함께 반복적 프루닝을 수행할 때 모델 복구와 과적합을 균형 잡는 데 최적의 프루닝 빈도는 무엇인가?
  • RQ4LoRA 가이드 중요도 평가 기반의 구조적 프루닝이 메모리 오버헤드를 어떻게 줄이고 동시에 하류 작업에서 정확도를 유지할 수 있는가?
  • RQ5제안된 방법이 LoRA 가중치를 직접 프루닝된 모델에 병합할 수 있도록 해, 효율적이고 메모리 친화적이며 하드웨어 호환성 있는 추론을 가능하게 할 수 있는가?

주요 결과

  • 50% 압축 비율에서 LoRAPrune는 LLM-Pruner 대비 WikiText2에서 퍼플렉서티를 8.0 감소시키고 PTB에서 16.05 감소시켜 뛰어난 정확도를 확보한다.
  • LLaMA-65b를 프루닝할 때 LoRAPrune는 LLM-Pruner 대비 메모리 사용량을 52.6% 절감하여 기존의 3개의 A100(80GB) GPU에서 1개의 A100으로만 가능하게 한다.
  • LoRA 가이드 기준은 바닐라 기울기 기반 기준 대비 GPU 메모리 사용량을 52.6% 감소시키며, 처리량을 64.6% 향상시킨다.
  • 통합 프루닝 및 미세조정은 별도의 프루닝 및 미세조정보다 우수한 성능을 보이며, 특히 고압축 비율에서 두드러진다. 50% 비율에서 분류 작업의 평균 정확도가 2.87점 향상되었다.
  • 최적의 프루닝 빈도는 프루닝 반복 주기당 10회의 미세조정 스텝으로 확인되었으며, 낮은 빈도(예: 1)는 복구 능력을 제한하고, 높은 빈도(예: 20)는 과적합을 유도한다.
  • LoRA 가이드 기준과 바닐라 기준 간의 마스크 유사도는 높은 편이었으며, 특히 저압축 비율에서 두드러져 LoRA 가이드 기준이 정확하고 저비용 프루닝을 가능하게 하는 강력한 근사임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.