Skip to main content
QUICK REVIEW

[논문 리뷰] IncreLoRA: Incremental Parameter Allocation Method for Parameter-Efficient Fine-tuning

Feiyu Zhang, Liangzhi Li|arXiv (Cornell University)|2023. 08. 23.
Topic Modeling인용 수 6
한 줄 요약

IncreLoRA는 모듈 중요도 점수를 기반으로 학습 중 LoRA 어댑터의 랭크를 동적으로 증가시키는 점진적 파rameter 할당 방법을 제안한다. 이는 초기 파rameter 과도 할당 없이 높은 랭크 상한선을 달성할 수 있게 하며, 사전 학습 및 재시작 웜업 기법을 통해 학습 안정성과 직교성 향상을 도모함으로써 특히 자원이 제한된 환경에서 뛰어난 성능을 달성한다.

ABSTRACT

With the increasing size of pre-trained language models (PLMs), fine-tuning all the parameters in the model is not efficient, especially when there are a large number of downstream tasks, which incur significant training and storage costs. Many parameter-efficient fine-tuning (PEFT) approaches have been proposed, among which, Low-Rank Adaptation (LoRA) is a representative approach that injects trainable rank decomposition matrices into every target module. Yet LoRA ignores the importance of parameters in different modules. To address this problem, many works have been proposed to prune the parameters of LoRA. However, under limited training conditions, the upper bound of the rank of the pruned parameter matrix is still affected by the preset values. We, therefore, propose IncreLoRA, an incremental parameter allocation method that adaptively adds trainable parameters during training based on the importance scores of each module. This approach is different from the pruning method as it is not limited by the initial number of training parameters, and each parameter matrix has a higher rank upper bound for the same training overhead. We conduct extensive experiments on GLUE to demonstrate the effectiveness of IncreLoRA. The results show that our method owns higher parameter efficiency, especially when under the low-resource settings where our method significantly outperforms the baselines. Our code is publicly available.

연구 동기 및 목표

  • 고정 랭크 LoRA의 비효율성을 해결하여, 파rameter 효율적 미세조정에서 모듈별 중요도를 忽시하는 균일한 랭크 할당 방식을 개선한다.
  • 초기 설정된 값에 의해 최종 랭크가 제약받는 구조적 프루닝 기법의 한계를 극복하여, 최적의 파rameter 활용을 가능하게 한다.
  • 학습 중에 적응적이고 점진적인 랭크 확장을 통해 자원이 제한된 조건에서도 파라미터 효율성과 모델 성능을 향상시킨다.
  • 새로 추가된 파ram터의 학습 안정성을 향상시키기 위해 새로운 사전 학습 기법과 재시작 웜업 전략을 통해 수렴성과 직교성을 향상시킨다.

제안 방법

  • 모듈 중요도 점수를 기반으로 학습 중 LoRA 어댑터의 랭크를 증가시키는 점진적 파라미터 할당 메커니즘을 도입한다.
  • 새로 추가된 파라미터를 유리한 초기 상태로 초기화하기 위해 '사전 학습'이라고 불리는 사전 훈련 단계를 활용해 LoRA의 저랭크 행렬을 재구성한다.
  • 새로 추가된 파라미터 그룹에 대해 독립적인 학습률 스케줄링과 재시작 웜업 전략을 적용하여 학습의 불안정성을 감소시킨다.
  • 저랭크 행렬 A와 B에 대해 직교성 정규화를 강제 적용하여 파라미터 효율성과 모델 안정성을 향상시킨다.
  • 프루닝 기반 방법과 달리, 높은 랭크 모듈이 초기 제약을 초월해 성장할 수 있도록 동적 랭크 분포 전략을 사용한다.
  • 모든 방법 간의 공정한 비교를 위해 랭크 분포 영향을 평가하기 위해 공유된 SVD 유사 파aram터화 및 정규화 항목을 사용한다.

실험 결과

연구 질문

  • RQ1학습 중 점진적 랭크 할당이 고정 또는 프루닝 기반 LoRA 방법에 비해 파라미터 효율성을 향상시키는가?
  • RQ2제안된 사전 학습 기법이 새로 추가된 LoRA 파라미터의 수렴성과 직교성 향상에 기여하는가?
  • RQ3LoRA 어댑터의 랭크 분포가 특히 자원이 제한된 미세조정 조건에서 모델 성능에 어떤 영향을 미치는가?
  • RQ4동적으로 트레이너블 파라미터를 LoRA 어댑터에 추가할 경우 재시작 웜업 전략이 학습 안정성을 향상시키는가?
  • RQ5정확도와 파라미터 효율성 측면에서 동적 랭크 할당이 정적 또는 프루닝 기반 랭크 할당을 얼마나 뛰어나게 하는가?

주요 결과

  • IncreLoRA는 저자원 환경에서 AdaLoRA에 비해 RTE 작업에서 1.81% 향상된 정확도를 달성했고, STS-B에서는 1.08% 향상되었다.
  • GLUE 벤치마크 전반에서 기준 LoRA 및 AdaLoRA보다 뚜렷하게 뛰어난 성능을 보였으며, 특히 파라미터 수가 적은 영역에서 두각을 나타냈다.
  • 동일한 초모수 조건에서 재학습했을 때 IncreLoRA의 랭크 분포가 AdaLoRA보다 더 높은 모델 성능을 내는 것으로 나타나, 뛰어난 동적 할당 전략을 입증했다.
  • 사전 학습은 직교 정규화 손실을 감소시켜 더 빠른 직교성 수렴을 가능하게 하여 파라미터 효율성을 향상시켰다.
  • 재시작 웜업 전략은 새로 추가된 파라미터의 학습 안정성을 높여 분산을 감소시키고 최종 성능을 향상시켰다.
  • IncreLoRA의 랭크 분포는 핵심 모듈(예: Wv, Wo, Wf1)에 더 집중되어 있어, 저자원 조건에서도 중요한 구성 요소가 높은 랭크를 유지함을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.