Skip to main content
QUICK REVIEW

[논문 리뷰] LoRA ensembles for large language model fine-tuning

Xi Wang, Laurence Aitchison|arXiv (Cornell University)|2023. 09. 29.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 동일한 사전학습된 대규모 언어모델(LM)에 대해 서로 다른 무작위 초기화를 가진 다수의 저랭크 어댑터(LoRA)를 훈련시어, 파라미터 효율적인 방법으로 불확실성 캘리브레이션과 예측 정확도를 향상시키는 LoRA 앙상블을 제안한다. 전체 LLM 앙상블의 높은 메모리 비용에도 불구하고, LoRA의 낮은 저장 및 추론 오버헤드를 활용하면서도 모델 다양성을 유지함으로써, 특히 정규화 조건에서 정확도와 캘리브레이션 측면에서 뚜렷한 향상을 이룬다.

ABSTRACT

Finetuned LLMs often exhibit poor uncertainty quantification, manifesting as overconfidence, poor calibration, and unreliable prediction results on test data or out-of-distribution samples. One approach commonly used in vision for alleviating this issue is a deep ensemble, which constructs an ensemble by training the same model multiple times using different random initializations. However, there is a huge challenge to ensembling LLMs: the most effective LLMs are very, very large. Keeping a single LLM in memory is already challenging enough: keeping an ensemble of e.g. 5 LLMs in memory is impossible in many settings. To address these issues, we propose an ensemble approach using Low-Rank Adapters (LoRA), a parameter-efficient fine-tuning technique. Critically, these low-rank adapters represent a very small number of parameters, orders of magnitude less than the underlying pre-trained model. Thus, it is possible to construct large ensembles of LoRA adapters with almost the same computational overhead as using the original model. We find that LoRA ensembles, applied on its own or on top of pre-existing regularization techniques, gives consistent improvements in predictive accuracy and uncertainty quantification.

연구 동기 및 목표

  • 파인튜닝된 LLM에서 낮은 불확실성 측정 정확도 문제, 예를 들어 분포 외 데이터에서의 과신과 열악한 캘리브레이션을 해결하기 위해.
  • 대규모 LLM에 대해 전체 모델 앙상블을 훈련하는 데 드는 금지적인 메모리 및 계산 비용을 극복하기 위해.
  • 기본 모델에 비해 수개의 파라미터를 요구하는 저랭크 어댑터(LoRA)를 사용하여 확장 가능하고 효율적인 LLM 앙상블을 가능하게 하기 위해.
  • LoRA 앙상블이 정규화 기법과의 호환성을 가지는지 조사하여 일반화 및 캘리브레이션 향상을 추가로 향상시키기 위해.
  • 무작위 초기화와 데이터셋 셔플링이 앙상블 다양성과 성능에 기여하는지 경험적으로 검증하기 위해.

제안 방법

  • 동일한 사전학습된 LLM에 대해 서로 다른 무작위 초기화를 가진 다수의 LoRA 어댑터를 동일한 파인튜닝 데이터로 훈련시킨다.
  • 모든 LoRA 어댑터의 기초로 전체 사전학습된 LLM 가중치를 사용하여 일관된 초기화를 확보하면서도, 어댑터 가중치의 무작위성으로 인해 다양성을 유지한다.
  • 추론 시점에 모든 LoRA 어댑터의 예측을 평균 내어 로그릿 또는 확률을 조합하여 앙상블 예측을 생성한다.
  • 일반화 및 과적합 방지를 위해 LoRA 훈련 중 정규화 기법(예: 가중치 감쇠, KL 정규화, 조기 정지)을 적용한다.
  • 데이터셋 셔플링을 통해 확률적 경량 최적화 방법(SGD)의 노이즈를 도입하여 앙상블 구성 요소 간의 다양성을 더욱 향상시킨다.
  • 내분포 및 분포 외(OOD) 테스트 세트에서 정확도, 기대 캘리브레이션 오차(ECE), AUROC 등의 지표를 사용하여 앙상블 성능을 평가한다.
(a)
(a)

실험 결과

연구 질문

  • RQ1LoRA 앙상블은 단일 LoRA 파인튜닝 대비 파인튜닝된 LLM의 정확도와 캘리브레이션을 뚜렷이 향상시키는가?
  • RQ2LoRA 앙상블에 정규화 기법을 조합할 경우 모델의 캘리브레이션 및 일반화 성능이 추가로 향상되는가?
  • RQ3무작위 초기화와 데이터셋 셔플링에서 유도된 SGD 노이즈와 같은 다양한 무작위성의 원천이 앙상블 다양성과 성능에 어떤 기여를 하는가?
  • RQ4앙상블 구성 요소 수(M)를 늘릴 경우 모델 성능에 어떤 영향을 미치며, M이 커질수록 수익 감소 현상이 나타나는가?
  • RQ5정확도와 캘리브레이션 측면에서 Monte Carlo 드롭아웃이나 마지막 레이어 파인튜닝과 같은 대안적 불확실성 추정 방법에 비해 LoRA 앙상블은 어떻게 비교되는가?

주요 결과

  • LoRA 앙상블은 여섯 개의 공통 이해 추론 데이터셋 전반에서 정확도와 캘리브레이션을 일관되게 향상시키며, 기대 캘리브레이션 오차(ECE)가 뚜렷이 감소한다.
  • 다섯 개의 LoRA 구성 요소를 가진 앙상블은 단일 LoRA 모델과 Monte Carlo 드롭아웃, 마지막 레이어 파인튜닝과 같은 대안 방법보다 정확도와 ECE 측면에서 모두 뛰어난 성능을 보인다.
  • LoRA 앙상블은 정규화 기법과 함께 사용되어도 효과를 유지한다: 가중치 감쇠는 가장 견고한 성능을 보이며, 강한 KL 정규화나 조기 정지는 다양성을 억제함으로써 앙상블의 이점을 감소시킬 수 있다.
  • 앙상블 구성 요소 수(M)를 늘릴수록 성능 향상이 이루어지지만, M이 커질수록 이득의 감소 폭이 커져 특정 지점 이후 수익 감소 현상이 나타남을 시사한다.
  • 무작위 초기화와 데이터셋 셔플링 모두 앙상블 다양성에 기여하며, 셔플링에서 유도된 SGD 노이즈가 초기화만으로는 더 강한 영향을 미치며, 최적의 성능을 얻기 위해서는 둘 다 필요하다.
(b)
(b)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.