Skip to main content
QUICK REVIEW

[논문 리뷰] AdaMix: Mixture-of-Adaptations for Parameter-efficient Model Tuning

Yaqing Wang, Agarwal, Sahaj|arXiv (Cornell University)|2022. 05. 24.
Topic Modeling인용 수 12
한 줄 요약

AdaMix는 각 Transformer 레이어 내에서 어댑테이션 모듈(예: 어댑터 또는 LoRA)의 믹스처를 훈련함으로써 성능을 향상시키는 파라미터 효율적인 미세조정 방법을 제안한다. 입력당 하나의 모듈만 선택하는 확률적 라우팅을 사용함으로써, 단일 모듈과 동일한 FLOPs와 학습 가능한 파라미터 수를 유지하면서도 성능을 향상시킨다. 단지 모델 파라미터의 0.1–0.2%만 조정함으로써 AdaMix는 NLU 및 NLG 작업에서 표준 전체 미세조정 및 최신 PEFT 방법을 모두 능가한다.

ABSTRACT

Standard fine-tuning of large pre-trained language models (PLMs) for downstream tasks requires updating hundreds of millions to billions of parameters, and storing a large copy of the PLM weights for every task resulting in increased cost for storing, sharing and serving the models. To address this, parameter-efficient fine-tuning (PEFT) techniques were introduced where small trainable components are injected in the PLM and updated during fine-tuning. We propose AdaMix as a general PEFT method that tunes a mixture of adaptation modules -- given the underlying PEFT method of choice -- introduced in each Transformer layer while keeping most of the PLM weights frozen. For instance, AdaMix can leverage a mixture of adapters like Houlsby or a mixture of low rank decomposition matrices like LoRA to improve downstream task performance over the corresponding PEFT methods for fully supervised and few-shot NLU and NLG tasks. Further, we design AdaMix such that it matches the same computational cost and the number of tunable parameters as the underlying PEFT method. By only tuning 0.1-0.2% of PLM parameters, we show that AdaMix outperforms SOTA parameter-efficient fine-tuning and full model fine-tuning for both NLU and NLG tasks.

연구 동기 및 목표

  • 대규모 사전 학습된 언어 모델(PLM)에서 전체 미세조정의 높은 저장, 공유, 서비스 비용 문제를 해결하기 위해, 각 작업당 수십억 개의 파라미터를 업데이트하고 저장해야 하는 점을 다루기 위해.
  • 학습 가능한 파라미터 수를 줄임으로써 성능이 저하되는 기존 파라미터 효율적인 미세조정(PEFT) 방법의 성능을 향상시키기 위해.
  • 기본 PEFT 방법(예: 어댑터 또는 LoRA)을 향상시킬 수 있는 일반적인 PEFT 프레임워크를 제공하기 위해, 계산 비용을 증가시키지 않고도 어댑테이션 모듈의 믹스처를 통해 성능을 향상시키기 위해.
  • 기본 PEFT 방법과 동일한 학습 가능한 파라미터 수와 FLOPs를 유지하면서, 모듈 병합 및 일관성 정규화를 통해 안정성과 성능을 향상시키기 위해.

제안 방법

  • AdaMix는 표준 PEFT에서 사용하는 단일 모듈 대신 각 Transformer 레이어에 여러 어댑테이션 모듈(예: 어댑터 또는 LoRA 행렬)을 도입한다.
  • 확률적 라우팅을 사용하여 입력당 하나의 활성 어댑테이션 모듈을 선택하며, 이는 믹스처 오브 응용자(MoE)와 유사하다. 이로 인해 단일 모듈과 동일한 FLOP 수를 확보한다.
  • 다수의 무작위 초기화된 모듈 간의 일관성 정규화와 공통 초기화가 확률적 라우팅에도 불구하고 훈련을 안정화시키는 데 기여한다.
  • 후처리 훈련 병합 메커니즘을 통해 다수의 어댑테이션 모듈의 가중치를 평균화하여 단일 효과적인 모듈로 통합함으로써, 기본 PEFT 방법과 동일한 학습 가능한 파라미터 수를 유지한다.
  • 이 병합 과정은 모델 가중치 평균화(예: 모델 수프)에 영감을 받았으며, 전체 모델이 아닌 PEFT 어댑테이션 모듈에 특화되어 적용된다.
  • 이 방법은 기존 PEFT 기법과 수직이며, 어댑터, LoRA, 프롬프트 튜닝, 프리픽스 튜닝을 포함한 어떤 PEFT 방법에도 적용 가능하다.

실험 결과

연구 질문

  • RQ1계산 비용을 증가시키지 않고도 어댑테이션 모듈의 믹스처가 파라미터 효율적인 미세조정에서 최종 성능을 향상시킬 수 있는가?
  • RQ2다수의 어댑테이션 모듈 간의 확률적 라우팅이 단일 모듈 PEFT에 비해 더 나은 일반화 및 강건성을 제공하는가?
  • RQ3일관성 정규화와 가중치 병합이 다수의 무작위 초기화된 어댑테이션 모듈을 사용할 때 훈련을 안정화시키고 성능을 유지하는 데 기여하는가?
  • RQ4AdaMix는 단지 모델 파라미터의 0.1–0.2%만 조정함으로써 표준 전체 미세조정과 최신 PEFT 방법을 모두 능가하는가?
  • RQ5AdaMix 프레임워크는 어댑터 및 LoRA와 같은 다양한 PEFT 방법에 일반화될 수 있는가?

주요 결과

  • RoBERTa-large를 사용한 GLUE 벤치마크에서 AdaMix는 단지 0.1–0.2%의 파라미터만 조정함으로써 평균 점수 91.0%를 기록하며 전체 모델 미세조정을 능가한다.
  • SuperGLUE 벤치마크에서 어댑터를 사용한 AdaMix는 평균 점수 90.7%를 기록하여 표준 LoRA의 89.2%와 표준 어댑터의 90.9%를 초월한다.
  • CNN/DailyMail 요약 작업에서 LoRA를 사용한 AdaMix는 ROUGE-L 점수 42.1을 기록하여 표준 LoRA의 40.8과 표준 어댑터의 41.5를 뛰어넘는다.
  • AdaMix는 NLU 및 NLG 작업 전반에서 성능을 향상시키면서도, 기본 PEFT 방법과 동일한 FLOPs와 학습 가능한 파라미터 수를 유지한다.
  • AdaMix는 단지 모델 파라미터의 0.1–0.2%만 조정함에도 불구하고 GLUE 및 SuperGLUE 벤치마크에서 최상의 성능을 기록한다.
  • 병합 메커니즘이 성능 저하 없이 다수의 어댑테이션 모듈을 하나의 모듈로 통합함으로써 저장 비용을 효과적으로 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.