Skip to main content
QUICK REVIEW

[논문 리뷰] On the Effectiveness of Adapter-based Tuning for Pretrained Language Model Adaptation

Ruidan He, Linlin Liu|arXiv (Cornell University)|2021. 06. 06.
Topic Modeling참고 문헌 24인용 수 14
한 줄 요약

이 논문은 사전 훈련된 언어 모델(PrLM)에 대한 전면 미세조정의 파arameter 효율적인 대안으로 어댑터 기반 튜닝을 조사하며, 원래 PrLM의 표현에서의 이탈을 줄임으로써 훈련을 더 잘 정규화함을 입증한다. 어댑터는 자원이 적거나 다국어 설정에서 전면 미세조정보다 성능이 뛰어나며, 학습률 변화에 더 강건하고 과적합이 감소함을 보여준다.

ABSTRACT

Adapter-based tuning has recently arisen as an alternative to fine-tuning. It works by adding light-weight adapter modules to a pretrained language model (PrLM) and only updating the parameters of adapter modules when learning on a downstream task. As such, it adds only a few trainable parameters per new task, allowing a high degree of parameter sharing. Prior studies have shown that adapter-based tuning often achieves comparable results to fine-tuning. However, existing work only focuses on the parameter-efficient aspect of adapter-based tuning while lacking further investigation on its effectiveness. In this paper, we study the latter. We first show that adapter-based tuning better mitigates forgetting issues than fine-tuning since it yields representations with less deviation from those generated by the initial PrLM. We then empirically compare the two tuning methods on several downstream NLP tasks and settings. We demonstrate that 1) adapter-based tuning outperforms fine-tuning on low-resource and cross-lingual tasks; 2) it is more robust to overfitting and less sensitive to changes in learning rates.

연구 동기 및 목표

  • 어댑터 기반 튜닝이 파rameter 효율성 외의 이점이 있는지 평가하는 것.
  • 어댑터가 전면 미세조정보다 치명적인 잊힘(catastrophic forgetting)을 더 잘 완화하는지 조사하는 것.
  • 다양한 NLP 작업과 설정에서 어댑터 기반 튜닝과 전면 미세조정의 일반화 및 강건성 비교하는 것.
  • 어댑터의 저자원 및 다국어 전이 학습 시나리오에서의 효과성 분석하는 것.
  • 학습률 및 모델 용량과 같은 하이퍼파ram터에 대한 민감도 평가하는 것.

제안 방법

  • 사전 훈련된 언어 모델의 트랜스포머 레이어 사이에 경량 어댑터 모듈(하향 프로젝션, 비선형성(tanh), 상향 프로젝션으로 구성)을 삽입한다.
  • 모든 원래 PrLM 파aram터를 동결하고, 미세조정 중에는 어댑터 모듈의 파aram터만 업데이트한다.
  • 튜닝 후 원래 PrLM의 히든 표현에서의 이탈을 측정하기 위해 표현 유사도 분석(RSA)을 사용한다.
  • 어댑터 가중치가 근처에 0에 가까워지면 신뢰성 있는 매핑을 허용하기 위해 어댑터에 스킵 커넥션을 사용한다.
  • GLUE, XNLI 및 후행 분류 작업을 포함한 여러 NLP 작업에서 BERT-base를 사용해 성능을 비교한다.
  • 다양한 학습률, 데이터 크기, 제로샷 다국어 전이 설정에서 일반화 및 안정성 평가한다.

실험 결과

연구 질문

  • RQ1어댑터 기반 튜닝이 전면 미세조정보다 원래 PrLM에서의 표현 이탈을 줄여 더 나은 정규화를 나타내는가?
  • RQ2저자원 및 고자원 설정에서 어댑터 기반 튜닝은 전면 미세조정 대비 어떻게 성능을 내는가?
  • RQ3학습률 변화와 같은 하이퍼파aram터 변화에 대해 어댑터 기반 튜닝은 전면 미세조정보다 더 강건한가?
  • RQ4제로샷 다국어 전이 학습에서 어댑터 기반 튜닝은 전면 미세조정 대비 얼마나 효과적인가?
  • RQ5혼합 출력(mixout) 정규화 기법과 결합했을 때 어댑터 기반 튜닝은 전면 미세조정을 능가할 수 있는가?

주요 결과

  • 어댑터 기반 튜닝은 전면 미세조정보다 원래 PrLM에서의 표현 이탈을 더 효과적으로 줄여 더 나은 정규화와 잊힘 감소를 나타낸다.
  • 저자원 설정에서는 어댑터 기반 튜닝이 전면 미세조정을 능가하며, 특히 도메인 특화 작업에서 성능 향상이 두드러진다. 데이터 크기가 증가함에 따라 성능 향상 폭은 점점 줄어든다.
  • 모든 데이터 설정에서 제로샷 다국어 전이 작업에서 어댑터 기반 튜닝이 전면 미세조정보다 뛰어난 결과를 내며, 새로운 언어로의 일반화 능력이 뛰어나다는 것을 보여준다.
  • 어댑터 기반 튜닝은 전면 미세조정보다 학습률 하이퍼파aram터 변화에 훨씬 더 강건하며, 다양한 학습률에서 성능 변동이 적다.
  • 혼합 출력 정규화 실험에서 어댑터 기반 튜닝은 혼합 출력 정규화가 적용된 전면 미세조정보다 더 높은 성능을 달성한다. 또한 어댑터에 혼합 출력을 적용할 경우 가용 학습 파aram터 수가 제한되어 성능 저하가 발생한다.
  • 어댑터와 전면 미세조정 간의 성능 격차는 저자원 및 다국어 시나리오에서 가장 두드러지며, 이는 어댑터가 파aram터 효율적 적응에서의 강점을 잘 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.