Skip to main content
QUICK REVIEW

[논문 리뷰] Better Fine-Tuning by Reducing Representational Collapse

Armen Aghajanyan, Akshat Shrivastava|arXiv (Cornell University)|2020. 08. 06.
Topic Modeling참고 문헌 29인용 수 20
한 줄 요약

이 논문은 신뢰영역 이론에 기반한 효율적인 파인튜닝 방법인 R3F와 R4F를 제안하며, 훈련 중에 매개변수화된 노이즈를 적용하여 표현 붕괴를 감소시킵니다. 이 방법은 GLUE, XNLI, 요약 및 생성 작업에서 표준 파인튜닝 및 적대적 파인튜닝을 능가하지만, 일반화 가능한 표현을 유지하면서도 계산 비용을 크게 줄입니다.

ABSTRACT

Although widely adopted, existing approaches for fine-tuning pre-trained language models have been shown to be unstable across hyper-parameter settings, motivating recent work on trust region methods. In this paper, we present a simplified and efficient method rooted in trust region theory that replaces previously used adversarial objectives with parametric noise (sampling from either a normal or uniform distribution), thereby discouraging representation change during fine-tuning when possible without hurting performance. We also introduce a new analysis to motivate the use of trust region methods more generally, by studying representational collapse; the degradation of generalizable representations from pre-trained models as they are fine-tuned for a specific end task. Extensive experiments show that our fine-tuning method matches or exceeds the performance of previous trust region methods on a range of understanding and generation tasks (including DailyMail/CNN, Gigaword, Reddit TIFU, and the GLUE benchmark), while also being much faster. We also show that it is less prone to representation collapse; the pre-trained models maintain more generalizable representations every time they are fine-tuned.

연구 동기 및 목표

  • 사전 훈련된 언어 모델의 표준 파인튜닝에서 발생하는 불안정성과 낮은 일반화 성능을 해결하기 위해.
  • 사전 훈련된 모델에서 일반화 가능한 특징가 파인튜닝 과정에서 악화되는 표현 붕괴 현상을 규명하기 위해.
  • SMART 및 FreeLB와 같은 적대적 신뢰영역 방법의 계산 비용을 줄인 효율적인 대안을 개발하기 위해.
  • 표현 붕괴가 감소할수록 다양한 NLP 작업에서 제로샷 및 피처샷 일반화 성능이 향상됨을 입증하기 위해.

제안 방법

  • 모델의 표현에 매개변수화된 노이즈(정규 또는 균일 분포)를 적용하여 정규화 역할을 수행합니다.
  • 표현 분포의 변화를 제약하여 신뢰영역 최적화를 근사함으로써, 붕괴를 유발하는 큰 갱신을 방지합니다.
  • 적대적 방법이 여러 번의 순환을 필요로 하는 것과 달리, 각 갱신마다 단일 역전파 단계만 사용하여 메모리 및 계산 비용을 감소시킵니다.
  • 표현 밀도 간의 KL 발산으로 제약된 최적화 문제로 파인튜닝을 공식화하며, 노이즈 주입을 통해 이를 근사합니다.
  • R3F(잔차 연결 포함)와 R4F(추가 정규화 포함)로 구현되었으며, 둘 다 효율성과 안정성을 고려해 설계되었습니다.
  • 파인튜닝 후 동결된 표현에 선형 헤드를 훈련시켜 표현 품질과 붕괴 정도를 측정하기 위해 探색 실험을 수행합니다.

실험 결과

연구 질문

  • RQ1표준 파인튜닝은 사전 훈련된 모델의 일반화 가능한 특징가 적응 과정에서 악화되는 표현 붕괴를 초래하는가?
  • RQ2신뢰영역 기반 방법은 표준 파인튜닝보다 표현 붕괴를 더 효과적으로 완화할 수 있는가?
  • RQ3기존의 적대적 파인튜닝 접근 방식보다 더 단순하고 효율적인 방법이 더 낮은 계산 비용으로 유사하거나 더 높은 성능을 달성할 수 있는가?
  • RQ4R3F와 R4F는 순차적 및 순환적 작업 파인튜닝 동안 표현 품질을 얼마나 잘 유지하는가?
  • RQ5감소된 표현 붕괴는 다양한 NLP 작업에서 제로샷 및 피처샷 일반화 성능 향상과 관련이 있는가?

주요 결과

  • R3F와 R4F는 모든 평가된 GLUE 작업에서 표준 파인튜닝 및 SMART와 같은 적대적 방법을 능가하며, RoBERTa의 GLUE에서 새로운 SOTA 성능을 확립합니다.
  • 추가 사전 훈련 없이도 제로샷 XNLI에서 최고 성능을 기록하여 개선된 다국어 일반화 능력을 보여줍니다.
  • 요약 작업(DailyMail/CNN, Gigaword, Reddit TIFU)에서 R3F와 R4F는 표준 파인튜닝을 일관되게 능가하며, 새로운 SOTA 결과를 달성합니다.
  • 탐색 실험 결과, R3F와 R4F는 표준 파인튜닝보다 더 높은 품질의 표현을 유지하며 순차적 작업 파인튜닝 동안 심각한 품질 저하를 보이지 않습니다.
  • 순환 탐색 실험에서 R4F는 여러 차례의 파인튜닝 사이클 동안 표현 품질을 유지하는 반면, 표준 파인튜닝은 점진적인 성능 저하를 보입니다.
  • SMART보다 표현 붕괴를 더 효과적으로 감소시켜 다양한 NLP 작업에서 일반화 능력과 강건성 향상과 관련이 있음을 입증합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.