[논문 리뷰] Recall and Learn: Fine-tuning Deep Pretrained Language Models with Less Forgetting
이 논문은 사전 훈련 데이터에 접근할 수 없음에도 불구하고 사전 훈련 및 다운스트림 작업을 함께 학습함으로써 딥 사전 훈련된 언어 모델의 파인튜닝 중 치명적인 잊음 현상을 줄이기 위해 복구 및 학습 메커니즘을 제안한다. 사전 훈련된 가중치만을 사용하여 지식을 복구하기 위해 사전 훈련 시뮬레이션을 도입하고, 점차 다운스트림 작업에 집중하기 위해 목적 함수 이동 기법을 제안하여 BERT-base가 BERT-large를 초월하는 SOTA 성능을 달성하며, 보편적인 사용을 위해 오픈소스 RecAdam 최적화기까지 공개한다.
Deep pretrained language models have achieved great success in the way of pretraining first and then fine-tuning. But such a sequential transfer learning paradigm often confronts the catastrophic forgetting problem and leads to sub-optimal performance. To fine-tune with less forgetting, we propose a recall and learn mechanism, which adopts the idea of multi-task learning and jointly learns pretraining tasks and downstream tasks. Specifically, we propose a Pretraining Simulation mechanism to recall the knowledge from pretraining tasks without data, and an Objective Shifting mechanism to focus the learning on downstream tasks gradually. Experiments show that our method achieves state-of-the-art performance on the GLUE benchmark. Our method also enables BERT-base to achieve better performance than directly fine-tuning of BERT-large. Further, we provide the open-source RecAdam optimizer, which integrates the proposed mechanisms into Adam optimizer, to facility the NLP community.
연구 동기 및 목표
- 딥 사전 훈련된 언어 모델의 파인튜닝 중 순차적 전이 학습에서 치명적인 잊음 현상을 해결하기 위해.
- 대규모 사전 훈련 데이터에 접근할 수 없더라도 사전 훈련 작업과 다운스트림 작업의 다중 작업 학습을 가능하게 하기 위해.
- 동적 목적 함수 가중치 부여를 통해 사전 훈련 지식의 유지와 효과적인 다운스트림 작업 학습 간 균형을 이루기 위해.
- 이러한 메커니즘을 통합한 실용적인 최적화기를 개발하여 자연어 처리 연구 및 응용 분야에서 쉽게 도입할 수 있도록 하기 위해.
제안 방법
- 원본 훈련 데이터에 접근하지 않고도 사전 훈련된 모델의 파arameter들만을 사용하여 사전 훈련 목표(예: 마스킹 언어 모델링 등)를 재구성하는 사전 훈련 시뮬레이션 메커니즘을 제안한다.
- 훈련 중에 다운스트림 작업의 손실 가중치를 점차 증가시키고 사전 훈련 작업의 손실 가중치를 점차 감소시키는 목적 함수 이동 메커니즘을 도입한다.
- 고정된 사전 훈련된 모델의 로짓과 기울기를 사용하여 파라미터 효율적이고 미분 가능한 방식으로 사전 훈련 작업의 지도를 시뮬레이션하는 방법을 설계한다.
- 복구 및 학습 메커니즘을 Adam 최적화기와 통합하여 플러그 앤 플레이 방식으로 사용할 수 있는 오픈소스 RecAdam 최적화기를 도입한다.
- 학습 안정화와 잊음 감소를 위해 사전 훈련된 모델의 파라미터에서 근사한 이차 정규화 항을 사용한다.
- 훈련 에포크 수에 따라 사전 훈련 작업 중심에서 다운스트림 작업 중심으로 전환되는 동적 손실 가중치 전략을 사용한다.
실험 결과
연구 질문
- RQ1사전 훈련 데이터에 접근할 수 없음에도 불구하고 사전 훈련된 언어 모델의 파인튜닝에 대해 다중 작업 학습을 효과적으로 적용할 수 있는가?
- RQ2사전 훈련된 모델의 파라미터만을 사용하여 다운스트림 파인튜닝 중에 사전 훈련 지식을 어떻게 복구하고 유지할 수 있는가?
- RQ3어떤 동적 손실 가중치 전략이 사전 훈련 지식 유지와 다운스트림 작업 학습 간의 균형을 더 잘 이룰 수 있는가?
- RQ4통합 학습 메커니즘이 표준 파인튜닝에 비해 다운스트림 성능 향상과 잊음 감소 측면에서 뛰어나게 성능을 내는가?
주요 결과
- 제안된 방법은 GLUE 벤치마크에서 기존 표준 파인튜닝 및 베이스라인을 모두 초월하는 SOTA 성능을 달성한다.
- 제안된 방법으로 파인튜닝한 BERT-base는 GLUE에서 BERT-large를 직접 파인튜닝한 것보다 뛰어난 성능을 보이며, 잊음 현상이著しく 감소한 것으로 나타났다.
- 무작위 초기화 조건에서도 뛰어난 성능을 기록함으로써, 복구 메커니즘이 사전 훈련 지식을 효과적으로 재획득하고 있음을 보여준다.
- 제안된 메커니즘을 통합한 RecAdam 최적화기는 최소한의 구현 오버헤드로 여러 NLP 작업에서 일관된 성능 향상을 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.