Skip to main content
QUICK REVIEW

[논문 리뷰] To Tune or Not To Tune? How About the Best of Both Worlds?

Ran Wang, Haibo Su|arXiv (Cornell University)|2019. 07. 09.
Topic Modeling참고 문헌 36인용 수 15
한 줄 요약

이 논문은 사전 훈련된 언어 모델을 위한 이단계 적응 방법을 제안한다: 먼저 고정된 BERT 파rameter를 사용해 작업별 헤드를 훈련한 후, 헤드와 BERT를 함께 미세조정한다. 이 방법은 일관된 정확도 향상을 보이며, 의미 유사성 작업에서 4.7%, 시퀀스 레이블링에서 0.99%, 텍스트 분류에서 0.72% 향상되었으며, 표준 미세조정 전용 전략보다 stack-and-finetune가 더 우수하다는 것을 입증한다.

ABSTRACT

The introduction of pre-trained language models has revolutionized natural language research communities. However, researchers still know relatively little regarding their theoretical and empirical properties. In this regard, Peters et al. perform several experiments which demonstrate that it is better to adapt BERT with a light-weight task-specific head, rather than building a complex one on top of the pre-trained language model, and freeze the parameters in the said language model. However, there is another option to adopt. In this paper, we propose a new adaptation method which we first train the task model with the BERT parameters frozen and then fine-tune the entire model together. Our experimental results show that our model adaptation method can achieve 4.7% accuracy improvement in semantic similarity task, 0.99% accuracy improvement in sequence labeling task and 0.72% accuracy improvement in the text classification task.

연구 동기 및 목표

  • 사전 훈련된 BERT를 고정한 채 작업 헤드를 미리 훈련한 후, 헤드와 BERT를 함께 미세조정하는 이단계 훈련 전략이 표준 미세조정 전용 방법보다 성능을 더 좋게 하는지 조사하는 것.
  • 특히 간단한 헤드 추가 또는 워드 임베딩 기반 전략과 비교할 때, 사전 훈련된 언어 모델 위에 설계된 아키텍처의 영향을 평가하는 것.
  • 대규모 사전 훈련된 모델을 사용한 딥 트랜스퍼 러닝에서 과적합 완화 및 기울기 흐름의 역할을 탐색하는 것.
  • BERT의 표현 구조에 맞게 설계된 복잡한 신경망을 BERT 위에 스택하여 단순한 미세조정을 초월한 성능 향상을 달성할 수 있는지 판단하는 것.

제안 방법

  • 먼저 BERT의 파라미터를 고정한 채, 작업에 특화된 신경망 헤드를 훈련시켜 수렴할 때까지 진행하며, 훈련 정확도와 검증 정확도의 격차를 통해 과적합 여부를 모니터링한다.
  • 그 후, BERT 인코더와 작업에 특화된 헤드를 함께 미세조정하여 파라미터 정렬을 향상시킨다.
  • 두 단계 훈련 스케줄을 사용한다: 첫 번째 단계에서는 BERT를 고정한 채 헤드를 훈련하고, 두 번째 단계에서는 모든 파라미터를 업데이트하는 엔드 투 엔드 미세조정을 수행한다.
  • BIMPM의 수정된 버전과, 매칭 레이어에서 양방향 LSTM을 트랜스포머로 대체한 Sim-Transformer 변형과 같은 다양한 네트워크 아키텍처를 BERT 위에 설계하고 평가한다.
  • 첫 번째 단계에서 검증 성능을 기반으로 조기 정지 기법을 적용하여 공동 미세조정 이전에 과적합을 방지한다.
  • 세 가지 NLP 작업(의미 유사성, 시퀀스 레이블링, 텍스트 분류)에서 표준 미세조정 전용 기준선과 BERT 전용 고정된 표현과의 결과를 비교한다.

실험 결과

연구 질문

  • RQ1BERT를 고정한 채 헤드를 사전 훈련한 후, 헤드와 BERT를 함께 미세조정하는 이단계 훈련 전략이 표준 미세조정 전용 방법보다 성능을 더 좋게 하는가?
  • RQ2BIMPM의 양방향 LSTM을 트랜스포머로 대체하는 것과 같은 BERT 위의 아키텍처 수정이 제안된 이단계 훈련과 결합될 경우 성능 향상을 이끌 수 있는가?
  • RQ3다양한 데이터 크기를 가진 다양한 NLP 작업에서 stack-and-finetune의 성능는 미세조정 전용 전략과 비교해 어떻게 다른가?
  • RQ4고도로 파라미터 수가 많은 대규모 사전 훈련된 모델을 미세조정할 때 과적합을 방지하는 데 가장 효과적인 훈련 전략은 무엇인가?
  • RQ5사전 훈련된 모델의 깊이와 구조가 상위 레이어 신경망의 설계 및 효과성에 얼마나 큰 영향을 미치는가?

주요 결과

  • 제안된 stack-and-finetune 방법은 미세조정 전용 기준선 대비 의미 유사성 작업에서 4.7%의 정확도 향상을 달성했다.
  • 시퀀스 레이블링 작업에서는 이 방법이 미세조정 전용 접근 방식보다 0.99% 높은 정확도를 기록했다.
  • 텍스트 분류 작업에서는 단순한 미세조정 대비 0.72%의 정확도 향상을 기록했다.
  • BIMPM의 양방향 LSTM을 트랜스포머로 대체한 Sim-Transformer 모델은 BERT를 고정한 상태에서는 성능이 떨어졌지만, 공동 미세조정 후에는 BIMPM를 능가했다.
  • BIMPM의 첫 번째 양방향 LSTM 레이어를 제거하는 것은 성능에 거의 영향을 주지 않았으며, 이는 BERT의 표현이 이미 매우 표현력이 뛰어나다는 것을 시사한다.
  • 이단계 훈련 전략은 과적합을 효과적으로 줄이고 일반화 성능을 향상시켰으며, 특히 훈련 정확도와 검증 정확도 격차를 신중히 모니터링함으로써 더욱 효과적이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.