Skip to main content
QUICK REVIEW

[논문 리뷰] Improving BERT Fine-tuning with Embedding Normalization

Wenxuan Zhou, Junyi Du|arXiv (Cornell University)|2019. 11. 10.
Topic Modeling참고 문헌 9인용 수 4
한 줄 요약

이 논문은 BERT의 [CLS] 토큰에서 편향된 임베딩 분포를 규명한다—특히 활성화 값이 몇몇 차원에 집중되어 있고 원점 중심이 아니며, 이로 인해 미세조정 중 최적화가 불안정해진다. 이를 해결하기 위해, [CLS] 임베딩을 재중앙화하고 정규화하는 단순한 임베딩 정규화 기법을 제안하며, 아키텍처 변경 없이도 다양한 텍스트 분류 작업에서 성능 향상을 이룬다.

ABSTRACT

Large pre-trained sentence encoders like BERT start a new chapter in natural language processing. A common practice to apply pre-trained BERT to sequence classification tasks (e.g., classification of sentences or sentence pairs) is by feeding the embedding of [CLS] token (in the last layer) to a task-specific classification layer, and then fine tune the model parameters of BERT and classifier jointly. In this paper, we conduct systematic analysis over several sequence classification datasets to examine the embedding values of [CLS] token before the fine tuning phase, and present the biased embedding distribution issue---i.e., embedding values of [CLS] concentrate on a few dimensions and are non-zero centered. Such biased embedding brings challenge to the optimization process during fine-tuning as gradients of [CLS] embedding may explode and result in degraded model performance. We further propose several simple yet effective normalization methods to modify the [CLS] embedding during the fine-tuning. Compared with the previous practice, neural classification model with the normalized embedding shows improvements on several text classification tasks, demonstrates the effectiveness of our method.

연구 동기 및 목표

  • BERT의 [CLS] 토큰 임베딩의 분포적 성질이 미세조정 이전에 어떻게 되어 있는지 조사하기.
  • 편향되며 원점 중심이 아닌 [CLS] 임베딩이 미세조정 중 최적화를 저해한다는 것을 규명하기.
  • 학습 안정성을 높이고 시퀀스 분류 작업에서 성능을 향상시키기 위한 정규화 기법을 제안하기.
  • 다양한 벤치마크 텍스트 분류 데이터셋을 통해 정규화된 [CLS] 임베딩의 효과를 평가하기.

제안 방법

  • 미세조정 이전에 여러 시퀀스 분류 데이터셋에서 [CLS] 토큰 임베딩의 분포를 분석하기.
  • 미세조정 중 [CLS] 임베딩 벡터에 배치 정규화 및 레이어 정규화와 같은 정규화 기법을 적용하기.
  • 배치 내 평균을 빼어 [CLS] 임베딩을 재중앙화하여 원점 중심화를 달성하기.
  • 분류기의 입력을 수정하여, 분류기로 들어가기 전에 [CLS] 표현을 정규화하기.
  • BERT의 아키텍처나 사전학습을 변경하지 않고도 경량의 후처리 단계로 정규화를 통합하기.
  • 표준 벤치마크를 사용하여 정규화의 영향을 최종 분류 성능에 대해 평가하기.

실험 결과

연구 질문

  • RQ1BERT의 [CLS] 토큰 임베딩은 시퀀스 분류 작업에서 미세조정 이전에 어떻게 분포되어 있는가?
  • RQ2[CLS] 임베딩의 원점 중심이 아니며 집중된 분포가 미세조정 최적화에 얼마나 큰 영향을 미치는가?
  • RQ3간단한 [CLS] 임베딩 정규화가 미세조정의 안정성과 모델 성능 향상에 기여할 수 있는가?
  • RQ4다양한 텍스트 분류 데이터셋에서 정규화 기법은 표준 미세조정과 비교해 어떻게 성능을 내는가?

주요 결과

  • [CLS] 토큰 임베딩은 미세조정 이전에 높은 차원 집중과 원점 중심이 아닌 편향된 분포를 보인다.
  • 이러한 편향된 분포는 미세조정 중에 불안정한 기울기와 성능 저하를 초래한다.
  • 배치 재중앙화 및 레이어 정규화와 같은 정규화 기법이 최적화 과정을 효과적으로 안정화시킨다.
  • 제안된 방법은 표준 미세조정 대비 여러 텍스트 분류 벤치마크에서 일관된 성능 향상을 달성한다.
  • 아키텍처 변경이나 추가 파rameter 없이도 성취된 성과로, 이 방법은 경량이며 쉽게 구현할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.