[논문 리뷰] TaCL: Improving BERT Pre-training with Token-aware Contrastive Learning
이 논문은 BERT의 토큰 표현을 토큰 인식형 대비 학습을 통해 향상시키는 새로운 연속 미세조정 방법인 TaCL을 제안한다. 학생 모델이 마스킹된 토큰 표현을 고정된 교사 모델의 기준 표현과 대비시킴으로써, TaCL은 더 균일하고 구분력 있는 토큰 임베딩을 학습하며, 추가 데이터 없이도 다양한 영어 및 중국어 NLU 벤치마크에서 일관된 성능 향상을 이룬다.
Masked language models (MLMs) such as BERT and RoBERTa have revolutionized the field of Natural Language Understanding in the past few years. However, existing pre-trained MLMs often output an anisotropic distribution of token representations that occupies a narrow subset of the entire representation space. Such token representations are not ideal, especially for tasks that demand discriminative semantic meanings of distinct tokens. In this work, we propose TaCL (Token-aware Contrastive Learning), a novel continual pre-training approach that encourages BERT to learn an isotropic and discriminative distribution of token representations. TaCL is fully unsupervised and requires no additional data. We extensively test our approach on a wide range of English and Chinese benchmarks. The results show that TaCL brings consistent and notable improvements over the original BERT model. Furthermore, we conduct detailed analysis to reveal the merits and inner-workings of our approach.
연구 동기 및 목표
- 사전 훈련된 BERT 모델의 토큰 표현이 비균일한 분포를 띠는 문제를 해결하기 위해.
- 전이 학습을 위한 일반 목적의 토큰 수준 표현의 품질을 향상시키기 위해.
- 표현 다양성과 구분력이 향상된 토큰 수준에서의 전적으로 비지도 연속 미세조정 방법을 개발하기 위해.
- 하류 NLU 작업에서 기존 문장 수준의 대비 학습 방법보다 토큰 수준의 대비 학습이 더 큰 이점을 제공하는지 입증하기 위해.
- 제안된 방법의 내부 작동 방식과 표현 공간 기하학에 미치는 영향에 대한 경험적 및 분해 분석을 제공하기 위해.
제안 방법
- 학생 모델는 사전 훈련된 BERT에서 초기화되며, 마스킹 언어 모델링(MLM), 다음 문장 예측(NSP), 그리고 새로운 TaCL 대비 손실을 포함한 세 가지 목적함수를 사용해 지속적으로 미세조정된다.
- 고정된 교사 모델은 원본의 마스킹되지 않은 입력 시퀀스를 처리하여 각 토큰의 기준 표현을 생성한다.
- TaCL 손실은 학생 모델이 마스킹된 토큰의 표현을 동일한 토큰의 표현(양성)과 같은 시퀀스 내 다른 토큰들의 표현(음성)과 비교하여 코사인 유사도를 사용한다.
- 대비 목적함수는 다음과 같이 정의된다: $\mathcal{L}_{\textup{TaCL}} = -\sum_{i=1}^{n}\mathds{1}(\tilde{x}_{i})\log\frac{\exp(\textup{sim}(\tilde{h}_{i},h_{i})/\tau)}{\sum_{j=1}^{n}\exp(\textup{sim}(\tilde{h}_{i},h_{j})/\tau)}$, 여기서 $\mathds{1}(\tilde{x}_{i})$는 토큰 $i$가 마스킹된 경우 1이다.
- 전체 손실은 TaCL, MLM, NSP를 조합하여 정의된다: $\mathcal{L} = \mathcal{L}_{\textup{TaCL}} + \mathcal{L}_{\textup{MLM}} + \mathcal{L}_{\textup{NSP}}$.
- 이 방법은 전적으로 비지도이며, 추가 데이터가 필요로 하지 않고 원본 사전 훈련 코퍼스만 사용한다.
실험 결과
연구 질문
- RQ1토큰 수준에서의 대비 학습이 BERT 표현의 구분력 향상에 기여하는가?
- RQ2균일한 토큰 표현을 학습하는 것이 다양한 NLU 벤치마크에서 성능 향상에 기여하는가?
- RQ3하류 전이 성능 측면에서 TaCL은 최신의 문장 수준 대비 학습 방법보다 어떻게 비교되는가?
- RQ4TaCL은 학습된 표현 공간의 기하학적 구조에 어떤 영향을 미치는가?
- RQ5제안된 방법은 영어와 저자원 중국어 NLU 작업 양쪽에서 성능 향상에 기여하는가?
주요 결과
- TaCL은 GLUE, SQuAD 1.1, SQuAD 2.0, 다양한 NER 및 CWS 작업을 포함한 광범위한 영어 및 중국어 NLU 벤치마크에서 BERT에 비해 일관되고 뚜렷한 성능 향상을 이룬다.
- GLUE 벤치마크에서 TaCL은 BERT-base의 평균 점수를 85.4에서 86.7로 향상시켰으며, 9개 작업 중 7개에서 성능 향상을 보였다. 특히 CoLA에서 2.1점 향상되고 SST-2에서 1.3점 향상되었다.
- SQuAD 1.1에서 TaCL은 BERT-base의 F1 점수를 91.8에서 92.6으로, EM 점수를 88.5에서 89.2로 향상시켜 추출형 QA 작업에서 뚜렷한 성능 향상을 보였다.
- 중국어 NER 작업에서 TaCL은 Ontonotes에서 F1 점수를 2.1점 향상시키고 Resume에서는 1.8점 향상시켰다.
- 자기 유사성 행렬 시각화 결과, TaCL은 BERT보다 더 균일하고 구분력 있는 토큰 표현을 생성하며, 서로 다른 토큰들 간의 분리가 더 뚜렷하다는 것을 확인했다.
- 분해 분석 결과, TaCL 목적함수가 성능 향상의 주요 원동력이며, 이 방법이 토큰 수준의 하류 작업에서 문장 수준의 대비 학습보다 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.