[논문 리뷰] ERNIE-Gram: Pre-Training with Explicitly N-Gram Masked Language Modeling for Natural Language Understanding
ERNIE-Gram은 연속된 토큰 시퀀스가 아닌 n-gram의 정체성을 직접 예측함으로써 사전 훈련을 향상시키는 명시적 n-gram 마스킹 언어 모델링 방법을 제안한다. 생성자 모델을 사용해 유의미한 n-gram을 샘플링하고, 종합적인 거시적 및 미세적 예측을 가능하게 하며, 30만 개의 n-gram 어휘를 사용해 GLUE 및 SQuAD 벤치마크에서 새로운 SOTA 성능을 달성한다. 이는 19개의 NLU 작업에서 XLNet과 RoBERTa를 크게 앞서며 최고 성능을 기록한다.
Coarse-grained linguistic information, such as named entities or phrases, facilitates adequately representation learning in pre-training. Previous works mainly focus on extending the objective of BERT's Masked Language Modeling (MLM) from masking individual tokens to contiguous sequences of n tokens. We argue that such contiguously masking method neglects to model the intra-dependencies and inter-relation of coarse-grained linguistic information. As an alternative, we propose ERNIE-Gram, an explicitly n-gram masking method to enhance the integration of coarse-grained information into pre-training. In ERNIE-Gram, n-grams are masked and predicted directly using explicit n-gram identities rather than contiguous sequences of n tokens. Furthermore, ERNIE-Gram employs a generator model to sample plausible n-gram identities as optional n-gram masks and predict them in both coarse-grained and fine-grained manners to enable comprehensive n-gram prediction and relation modeling. We pre-train ERNIE-Gram on English and Chinese text corpora and fine-tune on 19 downstream tasks. Experimental results show that ERNIE-Gram outperforms previous pre-training models like XLNet and RoBERTa by a large margin, and achieves comparable results with state-of-the-art methods. The source codes and pre-trained models have been released at https://github.com/PaddlePaddle/ERNIE.
연구 동기 및 목표
- BERT 스타일의 마스킹 언어 모델링이 명사어 및 어구와 같은 거시적 언어 정보를 포착하는 데에 한계가 있다는 문제를 해결하기 위해.
- 연속된 n-gram 마스킹의 비효율성, 즉 마스킹된 구간 내 토큰들을 독립적으로 취급하고 상호 의존성을 忽略한다는 문제를 해결하기 위해.
- 희박한 토큰 공간이 아닌 조밀한 예측 공간에서 n-gram 정체성을 명시적으로 모델링함으로써 표현 학습을 향상시키기 위해.
- 종합적인 예측(거시적 및 미세적)과 명시적 n-gram 간 관계 학습을 통해 어구 및 명사어의 의미 모델링을 향상시키기 위해.
- 개선된 사전 훈련을 통해 다양한 NLU 벤치마크에서 최고 성능을 달성하기 위해.
제안 방법
- ERNIE-Gram은 단일 [MASK] 토큰을 사용해 n-gram을 마스킹하고, 사전에 구성된 n-gram 어휘에서 명시적 n-gram 정체성을 통해 예측함으로써 예측 공간을 |V_F|^n 에서 |V_N| 으로 감소시킨다.
- 유의미한 n-gram 정체성을 선택 가능한 마스크로 샘플링하기 위해 생성자 모델을 활용하여 더 강력하고 다양한 훈련 신호를 제공한다.
- 공유된 어텐션 마스크 메커니즘을 사용해 마스킹된 구간의 명시적 n-gram 정체성과 개별 토큰 정체성을 동시에 예측함으로써 종합적인 n-gram 예측을 수행한다.
- 향상된 n-gram 관계 모델링 메커니즘을 도입하여, 가능한 n-gram들로부터 원래의 n-gram을 복원하도록 학습함으로써 n-gram 간의 의미적 관계를 명시적으로 모델링한다.
- 교체된 토큰 탐지(RTD) 목적함수를 수정하여 원본 n-gram와 생성된 n-gram를 구분함으로써 n-gram 수준와 토큰 수준의 표현 간 상호작용을 향상시킨다.
- BERT-base 및 BERT-large 설정을 사용해 영어 및 중국어 텍스트 코퍼스 16GB와 160GB에서 사전 훈련을 수행하고, 19개의 다운스트림 작업에서 미세조정을 수행한다.
실험 결과
연구 질문
- RQ1개별 토큰이나 연속된 토큰 시퀀스를 마스킹하는 것보다 명시적으로 n-gram 정체성을 마스킹하고 예측하는 것이 표현 학습을 향상시키는가?
- RQ2희박한 지수 공간(V_F^n)에서 예측하는 것보다 유한하고 조밀한 공간(V_N)에서 n-gram 정체성을 예측하는 것이 성능 향상에 기여하는가?
- RQ3n-gram 정체성과 구성 토큰 정체성을 동시에 예측하는 종합적 예측 방식이 어구 및 명사어의 의미 모델링을 얼마나 향상시키는가?
- RQ4가능한 대체물로부터 원래 n-gram을 복원하도록 학습하는 명시적 n-gram 관계 모델링 방식이 문맥 표현 학습을 얼마나 향상시키는가?
- RQ5사전 훈련에서 커버리지와 성능의 균형을 고려할 때, n-gram 어휘의 최적 크기는 얼마인가?
주요 결과
- ERNIE-Gram은 19개의 다운스트림 NLU 작업에서 XLNet과 RoBERTa를 크게 앞서며 GLUE 및 SQuAD 벤치마크에서 최고 성능을 기록한다.
- GLUE 벤치마크에서 ERNIE-Gram은 SQuAD1.1에서 78.9 F1 점수, SQuAD2.0에서 87.4 F1 점수를 기록하여 이전 모델들을 크게 앞선다.
- 제거 실험 결과, 종합적인 n-gram 예측을 제거하면 성능이 0.3~0.6점 감소하고, 향상된 n-gram 관계 모델링을 제거하면 0.4~1.3점 감소한다.
- n-gram 어휘 크기가 30만을 초과할 경우 성능이 저하되며, 이는 저빈도 n-gram 포함이 학습에 악영향을 미친다는 것을 시사한다. 40만 어휘 크기에서는 성능 저하가 심각하게 발생한다.
- 사례 연구 결과, ERNIE-Gram은 더 긴 명사어에 대해 더 높은 재현율을 유지하고 전체 명사어에 걸쳐 더 강한 어텐션 일관성을 보이며, 내부 의존성 모델링이 더 우수하다는 것을 확인한다.
- 어텐션 헤드의 시각화 결과, ERNIE-Gram에서는 명사어 영역에 밝고 일관된 블록이 나타나, 동일한 엔티티 내 토큰들이 서로를 주목하는 경향을 보이며, 기준 모델의 대각선 자기어텐션 패tern과는 대조된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.