[논문 리뷰] Application of Pre-training Models in Named Entity Recognition
이 논문은 MSRA-2006 데이터셋에서 미세조정을 통해 BERT, ERNIE, ERNIE2.0-tiny 및 RoBERTa의 사전 훈련된 언어 모델 네 가지를 중국어 명명된 실체 인식(NER)에 대해 평가한다. RoBERTa는 동적 마스킹과 문장 수준의 NSP 사전 훈련 작업 제거로 인해 NER 작업에 악영향을 미치는 것으로 밝혀져, F1 스코어 94.17%로 최신 기술 성능(SOTA)을 달성한다.
Named Entity Recognition (NER) is a fundamental Natural Language Processing (NLP) task to extract entities from unstructured data. The previous methods for NER were based on machine learning or deep learning. Recently, pre-training models have significantly improved performance on multiple NLP tasks. In this paper, firstly, we introduce the architecture and pre-training tasks of four common pre-training models: BERT, ERNIE, ERNIE2.0-tiny, and RoBERTa. Then, we apply these pre-training models to a NER task by fine-tuning, and compare the effects of the different model architecture and pre-training tasks on the NER task. The experiment results showed that RoBERTa achieved state-of-the-art results on the MSRA-2006 dataset.
연구 동기 및 목표
- 사전 훈련된 언어 모델이 중국어 명명된 실체 인식(NER) 성능 향상에 얼마나 효과적인지 평가하기 위해.
- 모델 아키텍처와 사전 훈련 작업이 NER 성능에 미치는 영향을 조사하기 위해.
- 정적 마스킹 대비 동적 마스킹 및 실체 수준 마스킹과 같은 다양한 사전 훈련 전략의 영향을 NER에 대해 비교하기 위해.
- 문장 수준의 사전 훈련 작업, 예를 들어 NSP가 NER와 같은 시퀀스 레이블링 작업에 유익한지 여부를 판단하기 위해.
- 아키텍처와 사전 훈련 목표에 기반하여 NER에 최적의 사전 훈련된 모델을 선택하기 위한 경험적 증거를 제공하기 위해.
제안 방법
- MSRA-2006 중국어 NER 데이터셋에서 사전 훈련된 모델 네 가지—BERT, ERNIE, ERNIE2.0-tiny, RoBERTa—를 미세조정하였다.
- 태그 간 의존성을 모델링하고 유효한 태그 시퀀스를 보장하기 위해 사전 훈련된 모델 출력 위에 CRF 레이어를 적용하였다.
- 사전 훈련된 모델의 최종 레이어 이후에 완전 연결 레이어를 적용하여 문맥적 표현을 태그 공간으로 투영하였다.
- BERT와 ERNIE는 정적 마스킹을 사용한 반면, RoBERTa에서는 각 훈련 에포크마다 다른 토큰이 마스킹되는 동적 마스킹을 사용하였다.
- BERT와 ERNIE와 달리 RoBERTa에서는 다음 문장 예측(NSP) 작업을 제거하여 NER 성능에 미치는 영향을 평가하였다.
- V100 GPU를 사용하여 AI Studio에서 PaddlePaddle를 사용해 모델을 훈련하였으며, 개발 세트에서 초기 학습률 5e-5, 배치 크기 16, 2 에포크로 하이퍼파라미터를 최적화하였다.
실험 결과
연구 질문
- RQ1MSRA-2006 데이터셋에서 모델 아키텍처의 차이—예를 들어 레이어 수, 히든 사이즈—가 NER 성능에 어떤 영향을 미치는가?
- RQ2사전 훈련 작업, 특히 MLM, NSP 및 실체/구문 수준 마스킹이 NER 성능에 어떤 영향을 미치는가?
- RQ3RoBERTa에서 NSP 사전 훈련 작업을 제거함으로써 BERT와 ERNIE에 비해 NER 작업 성능이 향상되었는지 또는 악화되었는가?
- RQ4ERNIE2.0-tiny는 더 많은 히든 유닛과 연속적인 사전 훈련을 갖추고 있음에도 불구하고 성능이 떨어지는 이유는 무엇이며, 얕은 아키텍처는 성능에 어떤 영향을 미치는가?
- RQ5RoBERTa의 동적 마스킹이 BERT와 ERNIE의 정적 마스킹에 비해 의미 표현을 얼마나 향상시키는가?
주요 결과
- RoBERTa는 MSRA-2006 데이터셋에서 F1 스코어 94.17%로 가장 높은 성능을 기록했으며, BERT(93.30%), ERNIE(93.37%), ERNIE2.0-tiny(86.52%)를 모두 앞섰다.
- RoBERTa에서 다음 문장 예측(NSP) 작업을 제거함으로써 성능 향상이 이루어졌으며, 이는 문장 수준의 사전 훈련이 NER에 유익하지 않으며 장거리 의존성 학습을 방해할 수 있음을 시사한다.
- RoBERTa의 동적 마스킹은 모델 일반화와 의미 표현을 향상시켜, 정적 마스킹을 사용하는 BERT와 ERNIE에 비해 뛰어난 성능을 내는 데 기여했다.
- ERNIE2.0-tiny는 더 많은 히든 유닛과 연속적인 사전 훈련을 갖추고 있음에도 불구하고 F1 스코어 86.52%에 그치며, 기준 BiGRU+CRF 모델(90.32%)보다도 유의미하게 낮았다. 이는 얕은 3층 아키텍처가 의미적 특징 추출을 제한하기 때문이다.
- ERNIE의 실체 수준 및 구문 수준 마스킹 전략은 BERT에 비해 약간의 성능 저하를 초래했으며, 이는 마스킹 과정에서의 분할 오류 가능성 때문일 수 있다.
- RoBERTa의 깊은 아키텍처(12층)와 최적화된 사전 훈련 목표는 더 적은 레이어 또는 최적화되지 않은 사전 훈련 작업을 가진 모델보다 NER와 같은 시퀀스 레이블링 작업에 더 효과적임을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.