[논문 리뷰] ChineseBERT: Chinese Pretraining Enhanced by Glyph and Pinyin Information
ChineseBERT는 BERT 스타일의 사전학습에 고스트 및 퓨인음 임베딩을 통합하여 중국어 언어 표현을 향상시킨다. 이는 시각적 문자 형태와 발음 해석 해소를 통해 의미 모델링을 향상시킨다. 더 적은 학습 스텝과 더 적은 데이터로도 여러 중국어 NLP 작업에서 새로운 최고 성능을 달성하며, 사전학습 과정에서 다중모달 문자 수준 신호의 효과성을 입증한다.
Recent pretraining models in Chinese neglect two important aspects specific to the Chinese language: glyph and pinyin, which carry significant syntax and semantic information for language understanding. In this work, we propose ChineseBERT, which incorporates both the {\it glyph} and {\it pinyin} information of Chinese characters into language model pretraining. The glyph embedding is obtained based on different fonts of a Chinese character, being able to capture character semantics from the visual features, and the pinyin embedding characterizes the pronunciation of Chinese characters, which handles the highly prevalent heteronym phenomenon in Chinese (the same character has different pronunciations with different meanings). Pretrained on large-scale unlabeled Chinese corpus, the proposed ChineseBERT model yields significant performance boost over baseline models with fewer training steps. The porpsoed model achieves new SOTA performances on a wide range of Chinese NLP tasks, including machine reading comprehension, natural language inference, text classification, sentence pair matching, and competitive performances in named entity recognition. Code and pretrained models are publicly available at https://github.com/ShannonAI/ChineseBert.
연구 동기 및 목표
- 기존 중국어 사전학습 모델에서 고스트 및 퓨인음 정보의 부족으로 인해 의미 및 문법 모델링이 제한되는 문제를 해결하기 위해.
- 문자에 대한 시각적(고스트) 및 청각적(퓨인음) 특징을 사전학습 과정에 통합하여 중국어 언어 이해를 향상시키기 위해.
- 구조적 및 청각적 신호를 정규화 요소로 활용하여 대규모 레이블링된 데이터에 대한 의존도를 줄이기 위해.
- 더 적은 학습 스텝과 더 적은 데이터로 다양한 중국어 NLP 작업에서 뛰어난 성능을 달성하기 위해.
제안 방법
- 다양한 폰트 스타일의 중국어 문자에서 유도된 고스트 임베딩을 도입하여 시각적 의미 신호를 캡처한다.
- 퓨인음 임베딩을 통합하여 동음이의어 및 이의어를 해소하고, 다음음의 모호함을 해결한다.
- 고스트, 퓨인음, 문자-ID 임베딩을 하나의 토큰에 대한 상황적 표현으로 융합한다.
- 마스크된 언어 모델링 및 다음 문장 예측을 사용하여 대규모 비라벨 중국어 코퍼스에서 모델을 사전학습한다.
- 문자 형태, 발음, 정체성에서 동시에 학습할 수 있도록 다중 브런치 아키텍처를 사용한다.
- 텍스트 분류, NLI, MRC, 시퀀스 태깅과 같은 하류 작업에서 모델을 미세조정한다.
실험 결과
연구 질문
- RQ1사전학습 과정에 고스트 및 퓨인음 정보를 통합하면 하류 작업에서 중국어 언어 모델의 성능 향상이 이루어지는가?
- RQ2고스트 및 퓨인음 임베딩은 중국어의 다음음 문자를 어떻게 해소하는가?
- RQ3시각적 및 청각적 특징의 포함이 정규화 요소로 작용하여 더 적은 학습 데이터로도 더 나은 성능을 내는가?
- RQ4ChineseBERT는 RoBERTa 및 BERT-wwm과 비교해 다양한 중국어 NLP 벤치마크에서 어떻게 성능을 내는가?
주요 결과
- ChineseBERT는 기계적 독해, 자연어 추론, 텍스트 분류, 문장 쌍 매칭 작업에서 새로운 최고 성능을 달성한다.
- MSRA 및 PKU 단어 분할 데이터셋에서, 대규모 버전으로 98.67 F1과 98.01 정확도를 MSRA에서, 97.16 F1과 98.01 정확도를 PKU에서 기록한다.
- 명명된 실체 인식 작업에서 ChineseBERT는 OntoNotes 4.0에서 81.65 F1을 기록하며, RoBERTa를 1.28 포인트 초월한다.
- 제거 실험 결과, 고스트 또는 퓨인음 임베딩을 제거할 경우 F1 점수가 1.17~1.52 포인트 감소함을 확인하여, 두 임베딩의 개별적 및 통합적 중요성을 확인한다.
- 학습 데이터의 30% 미만일 경우 성능 향상이 미미하지만, 30% 이상일 경우 성능 향상이 뚜렷해지며, 이는 데이터 효율성을 시사한다.
- 모든 평가된 작업에서 RoBERTa 및 BERT-wwm보다 중국어BERT가 더 뛰어난 성능을 보이며, 더 적은 데이터와 더 적은 에포크로도 학습된 경우에도 동일한 결과를 기록한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.