[논문 리뷰] ZEN: Pre-training Chinese Text Encoder Enhanced by N-gram Representations
ZEN은 사전에 추출된 n-gram 표현을 통해 사전 학습 중에 어휘 및 어구 수준의 정보를 통합함으로써 문자 수준의 인코더인 BERT의 의미 이해 능력을 향상시키는 중국어 텍스트 인코더를 제안한다. 보조 Transformer 인코더를 통해 n-gram 표현을 통합하고 문자 수준 표현과 융합함으로써 ZEN은 이전 모델들보다 더 적은 데이터와 외부 지식 없이도 여러 중국어 NLP 작업에서 최신 기술 수준의 성능을 달성한다.
The pre-training of text encoders normally processes text as a sequence of tokens corresponding to small text units, such as word pieces in English and characters in Chinese. It omits information carried by larger text granularity, and thus the encoders cannot easily adapt to certain combinations of characters. This leads to a loss of important semantic information, which is especially problematic for Chinese because the language does not have explicit word boundaries. In this paper, we propose ZEN, a BERT-based Chinese (Z) text encoder Enhanced by N-gram representations, where different combinations of characters are considered during training. As a result, potential word or phase boundaries are explicitly pre-trained and fine-tuned with the character encoder (BERT). Therefore ZEN incorporates the comprehensive information of both the character sequence and words or phrases it contains. Experimental results illustrated the effectiveness of ZEN on a series of Chinese NLP tasks. We show that ZEN, using less resource than other published encoders, can achieve state-of-the-art performance on most tasks. Moreover, it is shown that reasonable performance can be obtained when ZEN is trained on a small corpus, which is important for applying pre-training techniques to scenarios with limited data. The code and pre-trained models of ZEN are available at https://github.com/sinovation/zen.
연구 동기 및 목표
- 중국어에서 단어 분할이 모호한 점을 감안할 때, BERT와 같은 문자 수준 인코더가 의미 있는 어절 및 어구 경계를 포착하지 못하는 한계를 해결하기 위해.
- 모델 학습 중에 명시적인 n-gram 정보를 통합하여 중국어 사전 학습에서 의미 표현을 향상시키기 위해.
- 출력 형식을 문자 수준으로 유지함으로써 BERT를 수정하지 않고도 향상된 성능을 내는 방법을 개발하기 위해.
- 자동으로 학습된 n-gram을 활용하여 작은 또는 제한된 코퍼스에서도 효과적인 사전 학습을 가능하게 하기 위해.
- 서브워드 수준의 의미를 통합하기 위한 전통적인 전체어 masking 또는 약한 지도 학습 방법의 보완이 되는 방법을 제공하기 위해.
제안 방법
- ZEN은 두 가지 브랜치 아키텍처를 사용한다: 표준 BERT 기반 문자 인코더와 별도의 Transformer 인코더로 구성된 n-gram 인코더이다.
- n-gram은 비지도 학습 또는 사전 기반 방법으로 유도된 어휘에서 추출되며, 유효하고 빈도가 높은 문자 조합을 포착한다.
- n-gram 인코더는 검출된 각 n-gram에 대해 문맥적 표현을 생성하며, 이를 BERT 인코더의 해당 문자 표현과 요소별로 더한다.
- 모델은 마스크된 언어 모델링(MLM)과 다음 문장 예측(NSP) 목적함수를 모두 사용하여 사전 학습하며, n-gram 정보는 순전파 과정 중에 통합된다.
- 微조정 단계에서는 n-gram 표현을 계속 활용하여 작업에 특화된 적응을 가능하게 하면서도 문자 수준 출력 호환성을 유지한다.
- 통합 메커니즘은 미분 가능하며 BERT 아키텍처를 수정하지 않아도 되므로 엔드 투 엔드 학습이 가능하다.
실험 결과
연구 질문
- RQ1명시적인 n-gram 표현 통합이 중국어 NLP 작업에서 문자 수준 사전 학습 모델의 성능을 향상시킬 수 있는가?
- RQ2ZEN의 n-gram 정보 통합 방법이 전체어 마스킹 또는 약한 지도 학습 방법과 비교해 성능과 데이터 효율성 측면에서 어떻게 다른가?
- RQ3더 높은 수준의 n-gram 표현을 사용하더라도, ZEN은 문자 수준 출력을 요구하는 후속 작업과 호환성을 유지하는가?
- RQ4ZEN은 기존 모델이 더 큰 코퍼스에 의존하는 것보다 더 적은 학습 데이터로도 최신 기술 수준의 성능을 달성할 수 있는가?
- RQ5ZEN의 계층을 거치며 n-gram 표현은 어떻게 변화하며, 이는 의미적 표현과 형태소 표현 간의 차이를 어떻게 드러내는가?
주요 결과
- ZEN은 CLUE 및 CCLUE와 같은 여러 중국어 NLP 벤치마크에서 최신 기술 수준의 성능을 달성하며, 더 큰 코퍼스로 사전 학습된 모델들을 능가한다.
- ZEN는 작은 코퍼스로 사전 학습된 경우에도 강력한 성능을 보이며, 자원이 제한된 환경에 적합한 높은 데이터 효율성을 입증한다.
- 문장 분류 및 시퀀스 레이블링과 같이 어구 수준 이해가 필요한 작업에서 명시적인 n-gram 인코딩 덕분에 성능 향상이 이루어진다.
- 분석 결과, 더 긴 유효한 n-gram들인 提高速度 (속도 향상) 및 波士顿咨询 (보스턴 컨설팅 그룹) 같은 표현들이 깊은 계층에서 더 높은 주의 가중치를 받는 것으로 나타나 의미적 인코딩을 나타낸다.
- n-gram 표현의 통합은 모델이 의미 있는 텍스트 조각을 학습하는 데 능력을 향상시키며, 핵심어 추출 및 어구 분할과 같은 후속 작업에 응용 가능성을 시사한다.
- 외부 지식이나 복잡한 사전 처리를 사용하지 않음에도 불구하고, ZEN은 자율 지도 학습을 통한 n-gram 학습에만 의존함에도 불구하고, 외부 지식을 활용하거나 복잡한 전처리를 거친 모델들과 경쟁하거나 그 이상의 성능을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.