Skip to main content
QUICK REVIEW

[논문 리뷰] Training Multilingual Pre-trained Language Model with Byte-level Subwords

Victor Junqiu Wei, Qun Liu|arXiv (Cornell University)|2021. 01. 23.
Topic Modeling참고 문헌 28인용 수 10
한 줄 요약

이 논문은 서브워드 토크나이제이션을 위해 바이트 수준 BPE(BBPE)를 사용하여 다국어 사전 훈련 언어 모델을 훈련시키는 방법을 제안한다. 이는 UTF-8 바이트 시퀀스를 대상으로 하여 어휘 효율성을 향상시키고 OOV(알 수 없는 단어) 토큰을 감소시킨다. 실험 결과, BBPE를 사용한 NEZHA 모델은 여러 다국어 NLU 작업에서 다국어 BERT와 표준 NEZHA를 모두 능가하며, 특히 자원이 적은 언어에서 뚜렷한 성능 향상을 보였다.

ABSTRACT

The pre-trained language models have achieved great successes in various natural language understanding (NLU) tasks due to its capacity to capture the deep contextualized information in text by pre-training on large-scale corpora. One of the fundamental components in pre-trained language models is the vocabulary, especially for training multilingual models on many different languages. In the technical report, we present our practices on training multilingual pre-trained language models with BBPE: Byte-Level BPE (i.e., Byte Pair Encoding). In the experiment, we adopted the architecture of NEZHA as the underlying pre-trained language model and the results show that NEZHA trained with byte-level subwords consistently outperforms Google multilingual BERT and vanilla NEZHA by a notable margin in several multilingual NLU tasks. We release the source code of our byte-level vocabulary building tools and the multilingual pre-trained language models.

연구 동기 및 목표

  • 다국어 BERT에서 문자 수준 어휘의 한계를 해결하기 위해, 희귀 서브워드 비율이 높고 지속적인 [UNK] 토큰 문제를 해결하고자 한다.
  • 다국어 사전 훈련 언어 모델에 대해 더 강력하고 효율적인 대안으로 바이트 수준 서브워드 토크나이제이션을 탐색하고자 한다.
  • 다양한 언어 간의 서브워드 공유 및 표현 학습을 향상시켜 자원이 적은 언어에서의 모델 성능을 향상시키고자 한다.
  • 바이트 수준 BPE(BBPE)가 더 높은 빈도의 서브워드를 생성하고, 어휘에 포함된 256개의 모든 바이트를 인코딩함으로써 [UNK] 토큰을 완전히 제거함을 입증하고자 한다.

제안 방법

  • 이 방법은 텍스트를 UTF-8 바이트 시퀀스로 먼저 변환한 후, BPE를 적용하여 서브워드 어휘를 구축하는 바이트 수준 BPE(BBPE)를 사용한다.
  • 어휘는 UTF-8 인코딩된 시퀀스 기반으로 구성되며, 모든 256개의 가능한 바이트가 포함되어 있어 [UNK] 토큰이 제거된다.
  • 특수 토큰(예: 후행 서브워드에 대한 '##')을 통한 명시적 서브워드 유형 모델링과, 선두, 후행, 전체 단어 서브워드를 구분하기 위한 학습 가능한 서브워드 유형 임베딩을 포함한다.
  • 모델 아키텍처는 NEZHA를 백본으로 사용하며, 14개 언어를 포함한 XNLI, MLQA, XNLI 다국어 NLU 벤치마크에서 미세조정된다.
  • 훈련 과정에는 자원이 적은 언어에 대한 데이터 밸런싱을 위해 업샘플링을 적용하고, 11개 및 14개 언어 설정에서의 평가를 통해 확장성 여부를 평가한다.
  • 비교 대상으로는 단어 경계 처리 여부, 서브워드 유형 임베딩 여부, 명시적 서브워드 유형 모델링 여부를 포함한 다양한 변형을 사용한다.

실험 결과

연구 질문

  • RQ1문자 수준 어휘에 비해 바이트 수준 서브워드 토크나이제이션이 희귀 서브워드 수를 줄이고 [UNK] 토큰을 제거하는가?
  • RQ2BBPE 기반 토크나이제이션은 다양한 언어, 특히 자원이 적은 언어에서 다국어 모델 성능에 어떤 영향을 미치는가?
  • RQ3명시적 서브워드 유형 모델링(예: '##' 접두사 또는 학습 가능한 임베딩)이 다운스트림 NLU 작업 정확도에 어떤 영향을 미치는가?
  • RQ4BBPE로 훈련된 모델의 성능은 다국어 벤치마크에서 mBERT와 일반적인 NEZHA에 비해 어떻게 비교되는가?

주요 결과

  • BBPE로 훈련된 NEZHA 모델은 XNLI 벤치마크에서 8개 언어 평균 1.6점 향상되어 구글의 다국어 BERT(77.1 vs. 75.5)를 능가했다.
  • 14개 언어 XNLI 작업에서 BBPE 모델은 일반적인 NEZHA보다 2.0점 향상된 성능(77.1 vs. 77.5)을 기록했으며, 독일어, 태국어, 중국어에서 뚜렷한 향상이 있었다.
  • BBPE 어휘는 14개 언어에서 빈도가 10,000 미만인 서브워드가 전혀 없었지만, mBERT 어휘는 약 30%의 서브워드가 빈도 100 미만이었다.
  • 단어 경계 처리(WBL)를 제거하면 평균 성능이 4.0점 감소(74.21 vs. 77.1)하여, 명시적 서브워드 구조 모델링이 핵심임을 시사한다.
  • BBPE 모델은 자원이 많은 언어(예: 영어, 러시아어)에서 중복 서브워드를 줄였고, 아랍어, 말레이어, 태국어와 같은 자원이 적은 언어의 토큰 커버리지 확대를 이룩했다.
  • 서브워드 유형 임베딩이 없는 변형(STE)도 WBL 전용 변형보다 성능이 뛰어나, 서브워드 유형의 명시적 모델링이 표현 학습을 향상시킨다는 것을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.