Skip to main content
QUICK REVIEW

[논문 리뷰] DICT-MLM: Improved Multilingual Pre-Training using Bilingual Dictionaries

Aditi Chaudhary, Karthik Raman|arXiv (Cornell University)|2020. 10. 23.
Topic Modeling참고 문헌 21인용 수 17
한 줄 요약

이 논문은 BERT 기반 모델이 원본 언어의 마스킹된 토큰뿐만 아니라 이중어 사전을 사용해 교차 언어적 동의어를 예측하도록 훈련시켜 다국어 표현 학습을 향상시키는 다국어 사전 토큰 예측 다국어 사전 훈련(DICT-MLM)을 제안한다. 이 방법은 병렬 문장 데이터와 같은 고비용 자료에 의존하지 않고도 제로샷 다국어 전이 작업에서 최신 기술 수준의 성능을 달성하며, PAWS-X에서 최대 +5.3의 정확도 향상과 다국어 문장 검색 작업에서 20% 이상의 향상을 기록한다.

ABSTRACT

Pre-trained multilingual language models such as mBERT have shown immense gains for several natural language processing (NLP) tasks, especially in the zero-shot cross-lingual setting. Most, if not all, of these pre-trained models rely on the masked-language modeling (MLM) objective as the key language learning objective. The principle behind these approaches is that predicting the masked words with the help of the surrounding text helps learn potent contextualized representations. Despite the strong representation learning capability enabled by MLM, we demonstrate an inherent limitation of MLM for multilingual representation learning. In particular, by requiring the model to predict the language-specific token, the MLM objective disincentivizes learning a language-agnostic representation -- which is a key goal of multilingual pre-training. Therefore to encourage better cross-lingual representation learning we propose the DICT-MLM method. DICT-MLM works by incentivizing the model to be able to predict not just the original masked word, but potentially any of its cross-lingual synonyms as well. Our empirical analysis on multiple downstream tasks spanning 30+ languages, demonstrates the efficacy of the proposed approach and its ability to learn better multilingual representations.

연구 동기 및 목표

  • 표준 마스킹된 언어 모델링(MLM)이 언어 간에 중립적인 표현을 학습하는 데에 한계가 있음을 해결하기 위해 교차 언어적 동의어 예측을 장려함으로써 표현 학습을 향상시키는 것.
  • 고비용 병렬 문장 데이터에 의존하지 않고 제로샷 설정에서의 다국어 전이 성능을 향상시키는 것.
  • 기존의 병렬 데이터를 사용하는 방법과 비교해 저자원 다국어 사전이 다국어 표현 학습에 상당한 기여를 할 수 있음을 입증하는 것.
  • 공개된 이중어 사전이 없는 언어들 역시 제안된 사전 훈련 방법에서 유의미한 이점을 얻는지 조사하는 것.
  • 언어 조건화 레이어와 같은 아키텍처 수정 사항이 다국어 간 일치도를 향상시키는 데 얼마나 기여하는지 평가하는 것.

제안 방법

  • DICT-MLM는 표준 MLM을 확장하여 마스킹된 토큰의 다국어 동의어 중 하나를 예측할 수 있도록 허용하며, 원본 단어 외의 동의어도 허용한다.
  • 사전 훈련 중 마스킹된 토큰은 이중어 사전에서 제공하는 다국어 동의어로 대체되어 동일한 맥락에 대해 다양한 훈련 예제를 생성한다.
  • Transformer 인코더 이후 언어 조건화 밀도 레이어를 추가하여 목표 언어에 따라 조건화함으로써 교차 언어적 동의어 예측 성능을 향상시킨다.
  • 입력 레이어를 수정하여 언어 임베딩을 포함시켜 훈련 중에 명시적인 언어 신호를 제공한다.
  • 모델는 대규모 병렬 문장 데이터가 아닌 이중어 사전에서 유래한 수천 개의 교차 언어적 단어 쌍만을 사용한다.
  • 모델는 40개의 언어 유형이 다양하게 분포된 단일 언어 코퍼스에서부터 새로 훈련되며, 동의어 교체를 통한 데이터 증강 기법이 적용된다.

실험 결과

연구 질문

  • RQ1교차 언어적 동의어 예측을 장려하는 사전 훈련 목표가 표준 MLM을 초월해 다국어 표현 학습을 향상시킬 수 있는가?
  • RQ2고비용 병렬 문장 데이터 대신 이중어 사전만을 사용하는 것이 다국어 전이 작업에서 경쟁력 있거나 더 뛰어난 성능을 낼 수 있는가?
  • RQ3언어 조건화 레이커와 같은 아키텍처 수정 사항이 모델의 다국어 간 일반화 능력을 얼마나 향상시키는가?
  • RQ4공개된 이중어 사전이 없는 언어들 역시 DICT-MLM 사전 훈련에서 유의미한 이점을 얻는가?
  • RQ5다양한 NLP 작업에서 DICT-MLM이 mBERT 및 기타 최신 기술 수준의 모델과 비교해 제로샷 다국어 전이 성능에서 얼마나 뛰어나게 되는가?

주요 결과

  • DICT-MLM은 평가된 모든 작업에서 mBERT를 능가하며, NER에서 +2.4 F1 향상과 모든 언어에서 POS에서 +3.7 정확도 향상을 기록한다.
  • XNLI에서 +0.5 정확도 향상과 MLDOC-Headline에서 +2.5 정확도 향상으로 강력한 제로샷 일반화 능력을 입증한다.
  • TAOBAE 교차 언어 문장 검색 벤치마크에서 20% 이상의 향상률을 기록하여 교차 언어 간 일치도가 뛰어나다는 것을 시사한다.
  • PAWS-X에서는 +5.3 정확도 향상으로 문장 수준의 의미 유사성 작업에서 뛰어난 효과를 입증한다.
  • 공개된 이중어 사전이 없는 언어들 역시 DICT-MLM 사전 훈련에서 유의미한 이점을 얻는 것으로 나타나, 저자원 언어에 대한 광범위한 적용 가능성을 시사한다.
  • 제거 실험 결과 언어 조건화 레이어는 NER에서 특히 유익한 것으로 나타났고, 반면 POS와 PAWS-X에서는 제거 시 약간의 성능 향상이 관찰되어 작업에 따라 효과가 다름을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.