[논문 리뷰] Multilingual BERT Post-Pretraining Alignment
이 논문은 다국어 BERT의 다국어 간 전이 능력을 향상시키기 위해 후기 pretraining 정렬(PPA) 방법을 제안한다. 이 방법은 수정된 번역 언어 모델링(TLM) 목적함수를 통해 자기지도 학습 기반의 단어 수준 정렬을 실시하고, MoCo 기반의 대비 학습을 통해 문장 수준 정렬을 동시에 구현한다. 이 방법은 mBERT에 비해 XNLI의 제로샷 성능을 4.7% 향상시키며, XLM-R Base보다 57% 적은 파라미터를 사용하면서도 성능을 뛰어넘고, XLM의 병렬 데이터의 18% 미만을 사용한다.
We propose a simple method to align multilingual contextual embeddings as a post-pretraining step for improved zero-shot cross-lingual transferability of the pretrained models. Using parallel data, our method aligns embeddings on the word level through the recently proposed Translation Language Modeling objective as well as on the sentence level via contrastive learning and random input shuffling. We also perform sentence-level code-switching with English when finetuning on downstream tasks. On XNLI, our best model (initialized from mBERT) improves over mBERT by 4.7% in the zero-shot setting and achieves comparable result to XLM for translate-train while using less than 18% of the same parallel data and 31% less model parameters. On MLQA, our model outperforms XLM-R_Base that has 57% more parameters than ours.
연구 동기 및 목표
- 초기 학습 없이도 mBERT의 다국어 간 전이 능력을 향상시키기 위해.
- FastAlign과 같은 노이즈가 많은 단어 정렬 도구에 의존하는 후행 정렬 방법의 한계를 해결하기 위해.
- 최소한의 병렬 데이터를 사용하는 자기지도 학습 기반의 자원 효율적인 정렬 방법을 개발하기 위해.
- 다국어 NLP 작업의 제로샷 및 번역 학습 설정에서의 성능 향상을 위해.
- fine-tuning 중 코드 스위칭을 정렬 및 데이터 증강의 형태로 탐색하기 위해.
제안 방법
- 이 방법은 원본 및 대상 문장을 토큰 위치를 재설정하거나 언어 임베딩을 사용하지 않고 연결함으로써 수정된 TLM 목적함수를 통해 단어 수준 정렬을 수행한다.
- 문장 수준 정렬은 [CLS] 토큰을 대상으로 MoCo 기반의 대비 학습을 통해 달성되며, 모멘터미 엔코더와 음성 샘플의 큐를 사용한다.
- 모델은 병렬 문장 쌍에서 TLM 및 대비 학습 목적함수를 동시에 다중 작업 방식으로 학습한다.
- NLI 및 QA 작업의 fine-tuning 과정에서 영어와 대상 언어 간 문장 수준의 코드 스위칭을 적용하여 표현을 추가로 정렬한다.
- 사전에 학습된 단어 정렬 도구에 대한 의존도를 피함으로써 노이즈가 많은 정렬로 인한 오류 전파를 줄인다.
- 이 방법은 mBERT에 후기 pretraining 단계로 적용되어 원래 초기화를 유지하면서도 다국어 간 정렬을 정교화한다.
실험 결과
연구 질문
- RQ1자기지도 학습 기반의 단어 수준 및 문장 수준 정렬이 mBERT의 제로샷 다국어 간 전이 성능을 향상시킬 수 있는가?
- RQ2대비 학습과 수정된 TLM을 사용하면서도 최소한의 병렬 데이터를 활용하면 기존의 후행 정렬 방법보다 성능이 뛰어나게 되는가?
- RQ3fine-tuning 중 코드 스위칭이 추가적인 정렬 신호를 제공하고 모델 성능을 향상시키는가?
- RQ4성능 및 자원 효율성 측면에서 제안된 방법은 XLM 및 XLM-R과 어떻게 비교되는가?
- RQ5최신 기준 모델보다 훨씬 적은 파라미터와 병렬 데이터를 사용할 경우 성능이 유지되거나 향상되는가?
주요 결과
- XNLI 제로샷 벤치마크에서 제안된 모델은 mBERT의 성능을 4.7% 향상시켰다.
- 번역 학습 설정에서 XLM과 유사한 성능을 달성했으며, XLM의 병렬 데이터의 18% 미만과 31% 적은 파라미터를 사용했다.
- MLQA에서 제안된 모델는 파라미터 수가 57% 더 많은 XLM-R Base를 능가했다.
- 제거 실험을 통해 단어 수준 및 문장 수준 정렬 구성 요소가 성능 향상에 기여한다는 것이 확인되었다.
- fine-tuning 중 영어-대상 언어 간 코드 스위칭은 추가적인 정렬 신호를 제공하고 최종 성능을 향상시켰다.
- 이 방법은 자원 효율성이 뛰어나 최소한의 병렬 데이터와 축소된 모델 크기로 최신 기준 성능을 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.