Skip to main content
QUICK REVIEW

[논문 리뷰] Universal Conditional Masked Language Pre-training for Neural Machine Translation

Pengfei Li, Liangyou Li|arXiv (Cornell University)|2022. 03. 17.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 대규모 단어어 및 双어어 문장집합에서 조건부 마스킹 언어 모델링을 사용하여 이원방향 디코더를 갖춘 다국어 시퀀스-투-시퀀스 모델인 CeMAT을 제안한다. 이는 교차 언어 표현 학습을 향상시키기 위해 두 가지 새로운 마스킹 전략—일치하는 코드 스위칭 및 마스킹, 동적 双중 마스킹—을 도입한다. 이로 인해 자동회귀 NMT에서 저자원 설정에서 최대 +14.4 BLEU, 평균적으로 +7.9 BLEU의 최신 기술 성능 향상을 달성하였으며, 비자동회귀 NMT에서는 최대 +5.3 BLEU의 성능 향상을 보였다.

ABSTRACT

Pre-trained sequence-to-sequence models have significantly improved Neural Machine Translation (NMT). Different from prior works where pre-trained models usually adopt an unidirectional decoder, this paper demonstrates that pre-training a sequence-to-sequence model but with a bidirectional decoder can produce notable performance gains for both Autoregressive and Non-autoregressive NMT. Specifically, we propose CeMAT, a conditional masked language model pre-trained on large-scale bilingual and monolingual corpora in many languages. We also introduce two simple but effective methods to enhance the CeMAT, aligned code-switching & masking and dynamic dual-masking. We conduct extensive experiments and show that our CeMAT can achieve significant performance improvement for all scenarios from low- to extremely high-resource languages, i.e., up to +14.4 BLEU on low resource and +7.9 BLEU improvements on average for Autoregressive NMT. For Non-autoregressive NMT, we demonstrate it can also produce consistent performance gains, i.e., up to +5.3 BLEU. To the best of our knowledge, this is the first work to pre-train a unified model for fine-tuning on both NMT tasks. Code, data, and pre-trained models are available at https://github.com/huawei-noah/Pretrained-Language-Model/tree/master/CeMAT.

연구 동기 및 목표

  • 자기방향 디코더에 의존하는 것보다, 이원방향 디코더를 갖춘 통합 시퀀스-투-시퀀스 모델을 사전학습하여 신경 기계 번역(NMT) 성능을 향상시키는 것.
  • 비자동회귀 NMT(NAT)에서의 성능 격차를 해소하기 위해 표현 능력을 더 잘 포착하는 사전학습 초기화를 제공하는 것.
  • 언어 간 의미를 일치시키는 새로운 마스킹 전략을 통해 교차 언어 및 내부 언어 표현 학습을 향상시키는 것.
  • 자동회귀 및 비자동회귀 NMT 작업을 위한 사전학습을 통합하여 별도의 모델 초기화가 필요 없도록 하는 것.
  • 조건부 마스킹로 사전학습된 이원방향 디코더가 자동회귀 및 비자동회귀 모두에서 표준 자기방향 디코더보다 생성 및 표현 학습 성능에서 뛰어나지 못할지 조사하는 것.

제안 방법

  • 이원방향 인코더, 이원방향 디코더, 그리고 이들을 연결하는 크로스 어텐션 모듈을 갖춘 다국어 시퀀스-투-시퀀스 모델인 CeMAT을 제안한다.
  • 단어어 데이터에서 언어 모델링(MLM)과 이중어 데이터에서 조건부 마스킹 언어 모델링(CMLM)을 사용하여 모델을 사전학습한다.
  • 일치하는 코드 스위칭 및 마스킹을 도입한다: 소스 단어를 그 대응 번역어와 일치시킨 후, 소스 단어를 다른 언어의 의미적으로 유사한 단어로 대체하고, 해당 대응하는 목표 단어는 마스킹한다.
  • 동적 이중 마스킹을 적용하여 학습 중에 적응하는 동적 마스킹 전략을 사용해 소스 및 목표 언어의 나머지 단어를 마스킹한다.
  • 다양한 언어에서 대규모 단어어 및 이중어 문장집합을 사용하여 통합 프레임워크 내에서 모델을 사전학습한다.
  • 재초기화 없이도 사전학습된 CeMAT 모델을 직접 자동회귀 및 비자동회귀 NMT 작업에 피지테이닝한다.

실험 결과

연구 질문

  • RQ1사전학습된 시퀀스-투-시퀀스 모델에서 이원방향 디코더가 자동회귀 및 비자동회귀 NMT 모두에서 자기방향 디코더를 능가할 수 있는가?
  • RQ2조건부 마스킹로 통합된 모델을 사전학습하면 교차 언어 표현 학습과 저자원 및 고자원 언어 쌍 간의 일반화 능력 향상에 기여하는가?
  • RQ3일치하는 코드 스위칭 및 마스킹이 사전학습 과정에서 언어 간 의미 표현을 효과적으로 일치시킬 수 있는가?
  • RQ4동적 이중 마스킹이 디코더의 소스 측 컨텍스트에 대한 주의를 기울이고 생성 품질을 향상시키는 데 기여하는가?
  • RQ5단일 사전학습 모델이 별도의 작업별 재초기화 없이도 자동회귀 및 비자동회귀 NMT 모두에 효과적인 초기화로 기능할 수 있는가?

주요 결과

  • CeMAT은 저자원 NMT 설정(100만 개 이하 비텍스트 쌍)에서 기준 모델 대비 최대 +14.4 BLEU 포인트의 성능 향상을 달성하였다.
  • 자동회귀 NMT에서, CeMAT은 여러 언어 쌍에 걸쳐 평균적으로 최대 +7.9 BLEU의 성능 향상을 보였으며, 고자원 설정(2500만 개 이상 비텍스트 쌍)에서도 동일하게 유의미한 향상이 있었다.
  • 비자동회귀 NMT에서는 최대 +5.3 BLEU의 일관된 성능 향상을 기록하여 병렬 복제 환경에서의 효과성을 입증하였다.
  • NAT에서 반복 보정 과정에서 더 빠르고 안정적인 수렴을 보였으며, 정점 성능에 도달하기 위해 단지 3~6회의 반복만으로도 충분했다.
  • 백역역 번역을 통해 WMT16 루마니아어-영어 작업에서 추가로 +2.1 BLEU의 성능 향상을 기록하여 데이터 증강 기법과의 호환성을 입증하였다.
  • CeMAT은 자동회귀 및 비자동회귀 NMT 모두에 적합한 통합 사전학습 모델로, 별도의 초기화 전략이 필요 없음을 처음으로 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.