Skip to main content
QUICK REVIEW

[논문 리뷰] Code-switching pre-training for neural machine translation

Zhen Yang, Bojie Hu|arXiv (Cornell University)|2020. 09. 17.
Natural Language Processing Techniques참고 문헌 34인용 수 4
한 줄 요약

이 논문은 신경 기계 번역(NMT)를 위한 새로운 사전 훈련 방법인 코드 스위칭 사전 훈련(CSP)을 제안한다. 이 방법은 비지도 단어 임베딩 매핑을 사용해 원본 언어의 단어를 목표 언어 번역어로 무작위로 교체함으로써 교차 언어 정렬을 향상시킨다. CSP는 지도 및 비지도 NMT 성능을 크게 향상시키며, 코드 스위칭 입력을 더 잘 처리할 수 있게 하고, 내부 테스트 세트에서 다국어 기반 모델 대비 +2.3 및 +3.0 BLEU 포인트의 성능 향상을 달성한다.

ABSTRACT

This paper proposes a new pre-training method, called Code-Switching Pre-training (CSP for short) for Neural Machine Translation (NMT). Unlike traditional pre-training method which randomly masks some fragments of the input sentence, the proposed CSP randomly replaces some words in the source sentence with their translation words in the target language. Specifically, we firstly perform lexicon induction with unsupervised word embedding mapping between the source and target languages, and then randomly replace some words in the input sentence with their translation words according to the extracted translation lexicons. CSP adopts the encoder-decoder framework: its encoder takes the code-mixed sentence as input, and its decoder predicts the replaced fragment of the input sentence. In this way, CSP is able to pre-train the NMT model by explicitly making the most of the cross-lingual alignment information extracted from the source and target monolingual corpus. Additionally, we relieve the pretrain-finetune discrepancy caused by the artificial symbols like [mask]. To verify the effectiveness of the proposed method, we conduct extensive experiments on unsupervised and supervised NMT. Experimental results show that CSP achieves significant improvements over baselines without pre-training or with other pre-training methods.

연구 동기 및 목표

  • 기존 사전 훈련 방법에서 인위적인 토큰([mask] 등)으로 인해 발생하는 사전 훈련-微조정 불일치 문제를 해결하기 위해.
  • 단일 언어 코퍼스로부터의 교차 언어 정렬 신호를 활용하여 NMT 사전 훈련을 향상시키기 위해.
  • 표준 NMT 모델 아키텍처와 크기를 유지하면서도 실무에 적용 가능한 사전 훈련 방법을 개발하기 위해.
  • 실세계 다국어 환경에서 흔한 코드 스위칭 입력에 대해 NMT 성능을 향상시키기 위해.
  • 추론 비용을 증가시키는 모델 융합 또는 대규모 사전 훈련 인코더에 대한 의존도를 줄이기 위해.

제안 방법

  • 원본 언어와 목표 언어 간의 비지도 단어 임베딩 매핑을 수행하여 双어어휘를 유도하기 위해.
  • 유도된 어휘에서 원본 문장의 단어들을 무작위로 그 목표 언어 번역어로 교체하여 코드 혼합 입력을 생성하기 위해.
  • 인코더가 코드 혼합 문장을 처리하고 디코더가 원본 원본 언어 단어를 예측하도록 인코더-디코더 모델을 훈련하기 위해.
  • 교체된 조각들에 대해 마스크된 언어 모델링 목적함수를 사용하여, 모델이 문장 수준 표현과 교차 언어 정렬을 동시에 학습할 수 있도록 하기 위해.
  • 병렬 데이터가 필요 없이 단일 언어 원본 및 목표 언어 코퍼스에서 이 목적함수를 사용해 NMT 모델을 사전 훈련하기 위해.
  • 백트랜슬레이션 유무에 관계없이 표준 NMT 작업에서 사전 훈련된 모델을 미세조정하기 위해.

실험 결과

연구 질문

  • RQ1비지도 단일 언어 데이터에서 유도된 교차 언어 단어 쌍 정렬을 명시적으로 활용함으로써 코드 스위칭 사전 훈련이 NMT 성능 향상에 기여할 수 있는가?
  • RQ2CSP는 [mask]와 같은 인위적 토큰을 사용하는 방법과 비교해 사전 훈련-미세조정 불일치를 줄일 수 있는가?
  • RQ3사전 훈련된 NMT 모델은 표준 모델이나 다국어 모델보다 코드 스위칭 입력을 더 효과적으로 처리할 수 있는가?
  • RQ4NMT 모델의 어떤 구성 요소가 CSP 사전 훈련에서 가장 큰 이점을 얻는가?
  • RQ5CSP는 지도 및 비지도 번역 설정 모두에서 기존 사전 훈련 방법과 비교해 어떻게 성능을 냈는가?

주요 결과

  • CSP는 영어-독어 번역 작업에서 28.9 BLEU 점수를 기록하여 사전 훈련 없이 기준 모델(28.4)과 다른 사전 훈련 방법보다 뛰어나다.
  • 영어-프랑스어 번역에서 CSP는 38.8 BLEU에 도달하여 기준 모델(38.5)과 다른 사전 훈련 기반 모델을 초월한다.
  • 내부 코드 스위칭 테스트 세트에서 CSP는 테스트 A와 테스트 B에서 각각 다국어 기반 모델 대비 +2.3 및 +3.0 BLEU 포인트 향상되었다.
  • 절단 실험 결과, 사전 훈련된 인코더와 어텐션 모듈이 가장 중요한 구성 요소임을 확인하였고, 사전 훈련-미세조정 불일치로 인해 사전 훈련된 디코더는 최소한의 영향을 미쳤다.
  • 이 방법은 코드 스위칭 입력을 효과적으로 처리하며, 실세계 사용에서 흔히 나타나는 혼합 언어 입력 패턴에 대해 뛰어난 내성성을 보였다.
  • CSP는 모델 구조와 크기를 유지하므로, 모델 융합이나 추가 추론 오버헤드 없이 실무에 바로 적용 가능한 상태를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.