Skip to main content
QUICK REVIEW

[논문 리뷰] Exploiting Out-of-Domain Parallel Data through Multilingual Transfer Learning for Low-Resource Neural Machine Translation

Aizhan Imankulova, Raj Dabre|arXiv (Cornell University)|2019. 07. 06.
Natural Language Processing Techniques참고 문헌 26인용 수 18
한 줄 요약

이 논문은 저자원 일본어-러시아어 신경 기계 번역을 향상시키기 위해 도메인 외 병렬 데이터를 활용하는 다국어 다단계 미세조정 방법을 제안한다. 먼저 다양한 도메인 외 데이터로 다국어 모델을 사전 훈련한 후, 도메인 내 병렬 데이터와 역번역된 데이터로 미세조정함으로써, 극도로 저자원 환경에서 강력한 베이스라인 대비 +3.7 BLEU 향상을 달성한다.

ABSTRACT

This paper proposes a novel multilingual multistage fine-tuning approach for low-resource neural machine translation (NMT), taking a challenging Japanese--Russian pair for benchmarking. Although there are many solutions for low-resource scenarios, such as multilingual NMT and back-translation, we have empirically confirmed their limited success when restricted to in-domain data. We therefore propose to exploit out-of-domain data through transfer learning, by using it to first train a multilingual NMT model followed by multistage fine-tuning on in-domain parallel and back-translated pseudo-parallel data. Our approach, which combines domain adaptation, multilingualism, and back-translation, helps improve the translation quality by more than 3.7 BLEU points, over a strong baseline, for this extremely low-resource scenario.

연구 동기 및 목표

  • 저자원 신경 기계 번역의 지속적인 과제, 특히 일본어-러시아어와 같은 저자원 번역 쌍에 대해 해결하고자 한다.
  • 도메인 내 데이터가 부족한 저자원 NMT 환경에서 도메인 외 병렬 데이터를 효과적으로 활용할 수 있는지 조사하고자 한다.
  • 다국어 사전 훈련, 도메인 적응, 역번역을 다단계 미세조정 프레임워크에 통합하여 번역 품질을 향상시키고자 한다.
  • 다양하고 도메인 외의 데이터에서의 전이 학습이 극도로 저자원 환경에서 성능을 크게 향상시킬 수 있음을 입증하고자 한다.

제안 방법

  • 다양한 언어에서 대규모 도메인 외 병렬 데이터로 다국어 NMT 모델을 사전 훈련한다.
  • 일본어-러시아어 번역 작업에 특화된 도메인 내 병렬 단일 언어 데이터로 다국어 모델을 미세조정한다.
  • 목표 언어의 도메인 내 단일 언어 문장을 기반으로 역번역을 통해 가짜 병렬 단일 언어 데이터를 생성한다.
  • 도메인 내 병렬 데이터로 모델을 순차적으로 적응시킨 후, 가짜 병렬 데이터로의 적응을 이어가며 다단계 미세조정을 수행한다.
  • 모든 훈련 과정에서 다국어 간 전이 능력을 유지하기 위해 공유된 다국어 인코더-디코더 아키텍처를 사용한다.

실험 결과

연구 질문

  • RQ1도메인 내 데이터가 극도로 제한된 상황에서 도메인 외 병렬 데이터가 저자원 신경 기계 번역에 도움이 될 수 있는가?
  • RQ2다국어 사전 훈련과 도메인 특화 미세조정을 조합했을 때 저자원 환경에서 번역 품질에 어떤 영향을 미치는가?
  • RQ3다국어 다단계 미세조정 파이프라인에 통합된 역번역의 기여도는 어떠한가?
  • RQ4제안된 방법이 도메인 내 데이터에만 의존하거나 표준 다국어 NMT에 의존하는 강력한 베이스라인을 초월하는가?

주요 결과

  • 제안된 방법은 저자원 일본어-러시아어 번역 작업에서 강력한 베이스라인 대비 +3.7 BLEU 포인트 향상을 달성한다.
  • 도메인 외 병렬 데이터의 사용은 데이터가 목표 도메인과 직접 일치하지 않더라도 모델 성능을 크게 향상시킨다.
  • 도메인 내 병렬 데이터와 역번역된 가짜 병렬 데이터로의 다단계 미세조정은 단일 단계의 미세조정보다 더 나은 도메인 적응을 이끈다.
  • 다국어성, 도메인 적응, 역번역의 조합은 저자원 환경에서 표준 접근 방식에 비해 열등한 성능을 내지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.