Skip to main content
QUICK REVIEW

[논문 리뷰] Facebook FAIR's WMT19 News Translation Task Submission

Peng‐Jen Chen, Ann Lee|arXiv (Cornell University)|2019. 07. 15.
Topic Modeling참고 문헌 50인용 수 13
한 줄 요약

Facebook FAIR는 WMT19 뉴스 번역 과제에 제출하여 저자원 히타루-영어 및 이누크티투트-영어 쌍에 초점을 맞췄다. 이 접근법은 다국어 사전 훈련, 데이터 증강, 도메인 적응을 위한 도메인 내 미세조정, 그리고 재정렬을 조합하여 21.5 BLEU(Ta→En)와 27.9 BLEU(Iu→En)를 달성했으며, 병렬 및 단일 언어 데이터가 제한된 상황에서도 뛰어난 성능을 보였다.

ABSTRACT

This paper describes Facebook AI's submission to WMT20 shared news translation task. We focus on the low resource setting and participate in two language pairs, Tamil English and Inuktitut English, where there are limited out-of-domain bitext and monolingual data. We approach the low resource problem using two main strategies, leveraging all available data and adapting the system to the target news domain. We explore techniques that leverage bitext and monolingual data from all languages, such as self-supervised model pretraining, multilingual models, data augmentation, and reranking. To better adapt the translation system to the test domain, we explore dataset tagging and fine-tuning on in-domain data. We observe that different techniques provide varied improvements based on the available data of the language pair. Based on the finding, we integrate these techniques into one training pipeline. For En->Ta, we explore an unconstrained setup with additional Tamil bitext and monolingual data and show that further improvement can be obtained. On the test set, our best submitted systems achieve 21.5 and 13.7 BLEU for Ta->En and En->Ta respectively, and 27.9 and 13.0 for Iu->En and En->Iu respectively.

연구 동기 및 목표

  • 희귀 언어인 히타루 및 이누크티투트와 같은 저자원 환경에서 신경 기계 번역 성능을 향상시키기 위해.
  • 고도화된 데이터 및 모델 적응 기법을 통해 제한된 도메인 외 비트렉스트 및 단일 언어 데이터를 효과적으로 활용하기 위해.
  • 도메인 내 미세조정 및 데이터셋 태깅을 통해 번역 시스템을 뉴스 도메인에 적응시키기 위해.
  • 다양한 기법을 통합된 훈련 파이프라인으로 통합하여 저자원 언어 쌍에서 최고의 성능을 내기 위해.

제안 방법

  • 다국어 단일 언어 데이터를 기반으로 한 자기지도 사전 훈련을 통해 표현 학습을 향상시켰다.
  • 다국어 시퀀스-투-시퀀스 모델을 적용하여 관련 언어 간 지식을 공유했다.
  • 효율적인 훈련 데이터 크기를 늘리기 위해 데이터 증강 기법을 활용했다.
  • 데이터셋 태깅과 도메인 내 미세조정을 통해 모델을 뉴스 도메인에 적응시켰다.
  • 디코딩 후 번역 품질을 향상시키기 위해 재정렬을 구현했다.
  • 모든 기법을 저자원 환경에 최적화된 단일 훈련 파이프라인으로 통합했다.

실험 결과

연구 질문

  • RQ1다국어 및 자기지도 사전 훈련은 저자원 환경에서 번역 품질에 어떻게 기여하는가?
  • RQ2도메인 내 미세조정은 뉴스 텍스트 번역 성능에 어떤 영향을 미치는가?
  • RQ3데이터 증강과 재정렬은 저자원 번역에서 얼마나 효과적인가?
  • RQ4다양한 데이터 가용성 수준을 가진 언어 쌍에서 다양한 기법의 성능는 어떻게 비교되는가?

주요 결과

  • 최고의 시스템은 히타루-영어 번역 과제에서 21.5 BLEU를 기록하여 제한된 데이터 상황에서도 뛰어난 성능을 보였다.
  • 영어-히타루 번역에서 시스템은 13.7 BLEU를 기록했으며, 저자원 조건에서의 효과성을 입증했다.
  • 이누크티투트-영어 쌍에서 최고의 시스템은 27.9 BLEU를 달성하여 매우 저자원 언어에 대한 강력한 적응 능력을 보였다.
  • 영어-이누크티투트 번역에서 시스템은 13.0 BLEU를 기록했으며, 도메인 특화 적응의 효과를 입증했다.
  • 추가적인 히타루 비트렉스트 및 단일 언어 데이터는 제약 없는 설정에서 성능 향상에 기여했으며, 데이터 확장 가능성의 확인을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.