Skip to main content
QUICK REVIEW

[논문 리뷰] The Effect of Domain and Diacritics in Yorùbá-English Neural Machine Translation

David Ifeoluwa Adelani, Dana Ruiter|arXiv (Cornell University)|2021. 03. 15.
Natural Language Processing Techniques참고 문헌 39인용 수 6
한 줄 요약

이 논문은 표준화된 훈련-검증-테스트 분할을 갖춘 고품질의 다중 도메인 영어–요르바 문장 대조 어휘인 MENYO-20k를 소개하고, 신경 기계 번역(NMT)에 미치는 영향을 평가한다. 적절한 음절 표기와 도메인 특화 데이터를 통합함으로써, 저자들은 Google 및 Facebook의 M2M와 같은 거대한 다국어 모델보다 각각 +8.7 및 +9.1 BLEU 점수로 요르바어–영어 번역에서 피지컬 튜닝 모델이 뛰어난 성능을 보임을 입증한다.

ABSTRACT

Massively multilingual machine translation (MT) has shown impressive capabilities, including zero and few-shot translation between low-resource language pairs. However, these models are often evaluated on high-resource languages with the assumption that they generalize to low-resource ones. The difficulty of evaluating MT models on low-resource pairs is often due to lack of standardized evaluation datasets. In this paper, we present MENYO-20k, the first multi-domain parallel corpus with a special focus on clean orthography for Yorùbá--English with standardized train-test splits for benchmarking. We provide several neural MT benchmarks and compare them to the performance of popular pre-trained (massively multilingual) MT models both for the heterogeneous test set and its subdomains. Since these pre-trained models use huge amounts of data with uncertain quality, we also analyze the effect of diacritics, a major characteristic of Yorùbá, in the training data. We investigate how and when this training condition affects the final quality and intelligibility of a translation. Our models outperform massively multilingual models such as Google ($+8.7$ BLEU) and Facebook M2M ($+9.1$ BLEU) when translating to Yorùbá, setting a high quality benchmark for future research.

연구 동기 및 목표

  • 저자원 요르바어–영어 기계 번역을 위한 표준화되고 고품질의 대조 어휘 자료의 부족을 해결하기 위해.
  • 훈련 데이터의 도메인 다양성과 음절 표기 정확도가 번역 품질에 미치는 영향을 조사하기 위해.
  • 정제된 다중 도메인 데이터셋을 사용하여 요르바어–영어 신경 기계 번역의 벤치마크를 수립하기 위해.
  • 감독 학습, 준감독 학습 및 피지컬 튜닝 모델의 성능을 저자원 요르바어–영어 번역에서 평가하기 위해.
  • 음절 표기가 번역 품질에 미치는 영향, 특히 en–yo 방향에서의 영향을 분석하고, 음절 복원의 이점을 평가하기 위해.

제안 방법

  • 전문 번역가들이 정제한 영어–요르바어 대조 어휘로 구성된 20,000개 문장의 다중 도메인 어휘인 MENYO-20k를 구축하였다.
  • 요르바어–영어 NMT를 위한 재현 가능한 벤치마킹을 가능하게 하기 위해 표준화된 훈련-개발-테스트 분할을 정의하였다.
  • MENYO-20k와 JW300, 성경 데이터셋을 결합하여 감독 학습, 준감독 학습 및 피지컬 튜닝 NMT 모델을 훈련시켰다.
  • 자동 평가 지표(BLEU)와 인간 평가를 통해 유창성과 이해 가능성 여부를 평가하였다.
  • Google의 MNMT 및 Facebook의 M2M-100과 같은 거대한 다국어 모델과의 성능을 비교하였다.
  • 음절 표기의 영향을 분석하기 위해 음절 표기 풍부한 데이터와 음절 표기가 부족한 데이터 버전을 모두 사용하여 모델을 훈련시켰다.
Figure 1: Top: Perplexities of KenLM 5-gram language model learned on different training corpora and tested on subsets of MENYO-20k for English (left) and Yorùbá (right) respectively. Bottom: Vocabulary coverage (%) of different subsets of the MENYO-20k test set per training sets for English (left)
Figure 1: Top: Perplexities of KenLM 5-gram language model learned on different training corpora and tested on subsets of MENYO-20k for English (left) and Yorùbá (right) respectively. Bottom: Vocabulary coverage (%) of different subsets of the MENYO-20k test set per training sets for English (left)

실험 결과

연구 질문

  • RQ1훈련 데이터의 도메인 다양성이 저자원 요르바어–영어 번역에서 NMT 모델의 일반화 능력에 어떤 영향을 미치는가?
  • RQ2훈련 데이터의 정확한 음절 표기 수준이 번역 품질 향상에 얼마나 기여하는가, 특히 en–yo 방향에서의 영향은 어떠한가?
  • RQ3MENYO-20k를 기반으로 한 피지컬 튜닝 모델이 요르바어–영어 번역에서 Google의 MNMT 및 Facebook의 M2M 모델보다 뛰어난 성능을 보일 수 있는가?
  • RQ4훈련 데이터에 음절 표기가 포함되어 있을 경우 인간 평가에서 유창성과 이해 가능성에 어떤 영향을 미치는가?
  • RQ5음절 표기가 일관되지 않은 상황에서 훈련 데이터와 테스트 데이터 간의 도메인 불일치가 번역 품질에 어떤 영향을 미치는가?

주요 결과

  • MENYO-20k를 기반으로 한 피지컬 튜닝 모델은 요르바어–영어 번역에서 Google의 다국어 모델보다 +8.7 BLEU, Facebook의 M2M 모델보다 +9.1 BLEU 점수로 뛰어난 성능을 보였다.
  • 인간 평가 결과, 낮은 품질의 음절 표기 없이 훈련된 데이터(예: Google MNMT)로 훈련된 모델은 이해 가능했지만, 유창성이 떨어지는 것으로 나타났다.
  • 훈련 데이터의 정확한 음절 표기 처리가 en–yo 번역 방향에서 번역 품질 향상에 크게 기여했으며, 특히 도메인 불일치 상황에서 두드러진 효과를 보였다.
  • 단지 10,000개의 대조 문장만으로도 MENYO-20k에 JW300 및 성경 데이터셋을 결합하여 모든 도메인에서 번역 성능 향상을 달성했다.
  • 본 연구는 저자원 환경에서 높은 품질의 언어 특화 데이터셋이 음절 표기 정확도를 확보할 경우, 다량의 노이즈가 포함된 다국어 어휘 자료보다 뛰어난 성능을 낼 수 있음을 입증했다.
  • 자동 음절 복원 기술이 훈련 데이터에서 노이즈 또는 누락된 음절 표기의 악영향을 완화하는 데 유용함을 입증했다.
The Effect of Domain and Diacritics in Yorùbá-English Neural Machine Translation

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.