Skip to main content
QUICK REVIEW

[논문 리뷰] Marathi To English Neural Machine Translation With Near Perfect Corpus And Transformers

Swapnil Ashok Jadhav|arXiv (Cornell University)|2020. 02. 26.
Natural Language Processing Techniques참고 문헌 18인용 수 10
한 줄 요약

이 논문은 트랜스포머 아키텍처와 거의 완벽한 병렬 코퍼스를 사용하여 마라티어에서 영어로의 신경 기계 번역 시스템을 제시한다. 이는 페이스북의 Fairseq를 통해 훈련되고 허깅패쓰의 BERT 토크나이저를 사용한다. Tatoeba 및 위키백과 데이터셋에서 구글보다 높은 BLEU 점수를 기록하여, 훈련 데이터가 제한된 저자원 인도 언어에 대해 최신 기술 수준의 성능을 보여준다.

ABSTRACT

There have been very few attempts to benchmark performances of state-of-the-art algorithms for Neural Machine Translation task on Indian Languages. Google, Bing, Facebook and Yandex are some of the very few companies which have built translation systems for few of the Indian Languages. Among them, translation results from Google are supposed to be better, based on general inspection. Bing-Translator do not even support Marathi language which has around 95 million speakers and ranks 15th in the world in terms of combined primary and secondary speakers. In this exercise, we trained and compared variety of Neural Machine Marathi to English Translators trained with BERT-tokenizer by huggingface and various Transformer based architectures using Facebook's Fairseq platform with limited but almost correct parallel corpus to achieve better BLEU scores than Google on Tatoeba and Wikimedia open datasets.

연구 동기 및 목표

  • 저자원 인도 언어를 위한 고정확도 마라티어에서 영어로의 신경 기계 번역 시스템 개발.
  • 마라티어에 대해 제한된 양이지만 매우 정확한 병렬 코퍼스에서 최신 기술 수준의 트랜스포머 기반 아키텍처 평가.
  • 공개 벤치마크 데이터셋을 사용하여 구글 번역과 같은 상용 시스템과의 성능 비교.
  • 거의 완벽한 병렬 코퍼스가 제한된 데이터 조건에서도 번역 품질을 크게 향상시킬 수 있음을 입증.
  • 약 9500만 명의 어휘를 가진 마라티어어에 대해 상용 지원이 제한적인 재현 가능하고 오픈소스 NMT 시스템 기여.

제안 방법

  • 제한된 양이지만 매우 정확한 병렬 코퍼스를 기반으로 페이스북의 Fairseq 프레임워크를 사용해 여러 트랜스포머 기반 아키텍처 훈련.
  • 입력 시퀀스의 토크나이징을 허깅패쓰의 BERT 토크나이저를 사용하여 서브워드 표현 및 OOV 처리 향상.
  • 과적합 방지를 위해 하이퍼파라미터 튜닝 및 조기 정지 기법을 통한 모델 최적화.
  • Tatoeba 및 위키백과의 공개 테스트 세트에서 BLEU 점수를 사용해 모델 성능 평가.
  • 노이즈를 최소화하고 정렬 품질을 향상시키기 위해 정제된 거의 완벽한 병렬 코퍼스 사용.
  • 다양한 트랜스포머 변종 비교를 통해 마라티어에서 영어로의 번역에 가장 우수한 성능을 보이는 아키텍처 식별.

실험 결과

연구 질문

  • RQ1제한된 크기에도 불구하고 거의 완벽한 병렬 코퍼스가 마라티어에서 영어로의 NMT 성능을 크게 향상시킬 수 있는가?
  • RQ2트랜스포머 기반 아키텍처가 저자원 마라티어에서 영어로의 번역에서 다른 신경 아키텍처보다 우월한가?
  • RQ3맞춤형으로 훈련된 모델이 공개 벤치마크 데이터셋에서 구글 번역과 같은 상용 시스템을 능가할 수 있는가?
  • RQ4BERT 토크나이징이 저자원 환경에서 번역 품질에 어떤 영향을 미치는가?
  • RQ5최소한의 병렬 데이터로 마라티어에서 영어로의 번역에 가장 최적의 트랜스포머 아키텍처는 무엇인가?

주요 결과

  • 제안된 모델은 Tatoeba 및 위키백과 공개 데이터셋에서 모두 구글 번역보다 높은 BLEU 점수를 기록했다.
  • 거의 완벽한 병렬 코퍼스의 사용으로 인해 훈련 데이터의 크기가 제한된 상태에서도 성능 향상이 두드러졌다.
  • Fairseq로 미세조정한 트랜스포머 기반 아키텍처와 BERT 토크나이징을 적용한 시스템이 평가에서 다른 신경 아키텍처를 능가했다.
  • 고품질의 정제된 병렬 데이터가 저자원 언어 쌍에서 데이터 부족 문제를 상쇄할 수 있음을 시스템이 입증했다.
  • 기존 상용 시스템의 성능을 뛰어넘는 성능을 보이며 저자원 NLP 응용 분야의 잠재력을 보여주었다.
  • 결과는 정제된 데이터와 현대적 트랜스포머 아키텍처의 조합이 인도어 번역에 효과적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.