Skip to main content
QUICK REVIEW

[논문 리뷰] Lesan -- Machine Translation for Low Resource Languages

Asmelash Teka Hadgu, Abel Aregawi|arXiv (Cornell University)|2021. 12. 15.
Natural Language Processing Techniques인용 수 5
한 줄 요약

Lesan은 Tigrinya어 및 아مهر라어와 같이 언어적으로 소외된 언어를 위한 저자원 기계 번역 시스템을 제안한다. 이는 오프라인 및 온라인 다국어 자료를 활용하고, 에티오피아 문자를 위한 맞춤형 OCR, 그리고 자동 문장 정렬을 통해 병렬 코퍼스를 구축한다. 병렬 데이터가 제한된 상황에서도 복수의 언어 쌍에서 인간 평가에서 Google 번역, 마이크로소프트 번역, 야ндекс 번역을 능가하는 성능을 보이며, 1,000만 건 이상의 번역을 제공함으로써 최신 기술 수준에 도달한다.

ABSTRACT

Millions of people around the world can not access content on the Web because most of the content is not readily available in their language. Machine translation (MT) systems have the potential to change this for many languages. Current MT systems provide very accurate results for high resource language pairs, e.g., German and English. However, for many low resource languages, MT is still under active research. The key challenge is lack of datasets to build these systems. We present Lesan, an MT system for low resource languages. Our pipeline solves the key bottleneck to low resource MT by leveraging online and offline sources, a custom OCR system for Ethiopic and an automatic alignment module. The final step in the pipeline is a sequence to sequence model that takes parallel corpus as input and gives us a translation model. Lesan's translation model is based on the Transformer architecture. After constructing a base model, back translation, is used to leverage monolingual corpora. Currently Lesan supports translation to and from Tigrinya, Amharic and English. We perform extensive human evaluation and show that Lesan outperforms state-of-the-art systems such as Google Translate and Microsoft Translator across all six pairs. Lesan is freely available and has served more than 10 million translations so far. At the moment, there are only 217 Tigrinya and 15,009 Amharic Wikipedia articles. We believe that Lesan will contribute towards democratizing access to the Web through MT for millions of people.

연구 동기 및 목표

  • Tigrinya어 및 아مهر라어와 같이 저자원 언어의 병렬 단일 언어 데이터 부족 문제를 해결하기 위해.
  • 다양한 오프라인 및 온라인 다국어 자료를 활용하는 확장 가능한 기계 번역 파이프라인을 개발하기 위해.
  • 에티오피아 문자를 위한 맞춤형 OCR 및 자동 문장 정렬을 통해 저자원 언어 쌍의 번역 품질을 향상시키기 위해.
  • 저자원 언어 쌍에서 기존 상용 MT 시스템을 인간 평가에서 능가하기 위해.
  • 웹 콘텐츠 접근성을 민주화하기 위해 저자원 언어로의 번역을 가능하게 하기 위해.

제안 방법

  • 파이프라인은 오프라인 아카이브(예: 번역된 책, 잡지) 및 온라인 자료(예: 다국어 뉴스 사이트, 종교 및 법적 텍스트)에서 데이터를 수집한다.
  • 맞춤형 OCR 시스템이 스캔된 문서의 에티오피아 문자를 처리한 후, 문자 및 단어 오류를 수정하기 위한 후처리를 수행한다.
  • 웹 자료에서 추출된 텍스트는 HTML 태그를 제거하고 저자, 날짜와 같은 메타데이터를 유지하면서 깔끔한 텍스트로 정제된다.
  • 중복 제거, 언어 식별, 문장 분할 등의 NLP 모듈을 거쳐 원시 텍스트를 정제하고 구조화한다.
  • 두 개의 역방향 번역 모델에서 유도된 교차 엔트로피 점수를 사용해 유효한 병렬 문장 쌍을 식별하는 자동 정렬 시스템이 작동한다.
  • 정렬된 병렬 코퍼스를 기반으로 트랜스포머 기반의 시퀀스-투-시퀀스 모델을 훈련하고, 단일 언어 데이터를 활용해 백트랜스레이션을 적용하여 성능을 추가로 향상시킨다.

실험 결과

연구 질문

  • RQ1제한된 병렬 데이터를 바탕으로 Tigrinya-영어 및 아مهر라-영어와 같은 저자원 언어 쌍에서 높은 성능을 내는 기계 번역 시스템이 가능할 수 있는가?
  • RQ2에티오피아 문자를 위한 맞춤형 OCR 시스템이 스캔된 문서에서 사용 가능한 텍스트를 얼마나 효과적으로 복원하는가?
  • RQ3다양하고 노이즈가 많은 다국어 자료에서 자동 문장 정렬이 고품질 병렬 코퍼스를 얼마나 효과적으로 생성할 수 있는가?
  • RQ4병렬 단일 언어 데이터가 부족한 상황에서 백트랜스레이션이 번역 품질을 크게 향상시킬 수 있는가?
  • RQ5여러 언어 방향에서 인간 평가에서 Lesan이 Google 번역 및 마이크로소프트 번역과 같은 상용 시스템과 비교해 어떻게 성능을 내는가?

주요 결과

  • Lesan은 아مهر라-영어, 티그린야-영어 및 그 반대 방향을 포함한 6개 언어 방향에서 인간 평가에서 Google 번역, 마이크로소프트 번역, 야ндекс 번역을 모두 능가한다.
  • 아مهر라어로의 번역에서 Lesan은 스토리 수준에서 평균 인간 평가 점수 3.25(±0.38)를 기록했으며, 이는 Google 번역(2.88 ± 0.33)과 마이크로소프트 번역(2.54 ± 0.44)을 뛰어넘었다.
  • 영어에서 티그린야어로의 번역에서 Lesan은 문장 수준에서 2.78(±0.31)의 점수를 기록했으며, 이는 마이크로소프트의 2.01(±0.63)보다 유의미하게 높았다.
  • 영어에서 아مهر라어로의 번역에서 Lesan은 스토리 수준에서 평균 점수 3.17(±0.42)를 기록했으며, 이는 Google 번역(2.88 ± 0.33)과 마이크로소프트 번역(2.54 ± 0.44)을 모두 능가했다.
  • 시스템은 1,000만 건 이상의 번역을 제공하여 확장성과 실세계 적용 가능성의 타당성을 입증했다.
  • 평가 데이터셋은 향후 저자원 기계 번역 평가 연구를 지원하기 위해 공개되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.