Skip to main content
QUICK REVIEW

[논문 리뷰] Data Augmentation and Terminology Integration for Domain-Specific Sinhala-English-Tamil Statistical Machine Translation

Aloka Fernando, Surangika Ranathunga|arXiv (Cornell University)|2020. 11. 05.
Natural Language Processing Techniques참고 문헌 23인용 수 13
한 줄 요약

이 논문은 도메인 특화된 신달라-영어-타밀 통계적 기계 번역을 위한 데이터 증강 기법을 제안하며, 경우표지어(case-markers)를 사용하여 이중어휘사전의 어휘를 확장하여 파생형태를 생성함으로써 형태학적으로 풍부한 언어에서의 어휘 외부어(OOV) 문제를 해결한다. 이 방법은 병렬 단일어자료가 필요 없이 파생형태의 커버리지 향상으로 인해 BLEU 점수를 향상시키며, 자원이 적은 환경에서 효과적임을 보여준다.

ABSTRACT

Out of vocabulary (OOV) is a problem in the context of Machine Translation (MT) in low-resourced languages. When source and/or target languages are morphologically rich, it becomes even worse. Bilingual list integration is an approach to address the OOV problem. This allows more words to be translated than are in the training data. However, since bilingual lists contain words in the base form, it will not translate inflected forms for morphologically rich languages such as Sinhala and Tamil. This paper focuses on data augmentation techniques where bilingual lexicon terms are expanded based on case-markers with the objective of generating new words, to be used in Statistical machine Translation (SMT). This data augmentation technique for dictionary terms shows improved BLEU scores for Sinhala-English SMT.

연구 동기 및 목표

  • 자원이 적고 형태학적으로 풍부한 언어인 신달라어와 타밀어에서 통계적 기계 번역에서 어휘 외부어(OOV) 문제를 해결하기 위해.
  • 기본형 이외의 파생형태를 경우표지어를 사용하여 생성함으로써 이중어휘사전의 커버리지 범위를 확장하기 위해.
  • 대규모 병렬 단일어자료가 필요 없이 도메인 특화된 SMT 성능을 향상시키기 위해.
  • 데이터 증강이 자원이 적은 번역 환경에서 BLEU 점수에 미치는 영향을 평가하기 위해.
  • 이중어휘 목록의 어휘를 형태학적 정확성을 유지하면서 SMT 시스템에 통합하기 위해.

제안 방법

  • 이 방법은 신달라어와 타밀어와 같은 형태학적으로 풍부한 언어에서 기초형 어휘에 경우표지어(예: 주격, 속격, 목적격)를 적용하여 파생형태를 생성한다.
  • 기본형 어휘에서 유도된 형태학적 패턴을 기반으로 언어 규칙을 사용하여 파생형태를 합성함으로써 학습 데이터의 어휘 커버리지가 향상된다.
  • 증강된 어휘사전은 SMT 시스템의 번역 사전으로 통합되어 어순 정렬 및 번역 확률 추정이 향상된다.
  • 이 방법은 특정 도메인의 텍스트에 특화되어 있어 도메인 용어와의 관련성과 일관성을 확보한다.
  • 증강 전후의 번역 품질을 평가하기 위해 BLEU 점수가 사용되며, 기초형 어휘사전만을 사용한 기준 SMT와의 비교가 이루어진다.
  • 원칙적으로 언어에 종속되지 않게 설계되었지만, 형태학적 복잡성이 높기 때문에 신달라어와 타밀어에 적용되었다.

실험 결과

연구 질문

  • RQ1기본형 어휘사전의 경우표지어 기반 확장이 형태학적으로 풍부하고 자원이 적은 언어에서 OOV 처리에 효과적인가?
  • RQ2기본 어휘사전에서 유도된 파생형태를 사용한 데이터 증강이 도메인 특화된 신달라-영어-타밀 SMT에서 BLEU 점수에 얼마나 기여하는가?
  • RQ3추가적인 병렬 단일어자료 없이 증강된 어휘를 SMT 시스템에 통합하는 데 얼마나 효과적인가?
  • RQ4이 방법은 자원이 적은 환경에서 어휘 커버리지가 증가하는 동안 형태학적 정확성을 유지하는가?
  • RQ5이 방법은 다른 형태학적으로 풍부하고 자원이 적은 언어 쌍으로 일반화될 수 있는가?

주요 결과

  • 제안된 데이터 증강 기법은 기초 어휘사전 항목에서 유도된 파생형태 생성을 통해 신달라-영어 SMT에서 어휘 외부어(OOV) 비율을 크게 감소시킨다.
  • 이 방법은 기초형 어휘사전만을 사용한 기준 SMT 시스템 대비 측정 가능한 BLEU 점수 향상을 이끌어내어 번역 품질 향상이 확인된다.
  • 경우표지어 기반 확장은 신달라어와 타밀어의 형태학적 변형을 효과적으로 포착하여 파생형태 커버리지가 향상된다.
  • 증강된 어휘를 SMT 시스템에 통합함으로써 도메인 특화된 맥락에서 번역의 강건성이 향상된다.
  • 추가적인 병렬 단일어자료가 필요 없이 성능 향상을 달성하여 자원이 적은 환경에 적합함을 입증한다.
  • 형태학적 확장이 경우표지어를 통해 수행될 경우 형태학적으로 풍부하고 자원이 적은 언어에서 SMT 성능 향상에 실현 가능하고 효과적인 전략임을 결과가 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.