Skip to main content
QUICK REVIEW

[논문 리뷰] Context Models for OOV Word Translation in Low-Resource Languages

Angli Liu, Katrin Kirchhoff|arXiv (Cornell University)|2018. 01. 26.
Natural Language Processing Techniques참고 문헌 23인용 수 4
한 줄 요약

이 논문은 저자원 기계 번역에서 복수의 번역 후보가 외부 지식 소스(예: 사전)에서 유도될 때 번역의 모호성을 해결하기 위해 넓은 맥락을 고려한 타겟 언어 신경 언어 모델을 사용한다. 문서 수준의 맥락을 활용해 번역 라티스를 재평가함으로써, 이 방법은 훈련 데이터 증강과 최신 기술 기반 NMT 시스템에 비해 여섯 개 언어 쌍 중 다섯 개에서 일관된 성능 향상을 이룬다.

ABSTRACT

Out-of-vocabulary word translation is a major problem for the translation of low-resource languages that suffer from a lack of parallel training data. This paper evaluates the contributions of target-language context models towards the translation of OOV words, specifically in those cases where OOV translations are derived from external knowledge sources, such as dictionaries. We develop both neural and non-neural context models and evaluate them within both phrase-based and self-attention based neural machine translation systems. Our results show that neural language models that integrate additional context beyond the current sentence are the most effective in disambiguating possible OOV word translations. We present an efficient second-pass lattice-rescoring method for wide-context neural language models and demonstrate performance improvements over state-of-the-art self-attention based neural MT systems in five out of six low-resource language pairs.

연구 동기 및 목표

  • 병역 훈련 데이터가 극도로 제한된 저자원 언어에서 OOV 단어를 번역하는 데 도전하는 것.
  • 사전과 같은 외부 지식 소스에서 파생된 복수의 후보 번역이 존재할 때 번역의 모호성을 해결하는 것.
  • 특히 문서 수준의 맥락을 포함해 현재 문장 외부의 맥락 정보를 활용해 번역 품질을 향상시키는 것.
  • 넓은 맥락을 고려한 신경 언어 모델을 신경 기계 번역 시스템에 통합하기 위한 효율적인 라티스 재평가 방법을 개발하는 것.
  • 맥락 인식 모델이 저자원 환경에서 외부 번역을 직접 훈련 데이터에 추가하는 것보다 우수한 성능을 보이는지 입증하는 것.

제안 방법

  • 문장 수준 및 문서 수준 맥락을 포괄하는 타겟 언어 단일 언어 데이터를 사용해 신경 및 비신경 맥락 모델을 훈련한다.
  • NMT 출력물에 대해 두 번째 단계로 넓은 맥락 언어 모델(이전 문장 포함)을 통합해 라티스 재평가 단계를 수행한다.
  • 복수의 이전 문장을 고려한 어텐션 기반 신경 언어 모델을 사용해 장거리 의존성을 모델링하고, 번역의 모호성을 해소한다.
  • fastAlign을 사용해 어휘 기반 기계 번역(PBMT) 및 트랜스포머 기반 NMT 시스템의 출력을 정렬하여, 재평가를 위한 통합 라티스를 생성한다.
  • 맥락 모델을 사용해 라티스를 재평가하여 OOV 단어에 대해 가장 적절한 번역을 선택하고, 모호한 후보를 맥락에 맞는 것으로 교체한다.
  • 외부 번역을 사용한 훈련 데이터 증강 및 오라클 기반 상한선과 비교한다.

실험 결과

연구 질문

  • RQ1문장 수준 또는 맥락 없음과 비교해, 넓은 맥락을 고려한 타겟 언어 모델이 복수의 OOV 번역 후보를 해소하는 데 얼마나 효과적인가?
  • RQ2문서 수준 맥락을 고려한 신경 언어 모델이 저자원 환경에서 OOV 번역 성능을 크게 향상시킬 수 있는가?
  • RQ3맥락 모델을 사용한 라티스 재평가가 단순히 외부 번역을 훈련 데이터에 추가하는 것보다 우수한가?
  • RQ4다양한 저자원 언어 쌍에서 맥락 인식 모델의 성능는 어떻게 비교되는가?
  • RQ5제안된 방법이 어휘 기반 및 자기 어텐션 기반 모델을 포함한 다양한 신경 기계 번역 아키텍처에서 일관된 향상을 이끌 수 있는가?

주요 결과

  • 이전 문장을 포함한 문서 수준의 신경 언어 모델이 문장 수준 및 비신경 모델을 포함한 모든 다른 맥락 모델보다 우수한 성능을 보였다.
  • 넓은 맥락 신경 모델을 사용한 라티스 재평가 방법이 여섯 개 언어 쌍 중 다섯 개에서 외부 번역을 사용한 훈련 데이터 증강보다 일관된 성능 향상을 이뤘다.
  • 아مهر라어(amh) 및 요르바어(yor) 언어 쌍에서, 이 방법은 데이터 증강 기반 베이스라인 대비 BLEU 점수를 각각 2.46점과 1.36점 향상시켰다.
  • 베트남어(vie)의 경우, 데이터 증강 훈련 대비 2.10 BLEU 점수 향상으로 27.25 BLEU에 도달했다.
  • PBMT 및 트랜스포머 출력의 시스템 조합에 OOV 재평가를 적용함으로써, 베트남어에서 오라클 상한선에 가까운 성능을 달성했으며, 58.5 unigram 정밀도를 기록했다.
  • 이 방법은 다양한 저자원 언어 쌍에서 뛰어난 견고성을 보였으며, 특히 아مهر라어 및 요르바어처럼 형태소가 풍부하고 저자원인 언어에서 가장 뚜렷한 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.