Skip to main content
QUICK REVIEW

[논문 리뷰] Assamese-English Bilingual Machine Translation

Kalyanee Kanchan Baruah, Pranjal Das|arXiv (Cornell University)|2014. 07. 08.
Natural Language Processing Techniques참고 문헌 3인용 수 5
한 줄 요약

이 논문은 Moses 툴킷을 사용하여 아삼어-영어 双어 번역을 위한 통계적 어구 기반 기계 번역 시스템을 제시한다. 언어 모델링은 IRSTLM를, 어휘 정렬은 GIZA를 사용한다. 영어에서 아삼어로의 번역에서 BLEU 점수 15.8을 기록한 반면 아삼어에서 영어로의 번역은 12.4로 낮았으며, OOV 단어와 고유명사를 처리하기 위해 통계적 발음 전환 모듈을 통합하였다. 이는 문체적으로 복잡한 인도 언어에서의 번역 과제를 반영한다.

ABSTRACT

Machine translation is the process of translating text from one language to another. In this paper, Statistical Machine Translation is done on Assamese and English language by taking their respective parallel corpus. A statistical phrase based translation toolkit Moses is used here. To develop the language model and to align the words we used two another tools IRSTLM, GIZA respectively. BLEU score is used to check our translation system performance, how good it is. A difference in BLEU scores is obtained while translating sentences from Assamese to English and vice-versa. Since Indian languages are morphologically very rich hence translation is relatively harder from English to Assamese resulting in a low BLEU score. A statistical transliteration system is also introduced with our translation system to deal basically with proper nouns, OOV (out of vocabulary) words which are not present in our corpus.

연구 동기 및 목표

  • 저자원 인도 언어를 대상으로 한 이중 언어 기계 번역 시스템을 개발한다.
  • 영어에서 아삼어로의 번역을 복잡하게 만드는 아삼어의 형태적 풍부성 문제를 해결한다.
  • 통계적 발음 전환 시스템을 통해 훈련 데이터에 없는 OOV 단어와 명사어의 번역 품질을 향상시킨다.
  • 병렬 단일 언어 코퍼스를 이용하여 BLEU 점수로 시스템 성능을 평가한다.
  • 저자원 인도어 쌍을 위한 실용적이고 오픈소스 번역 파이프라인을 기여한다.

제안 방법

  • 훈련을 위한 어구 기반 번역 모델을 구축하기 위해 Moses 통계적 기계 번역 툴킷을 사용하였다.
  • 아삼어-영어 병렬 코퍼스 내 병렬 문장 간 어휘 수준의 정렬을 위해 GIZA++를 활용하였다.
  • 유창성과 통일성을 향상시키기 위해 IRSTLM 툴킷을 사용하여 양 언어의 언어 모델을 구축하였다.
  • 훈련 코퍼스에 존재하지 않는 단어, 특히 고유명사와 같은 OOV 단어를 대상 언어로 매핑하기 위해 통계적 발음 전환 시스템을 통합하였다.
  • 정부 및 교육 기관 자료에서 수집한 병렬 코퍼스를 기반으로 시스템을 훈련 및 평가하였다.
  • 기계 번역 평가의 표준 척도인 BLEU 점수를 사용하여 번역 품질을 측정하였다.

실험 결과

연구 질문

  • RQ1영어와 아삼어 간 번역에 대해 어구 기반 통계적 기계 번역 시스템의 효과성은 어떠한가?
  • RQ2영어에서 아삼어로의 번역과 아삼어에서 영어로의 번역 간 성능 격차는 이유가 무엇인가?
  • RQ3통계적 발음 전환 시스템이 저자원 환경에서 OOV 단어와 명사어를 처리하는 데 효과적인가?
  • RQ4아삼어의 형태적 복잡성이 번역 품질에 어느 정도 영향을 미치는가?
  • RQ5언어 모델링 및 어휘 정렬 도구가 이 설정에서 최종 BLEU 점수에 어떤 영향을 미치는가?

주요 결과

  • 영어에서 아삼어로의 번역 방향에서 BLEU 점수 15.8을 기록한 반면 아삼어에서 영어로의 번역은 12.4로 낮아 방향성에 따른 성능 격차가 확인되었다.
  • 아삼어에서 영어로의 번역에서 낮은 BLEU 점수는 아삼어의 형태적 풍부성으로 인한 번역 복잡성 증가 때문으로 분석되었다.
  • 통계적 발음 전환 시스템은 훈련 코퍼스에 없는 OOV 단어와 고유명사를 효과적으로 처리하였다.
  • GIZA++를 통한 어휘 정렬과 IRSTLM를 통한 언어 모델링이 시스템의 유창성과 정확성 향상에 기여하였다.
  • 어구 기반 SMT가 저자원 인도어 쌍에 적용될 수 있으며, 측정 가능한 성능을 보였지만 제한적이었다.
  • 결과적으로 형태적 복잡성이 영어에서 아삼어로의 번역에서 핵심적 장애물로 남아 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.