Skip to main content
QUICK REVIEW

[논문 리뷰] Demo of Sanskrit-Hindi SMT System

Rajneesh Kumar Pandey, Atul Kr. Ojha|arXiv (Cornell University)|2018. 04. 13.
Natural Language Processing Techniques참고 문헌 1인용 수 3
한 줄 요약

이 논문은 모스 툴킷을 사용하여 개발된 문장 기반 통계적 기계 번역(SMT) 시스템을 제안한다. 43,000개 문장 쌍의 병렬 코퍼스와 56,000개 문장의 단일 언어 히누디 코퍼스로 훈련된 이 시스템은 BLEU 점수 57을 기록하여 자원이 적은 상스크리트-힌두어 번역에 통계적 방법을 적용할 수 있음을 보여준다.

ABSTRACT

The demo proposal presents a Phrase-based Sanskrit-Hindi (SaHiT) Statistical Machine Translation system. The system has been developed on Moses. 43k sentences of Sanskrit-Hindi parallel corpus and 56k sentences of a monolingual corpus in the target language (Hindi) have been used. This system gives 57 BLEU score.

연구 동기 및 목표

  • 자원이 적은 상스크리트-힌두어 언어 쌍을 위한 통계적 기계 번역 시스템을 개발하기 위해.
  • 상스크리트어 및 히누디어에서 병렬 단일 언어 및 병렬 코퍼스의 부족 문제를 해결하기 위해.
  • 상스크리트어에서 히누디어로의 번역에 대해 문장 기반 SMT 모델의 성능을 평가하기 위해.
  • 인도어 자연어 처리 연구 및 평가를 위해 기능적인 데모 시스템을 기여하기 위해.

제안 방법

  • 시스템은 표준 프레이즈 기반 번역을 위한 프레임워크인 모스 SMT 툴킷을 사용하여 구축된다.
  • 훈련을 위해 43,000개 문장 쌍(상스크리트-힌두어)의 병렬 단일 언어 코퍼스를 사용한다.
  • 언어 모델 향상을 위해 56,000개 문장의 단일 언어 히누디어 코퍼스를 사용한다.
  • 표준 SMT 파이프라인 구성 요소를 사용하여 프레이즈 테이블 및 언어 모델을 포함한 프레이즈 기반 번역 모델을 훈련시킨다.
  • 번역 품질 평가의 주요 지표로 BLEU 점수를 사용한다.
  • 시스템은 LREC 2018 워크숍에서 공개 평가를 위한 데모로 배포된다.

실험 결과

연구 질문

  • RQ1문장 기반 SMT 시스템이 자원이 적은 상스크리트-힌두어 언어 쌍에 대해 만족스러운 번역 품질을 달성할 수 있는가?
  • RQ256,000개의 단일 언어 히누디어 코퍼스 포함 시 번역 성능에 어떤 영향을 미치는가?
  • RQ343,000개 문장 쌍의 제한된 병렬 코퍼스로 훈련된 프레이즈 기반 SMT 시스템의 BLEU 점수는 얼마인가?
  • RQ4모스 툴킷은 형태적 복잡성에도 불구하고 상스크리트-힌두어 번역을 효과적으로 지원할 수 있는가?

주요 결과

  • 상스크리트-힌두어 SMT 시스템은 BLEU 점수 57을 기록하여 중간에서 강한 번역 품질을 나타낸다.
  • 56,000개의 단일 언어 히누디어 코퍼스 사용은 언어 모델을 강화하고 번역의 유창성 향상에 기여한다.
  • 이 시스템은 상스크리트-힌두어와 같은 자원이 적은 인도어 언어 쌍에 대해 프레이즈 기반 SMT를 효과적으로 적용할 수 있음을 보여준다.
  • 데모 시스템은 11회차 LREC 2018 회의에서 성공적으로 배포되어 실용적 사용 가능성의 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.