QUICK REVIEW
[논문 리뷰] Demo of Sanskrit-Hindi SMT System
Rajneesh Kumar Pandey, Atul Kr. Ojha|arXiv (Cornell University)|2018. 04. 13.
Natural Language Processing Techniques참고 문헌 1인용 수 3
한 줄 요약
이 논문은 모스 툴킷을 사용하여 개발된 문장 기반 통계적 기계 번역(SMT) 시스템을 제안한다. 43,000개 문장 쌍의 병렬 코퍼스와 56,000개 문장의 단일 언어 히누디 코퍼스로 훈련된 이 시스템은 BLEU 점수 57을 기록하여 자원이 적은 상스크리트-힌두어 번역에 통계적 방법을 적용할 수 있음을 보여준다.
ABSTRACT
The demo proposal presents a Phrase-based Sanskrit-Hindi (SaHiT) Statistical Machine Translation system. The system has been developed on Moses. 43k sentences of Sanskrit-Hindi parallel corpus and 56k sentences of a monolingual corpus in the target language (Hindi) have been used. This system gives 57 BLEU score.
연구 동기 및 목표
- 자원이 적은 상스크리트-힌두어 언어 쌍을 위한 통계적 기계 번역 시스템을 개발하기 위해.
- 상스크리트어 및 히누디어에서 병렬 단일 언어 및 병렬 코퍼스의 부족 문제를 해결하기 위해.
- 상스크리트어에서 히누디어로의 번역에 대해 문장 기반 SMT 모델의 성능을 평가하기 위해.
- 인도어 자연어 처리 연구 및 평가를 위해 기능적인 데모 시스템을 기여하기 위해.
제안 방법
- 시스템은 표준 프레이즈 기반 번역을 위한 프레임워크인 모스 SMT 툴킷을 사용하여 구축된다.
- 훈련을 위해 43,000개 문장 쌍(상스크리트-힌두어)의 병렬 단일 언어 코퍼스를 사용한다.
- 언어 모델 향상을 위해 56,000개 문장의 단일 언어 히누디어 코퍼스를 사용한다.
- 표준 SMT 파이프라인 구성 요소를 사용하여 프레이즈 테이블 및 언어 모델을 포함한 프레이즈 기반 번역 모델을 훈련시킨다.
- 번역 품질 평가의 주요 지표로 BLEU 점수를 사용한다.
- 시스템은 LREC 2018 워크숍에서 공개 평가를 위한 데모로 배포된다.
실험 결과
연구 질문
- RQ1문장 기반 SMT 시스템이 자원이 적은 상스크리트-힌두어 언어 쌍에 대해 만족스러운 번역 품질을 달성할 수 있는가?
- RQ256,000개의 단일 언어 히누디어 코퍼스 포함 시 번역 성능에 어떤 영향을 미치는가?
- RQ343,000개 문장 쌍의 제한된 병렬 코퍼스로 훈련된 프레이즈 기반 SMT 시스템의 BLEU 점수는 얼마인가?
- RQ4모스 툴킷은 형태적 복잡성에도 불구하고 상스크리트-힌두어 번역을 효과적으로 지원할 수 있는가?
주요 결과
- 상스크리트-힌두어 SMT 시스템은 BLEU 점수 57을 기록하여 중간에서 강한 번역 품질을 나타낸다.
- 56,000개의 단일 언어 히누디어 코퍼스 사용은 언어 모델을 강화하고 번역의 유창성 향상에 기여한다.
- 이 시스템은 상스크리트-힌두어와 같은 자원이 적은 인도어 언어 쌍에 대해 프레이즈 기반 SMT를 효과적으로 적용할 수 있음을 보여준다.
- 데모 시스템은 11회차 LREC 2018 회의에서 성공적으로 배포되어 실용적 사용 가능성의 타당성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.