QUICK REVIEW
[论文解读] Demo of Sanskrit-Hindi SMT System
Rajneesh Kumar Pandey, Atul Kr. Ojha|arXiv (Cornell University)|Apr 13, 2018
Natural Language Processing Techniques参考文献 1被引用 3
一句话总结
本论文提出了一种基于短语的统计机器翻译(SMT)系统,用于梵语到印地语的翻译,该系统基于Moses工具包开发。该系统在43,000句平行语料和56,000句单语印地语文本语料上进行训练,取得了57的BLEU得分,证明了在低资源条件下使用统计方法进行梵语-印地语翻译的可行性。
ABSTRACT
The demo proposal presents a Phrase-based Sanskrit-Hindi (SaHiT) Statistical Machine Translation system. The system has been developed on Moses. 43k sentences of Sanskrit-Hindi parallel corpus and 56k sentences of a monolingual corpus in the target language (Hindi) have been used. This system gives 57 BLEU score.
研究动机与目标
- 开发针对低资源梵语-印地语语言对的统计机器翻译系统。
- 解决梵语和印地语中平行语料和单语语料稀缺的问题。
- 评估基于短语的SMT模型在梵语到印地语翻译任务中的性能。
- 为印度语言自然语言处理研究与评估贡献一个可运行的演示系统。
提出的方法
- 该系统基于Moses SMT工具包构建,这是基于短语的翻译的标准框架。
- 使用包含43,000对句子(梵语-印地语)的平行单语语料进行训练。
- 使用56,000句的单语印地语文本语料以改进语言模型。
- 使用标准SMT流水线组件训练基于短语的翻译模型,包括短语表和语言模型。
- BLEU得分被用作翻译质量的主要评估指标。
- 该系统作为演示系统在LREC 2018研讨会期间公开部署。
实验结果
研究问题
- RQ1基于短语的SMT系统能否在低资源梵语-印地语语言对上实现可接受的翻译质量?
- RQ2包含单语印地语文本语料在多大程度上提升了翻译性能?
- RQ3在仅43,000对句子的有限平行语料上训练的基于短语的SMT系统的BLEU得分是多少?
- RQ4尽管存在形态复杂性,Moses工具包能否有效支持梵语-印地语翻译?
主要发现
- 梵语-印地语SMT系统取得了57的BLEU得分,表明翻译质量中等至良好。
- 使用56,000句的单语印地语文本语料增强了语言模型,并有助于提升翻译的流畅性。
- 该系统表明,基于短语的SMT可以有效应用于梵语-印地语等低资源印度语言对。
- 演示系统已成功部署并在第11届LREC 2018会议上展示,验证了其实际可用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。