Skip to main content
QUICK REVIEW

[论文解读] Hindi to English Transfer Based Machine Translation System

Akanksha Gehlot, Vaishali Sharma|arXiv (Cornell University)|Jul 8, 2015
Natural Language Processing Techniques参考文献 3被引用 13
一句话总结

本文提出了一种基于迁移的印地语-英语机器翻译系统,利用两种语言的语言学知识生成翻译,而无需依赖大规模并行语料库。通过使用句法解析和重排规则,该系统在简单句子上实现了准确翻译,在复杂句和复合句上也取得了接近准确的结果,为低资源场景(如印地语-英语翻译)下数据密集型语料库方法提供了可行的替代方案。

ABSTRACT

In large societies like India there is a huge demand to convert one human language into another. Lots of work has been done in this area. Many transfer based MTS have developed for English to other languages, as MANTRA CDAC Pune, MATRA CDAC Pune, SHAKTI IISc Bangalore and IIIT Hyderabad. Still there is a little work done for Hindi to other languages. Currently we are working on it. In this paper we focus on designing a system, that translate the document from Hindi to English by using transfer based approach. This system takes an input text check its structure through parsing. Reordering rules are used to generate the text in target language. It is better than Corpus Based MTS because Corpus Based MTS require large amount of word aligned data for translation that is not available for many languages while Transfer Based MTS requires only knowledge of both the languages(source language and target language) to make transfer rules. We get correct translation for simple assertive sentences and almost correct for complex and compound sentences.

研究动机与目标

  • 通过开发基于迁移的系统,解决印地语-英语翻译中并行双语数据稀缺的问题。
  • 设计一种依赖语言学知识而非大规模并行语料库的机器翻译系统。
  • 提高印地语-英语翻译中简单句和复杂句结构的翻译准确性。
  • 证明基于迁移的方法在低资源语言对(如印地语-英语)中的可行性。

提出的方法

  • 系统使用语言学规则对输入的印地语文本进行句法结构分析。
  • 应用基于印地语和英语语法知识推导出的迁移规则,对解析后的输入进行重构。
  • 应用重排规则,根据英语的词序和句法重新排列成分。
  • 通过基于规则的转换,将印地语的句法结构映射到英语,生成目标语言输出。
  • 该方法通过依赖双语语言学专业知识,避免对大规模并行语料库的依赖。

实验结果

研究问题

  • RQ1基于迁移的机器翻译系统是否能在无需大规模并行语料库的情况下,实现对印地语-英语翻译的可接受翻译质量?
  • RQ2基于规则的重排和句法解析在将复杂和复合印地语句子翻译成英语时有多有效?
  • RQ3在低资源场景(如印地语-英语)中,基于迁移的方法在多大程度上优于基于语料库的方法?
  • RQ4该系统在简单句与复杂句类型上分别能达到何种准确度?

主要发现

  • 该系统通过迁移规则和句法解析,对简单陈述句实现了正确翻译。
  • 对于复杂句和复合句,系统实现了接近正确的翻译,表明其在处理结构差异方面具有鲁棒性。
  • 基于迁移的方法减少了对大规模对齐并行语料库的依赖,而这类语料库在印地语-英语中极为稀缺。
  • 该方法通过利用源语言和目标语言的语言学知识,在低资源机器翻译中展示了可行性与有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。