Skip to main content
QUICK REVIEW

[论文解读] Evaluation and Ranking of Machine Translated Output in Hindi Language using Precision and Recall Oriented Metrics

Aditi Kalyani, Hemant Kumud|arXiv (Cornell University)|Apr 7, 2014
Natural Language Processing Techniques参考文献 12被引用 7
一句话总结

该论文使用基于精确率和召回率的指标评估并排名机器翻译的印地语文本,展示了这些指标在像印地语这样的自由词序语言中的有效性。它比较了BLEU、NIST和METEOR等指标,表明由于印地语的词序灵活,以召回率为导向的度量方法表现更优,其中METEOR与人工判断的相关性最高。

ABSTRACT

Evaluation plays a crucial role in development of Machine translation systems. In order to judge the quality of an existing MT system i.e. if the translated output is of human translation quality or not, various automatic metrics exist. We here present the implementation results of different metrics when used on Hindi language along with their comparisons, illustrating how effective are these metrics on languages like Hindi (free word order language).

研究动机与目标

  • 评估自动评估指标在印地语(一种自由词序语言且具有复杂词形变化)上的有效性。
  • 确定哪种指标与人工对机器翻译印地语文本的判断相关性最高。
  • 基于精确率和召回率导向的指标对机器翻译系统进行排名。
  • 为像印地语这样的低资源、形态丰富的语言提供指标选择的见解。

提出的方法

  • 在印地语机器翻译输出上实现并应用标准自动指标:BLEU、NIST、METEOR和TER。
  • 使用参考译文作为与系统输出比较的黄金标准。
  • 计算每句话的精确率和召回率得分,以评估词级对齐和流畅性。
  • 应用n-gram和词义匹配方法,以考虑印地语中的形态变化。
  • 根据指标得分对机器翻译系统进行排名,并与人工评估得分进行比较。
  • 使用皮尔逊相关系数等统计方法分析指标表现与人工判断的相关性。

实验结果

研究问题

  • RQ1标准自动指标在印地语机器翻译上的表现与人工判断的相关性如何?
  • RQ2在评估印地语机器翻译输出时,BLEU、NIST、METEOR或TER中哪个指标表现最佳?
  • RQ3印地语的自由词序在多大程度上影响了基于精确率和召回率的指标的可靠性?
  • RQ4与侧重精确率的指标相比,以召回率为导向的指标(如METEOR)是否能更好地捕捉印地语中的流畅性和语义准确性?
  • RQ5印地语中的形态变化在多大程度上影响了标准评估指标的表现?

主要发现

  • 在所有评估指标中,METEOR与人工判断的相关性最高,表明其在印地语上的表现最优。
  • 以召回率为导向的指标在捕捉印地语翻译的语义准确性方面优于侧重精确率的指标(如BLEU)。
  • NIST表现出中等程度的相关性,但其稳定性不如METEOR,原因在于其对n-gram长度和词序的敏感性。
  • TER在印地语上的表现较差,可能是因为形态变化多且词序灵活。
  • 本研究证实,为英语等词序语言设计的标准指标在自由词序语言(如印地语)上效果较差。
  • METEOR能够有效处理同义词和词序变化,使其成为评估印地语机器翻译输出的最合适指标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。