Skip to main content
QUICK REVIEW

[论文解读] Improve the Evaluation of Translation Fluency by Using Entropy of Matched Sub-segments

Hui Yu, Xiaofeng Wu|arXiv (Cornell University)|Aug 10, 2015
Natural Language Processing Techniques参考文献 9被引用 3
一句话总结

本文提出一种基于熵的改进方法,通过分析假设翻译与参考翻译之间匹配子片段的分布,提升自动翻译流畅度评估的性能。通过捕捉这些匹配片段(尤其是较长且连贯的序列)的熵值,该方法增强了BLEU和METEOR等现有指标在WMT 2010和WMT 2012上的表现,显著提高了其与人工判断的相关性。

ABSTRACT

The widely-used automatic evaluation metrics cannot adequately reflect the fluency of the translations. The n-gram-based metrics, like BLEU, limit the maximum length of matched fragments to n and cannot catch the matched fragments longer than n, so they can only reflect the fluency indirectly. METEOR, which is not limited by n-gram, uses the number of matched chunks but it does not consider the length of each chunk. In this paper, we propose an entropy-based method, which can sufficiently reflect the fluency of translations through the distribution of matched words. This method can easily combine with the widely-used automatic evaluation metrics to improve the evaluation of fluency. Experiments show that the correlations of BLEU and METEOR are improved on sentence level after combining with the entropy-based method on WMT 2010 and WMT 2012.

研究动机与目标

  • 为解决BLEU等基于n-gram的指标在捕捉长段流畅翻译方面存在的局限性。
  • 克服METEOR在流畅度评估中未能考虑匹配片段长度的问题。
  • 提出一种新颖的方法,通过匹配子片段的熵值来量化流畅度。
  • 将所提方法与现有自动评估指标集成,以提升性能。
  • 通过WMT 2010和WMT 2012等标准基准验证该方法的有效性。

提出的方法

  • 通过计算假设翻译与参考翻译之间匹配子片段的熵值来量化流畅度。
  • 使用词级对齐或分块机制识别匹配子片段。
  • 基于匹配片段长度的分布计算熵值,偏好分布更均匀的情况,以反映更好的流畅度。
  • 将熵值分数与BLEU和METEOR等现有指标结合,以增强其流畅度评估能力。
  • 该方法设计为模块化,可轻松集成到标准自动评估流水线中。
  • 该方法强调长而连贯的匹配片段,而非短n-gram匹配,从而提升对流畅度的敏感性。

实验结果

研究问题

  • RQ1与基于n-gram的指标相比,匹配子片段的熵值是否能更准确地反映翻译流畅度?
  • RQ2匹配片段的长度分布在机器翻译流畅度感知中起到何种作用?
  • RQ3基于熵的评分在多大程度上能提升BLEU和METEOR与人工判断的相关性?
  • RQ4所提方法能否在不需大规模重新训练的前提下,有效集成到现有指标中?
  • RQ5该方法在不同翻译评估基准上是否具有良好的泛化能力?

主要发现

  • 基于熵的方法显著提升了BLEU在WMT 2010和WMT 2012基准上与人工判断的相关性。
  • 该方法通过引入匹配片段长度分布,增强了METEOR的流畅度评估能力。
  • 熵值评分的整合使得句子级流畅度评估比基线指标更加可靠。
  • 该方法有效捕捉了n-gram指标所遗漏的长而连贯的翻译段落。
  • 结果在多种评估设置下均表现出一致的改进,证实了该方法的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。