Skip to main content
QUICK REVIEW

[论文解读] Fine-grained linguistic evaluation for state-of-the-art Machine Translation

Eleftherios Avramidis, Vivien Macketanz|arXiv (Cornell University)|Oct 13, 2020
Natural Language Processing Techniques被引用 5
一句话总结

本论文采用人工精心整理的5,514项测试集,对11个最先进的德语到英语机器翻译系统进行了细粒度的语言学评估,覆盖14个类别中的107种语言现象。东北大学(Tohoku)和火山(Huoshan)系统表现最佳,但所有系统在整体平均性能上均未显著超越WMT19的最佳模型,且在习语、结果补语和过去完成时结构方面普遍存在弱点。

ABSTRACT

This paper describes a test suite submission providing detailed statistics of linguistic performance for the state-of-the-art German-English systems of the Fifth Conference of Machine Translation (WMT20). The analysis covers 107 phenomena organized in 14 categories based on about 5,500 test items, including a manual annotation effort of 45 person hours. Two systems (Tohoku and Huoshan) appear to have significantly better test suite accuracy than the others, although the best system of WMT20 is not significantly better than the one from WMT19 in a macro-average. Additionally, we identify some linguistic phenomena where all systems suffer (such as idioms, resultative predicates and pluperfect), but we are also able to identify particular weaknesses for individual systems (such as quotation marks, lexical ambiguity and sluicing). Most of the systems of WMT19 which submitted new versions this year show improvements.

研究动机与目标

  • 提供超越通用指标的、基于语言学动机的最新德语-英语机器翻译系统的详细评估。
  • 识别当前机器翻译系统在表现不佳的特定语言现象,尤其是罕见或复杂结构方面。
  • 评估WMT20最新系统相较于前一年最佳模型是否展现出可测量的改进。
  • 通过系统化的人工标注测试集精确定位错误模式,以支持针对性的系统改进和数据整理。

提出的方法

  • 本研究采用DFKI测试集,该测试集为人工构建的基准,包含5,514个测试项,针对14个类别中的107种语言现象。
  • 每个测试项包含一个源句和多个参考翻译,包括正确和错误的变体,以根据特定语言学标准评估系统输出。
  • 系统输出通过基于规则的检查(正则表达式和固定字符串)进行自动评估,模糊情况由专家语言学家裁定。
  • 混合评估流程通过结合自动评分与人工标注判断来确保高精度,尤其针对边界情况。
  • 性能以每种语言现象正确翻译的测试项比例衡量,并计算所有现象的宏观平均值与微观平均值。
  • 评估应用于WMT20共享任务中的11个系统,包括与WMT19系统进行比较的参与系统。

实验结果

研究问题

  • RQ1哪些德语-英语机器翻译系统在细粒度语言现象上表现出最高准确率,与前一年系统相比如何?
  • RQ2是否存在所有当前系统均持续表现不佳的特定语言现象?
  • RQ3在最新版本中,哪些系统相较于其WMT19对应版本展现出可测量的改进?
  • RQ4当前最先进机器翻译系统中最常见的错误模式是什么,这些错误在不同语言类别中如何变化?

主要发现

  • 东北大学(Tohoku)和火山(Huoshan)系统在整体准确率上表现最高,显著优于其余九个系统。
  • 所有WMT20系统在所有现象的宏观平均值上均未表现出相对于WMT19最佳系统的统计显著改进。
  • 所有系统在习语、结果补语和过去完成时结构方面均表现困难,表明在处理复杂句法和语义现象方面存在持续挑战。
  • 各系统表现出不同的弱点:部分系统在引号使用上存在问题,另一些则反复出现词汇歧义问题,而削支结构(sluicing constructions)常被错误翻译。
  • 大多数从WMT19更新版本的系统均展现出可测量的改进,尤其在情态动词和及物结构等现象上。
  • 所有107种现象的微观平均准确率为85.3%,而现象宏观平均达到89.1%,表明在常见现象上表现良好,但在罕见或复杂现象上存在明显下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。