Skip to main content
QUICK REVIEW

[论文解读] The Devil is in the Errors: Leveraging Large Language Models for Fine-grained Machine Translation Evaluation

Patrick Fernandes, Daniel Deutsch|arXiv (Cornell University)|Aug 14, 2023
Natural Language Processing Techniques被引用 5
一句话总结

本文提出 AutoMQM,一种利用大型语言模型(LLM)如 PaLM-2 的提示技术,通过使用多维质量度量(MQM)框架识别并分类翻译错误,实现细粒度的机器翻译评估。该方法在句子级别与人工判断具有高度相关性,尤其在大模型上表现更优,并能提供可解释的错误片段,优于仅输出分数的提示方法,在错误检测方面达到最先进学习型度量的水平,且仅需极少的人工标注。

ABSTRACT

Automatic evaluation of machine translation (MT) is a critical tool driving the rapid iterative development of MT systems. While considerable progress has been made on estimating a single scalar quality score, current metrics lack the informativeness of more detailed schemes that annotate individual errors, such as Multidimensional Quality Metrics (MQM). In this paper, we help fill this gap by proposing AutoMQM, a prompting technique which leverages the reasoning and in-context learning capabilities of large language models (LLMs) and asks them to identify and categorize errors in translations. We start by evaluating recent LLMs, such as PaLM and PaLM-2, through simple score prediction prompting, and we study the impact of labeled data through in-context learning and finetuning. We then evaluate AutoMQM with PaLM-2 models, and we find that it improves performance compared to just prompting for scores (with particularly large gains for larger models) while providing interpretability through error spans that align with human annotations.

研究动机与目标

  • 为解决仅输出单一标量分数的自动机器翻译评估度量缺乏可解释性的问题。
  • 探究是否可利用大型语言模型(LLM)在极少人工标注数据下实现机器翻译中的细粒度错误检测。
  • 评估 LLM 在低资源语言对中的表现,此前的研究在此方面受限。
  • 在与人工判断的相关性方面,比较基于提示的方法(如 AutoMQM)与微调和分数预测基线的表现。
  • 探索利用 LLM 生成类似 MQM 的标注是否可行,且其标注结果是否与人工标注的错误片段对齐。

提出的方法

  • AutoMQM 是一种提示技术,指导 LLM 识别翻译中的错误片段,并使用包含错误类别和严重程度等级的 MQM 框架进行分类。
  • 该方法采用上下文学习,使用少量人工标注示例来引导 LLM 进行错误检测与分类,而无需完整微调。
  • 对 PaLM 和 PaLM-2 等 LLM 同时进行直接分数预测和通过 AutoMQM 的基于错误的评估提示,以比较不同设置下的性能表现。
  • 性能通过标准指标进行评估:皮尔逊相关系数(R)、平均倒数排名(MR),以及基于 F1 的片段精确率与召回率(SR、MR),分别在句子和词级别进行。
  • 该方法在多个语言对的 WMT22 测试集上进行评估,包括低资源语言对(如 ZH-EN),以检验其鲁棒性与可扩展性。
  • 该方法利用 LLM 的推理能力和上下文学习能力,生成可解释的、与人类对齐的错误标注,从而提供质量分数依据。

实验结果

研究问题

  • RQ1大型语言模型是否可通过提示技术有效实现基于 MQM 框架的可解释细粒度机器翻译评估?
  • RQ2在句子级别,AutoMQM 与仅输出分数的提示方法相比,与人工判断的相关性如何?
  • RQ3在人类标注的 MQM 数据上对 LLM 进行微调是否能提升性能,尤其对较小模型而言?
  • RQ4在数据稀缺的低资源语言对中,基于 LLM 的评估方法表现如何?
  • RQ5LLM 通过 AutoMQM 预测的错误片段在精确率与召回率方面与人工标注的错误片段对齐程度如何?

主要发现

  • 使用 AutoMQM 提示的 PaLM-2 模型在句子级别与人工判断的相关性高于仅输出分数的提示方法,尤其在大模型(如 Unicorn)上提升显著。
  • 使用 PaLM-2 Unicorn 的无参考版本 AutoMQM 在句子级别表现具有竞争力,与最佳学习型度量在相关性上相当(EN-DE 上 MCC = 0.143)。
  • AutoMQM 生成的错误片段能正确识别超过 50% 的主要错误中的词语,Unicorn 在 ZH-EN 上实现主要召回率(MR)为 0.476,与最先进词级别评估器相当。
  • AutoMQM 生成的分数分布与真实 MQM 分布更为接近,分数范围更广,且与人工标注范围对齐更好,优于仅输出分数的提示方法。
  • 在人类判断数据上对 LLM 进行微调能显著提升句子级别性能,尤其对较小模型(如 Bison)而言,显著缩小与最先进学习型度量的差距。
  • AutoMQM 在所有评估指标上均优于零样本分数预测,表明基于错误的提示能提供更丰富、更准确的评估结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。