Skip to main content
QUICK REVIEW

[论文解读] MLQE-PE: A Multilingual Quality Estimation and Post-Editing Dataset

Marina Fomicheva, Shuo Sun|arXiv (Cornell University)|Oct 9, 2020
Natural Language Processing Techniques参考文献 21被引用 16
一句话总结

本文介绍了 MLQE-PE,一个用于机器翻译质量评估(QE)和自动后编辑(APE)的多语言数据集,涵盖11种语言对,包含句子级别的直接评估、词级别的好坏标签以及后编辑后的翻译。该数据集独特地提供了底层神经机器翻译(NMT)模型的访问权限,支持玻璃盒(glass-box)QE方法,并在高资源、中资源和低资源语言对上支持质量评估与后编辑任务,且在多种基准测试中取得了优异的实证结果。

ABSTRACT

We present MLQE-PE, a new dataset for Machine Translation (MT) Quality Estimation (QE) and Automatic Post-Editing (APE). The dataset contains eleven language pairs, with human labels for up to 10,000 translations per language pair in the following formats: sentence-level direct assessments and post-editing effort, and word-level good/bad labels. It also contains the post-edited sentences, as well as titles of the articles where the sentences were extracted from, and the neural MT models used to translate the text.

研究动机与目标

  • 为了解决现有QE数据集中缺乏公开可用的神经机器翻译(NMT)模型的问题,从而支持玻璃盒(glass-box)和基于不确定性的QE方法。
  • 在一个数据集中整合直接评估与后编辑工作量,使翻译质量与后编辑成本之间的相关性分析成为可能。
  • 包含中资源和低资源语言对(例如尼泊尔语-英语、僧伽罗语-英语),这些语言对在QE中最为需要但目前代表性不足。
  • 通过文章标题提供文档级别的上下文,提升上下文感知的质量评估能力。
  • 通过包含后编辑后的句子和参考译文,同时支持质量评估与自动后编辑(APE)研究。

提出的方法

  • 该数据集基于维基百科文章构建,使用最先进的开源神经机器翻译(NMT)模型(fairseq)提取句子并生成翻译。
  • 人工标注员对每种语言对的10,000个句子执行直接评估(DA)和后编辑任务,另额外提供2,000个句子用于零样本评估。
  • 为识别机器翻译输出中的错误,对词级别分配了“好”/“坏”标签。
  • 收集了后编辑后的句子,并与原始翻译和源语文本配对,用于APE的训练与评估。
  • 数据集包含文章标题,以支持在质量评估中进行文档级别的上下文建模。
  • 基线模型采用共享编码器-解码器架构,使用XLM-RoBERTa进行训练,并在直接评估(DA)和人类翻译错误率(HTER)任务上进行微调。

实验结果

研究问题

  • RQ1在多种语言对中,翻译质量的直接评估与后编辑工作量之间的相关性如何?
  • RQ2访问底层NMT模型在多大程度上能提升质量评估性能?
  • RQ3QE模型在高资源、中资源和低资源语言对上的泛化能力如何?
  • RQ4通过文章标题提供的文档级别上下文能否提升句子级别和词级别的质量评估性能?
  • RQ5统一模型在质量评估与后编辑任务上的性能表现如何?

主要发现

  • 在罗马尼亚语-英语语言对上,模型在直接评估任务上的皮尔逊相关系数达到0.818,表明在中资源语言对上表现优异。
  • 在HTER预测任务中,模型在罗马尼亚语-英语语言对上的相关系数达到0.862,表明其在估计后编辑工作量方面具有高度一致性。
  • 在词级别预测中,尼泊尔语-英语语言对的“坏”词F1得分达到0.828,表明在低资源语言对上表现强劲。
  • 所有语言对在词级别上“好”词的平均F1得分为0.717,表明对正确翻译的检测具有可靠性。
  • 所有语言对在直接评估上的平均皮尔逊相关系数为0.541,表明与人类判断具有中等到较强的对齐程度。
  • 该数据集已成功应用于WMT2020和WMT2021共享任务,验证了其在QE与APE研究中的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。