Skip to main content
QUICK REVIEW

[论文解读] "Bilingual Expert" Can Find Translation Errors

Kai Fan, Jiayi Wang|arXiv (Cornell University)|Jul 25, 2018
Natural Language Processing Techniques参考文献 20被引用 3
一句话总结

本文提出了一种新颖的神经双语专家模型——基于双向变换器构建的条件目标语言模型,该模型在大规模平行语料上进行预训练,以提取翻译质量评估(QE)所需的联合源-目标表征,且无需黄金参考译文。通过将这些特征与四维不匹配特征结合,并使用双向LSTM预测器,该方法在WMT 2017/2018 QE基准上实现了最先进性能,展现出强大的零参考QE能力,并具备统一质量评估与自动后编辑(APE)的潜力。

ABSTRACT

Recent advances in statistical machine translation via the adoption of neural sequence-to-sequence models empower the end-to-end system to achieve state-of-the-art in many WMT benchmarks. The performance of such machine translation (MT) system is usually evaluated by automatic metric BLEU when the golden references are provided for validation. However, for model inference or production deployment, the golden references are prohibitively available or require expensive human annotation with bilingual expertise. In order to address the issue of quality evaluation (QE) without reference, we propose a general framework for automatic evaluation of translation output for most WMT quality evaluation tasks. We first build a conditional target language model with a novel bidirectional transformer, named neural bilingual expert model, which is pre-trained on large parallel corpora for feature extraction. For QE inference, the bilingual expert model can simultaneously produce the joint latent representation between the source and the translation, and real-valued measurements of possible erroneous tokens based on the prior knowledge learned from parallel data. Subsequently, the features will further be fed into a simple Bi-LSTM predictive model for quality evaluation. The experimental results show that our approach achieves the state-of-the-art performance in the quality estimation track of WMT 2017/2018.

研究动机与目标

  • 为解决在真实部署中难以获取昂贵的黄金参考译文时的翻译质量评估(QE)挑战。
  • 开发一种通用的自动QE框架,利用大规模平行语料作为先验知识。
  • 通过在低质量翻译的插入/删除操作上进行间隙预测来训练条件语言模型,实现质量评估与自动后编辑(APE)的统一。
  • 通过结合预训练的双语特征与预测和实际翻译标记之间的学习到的不匹配特征,提升QE性能。
  • 证明可使用单一预训练模型同时支持QE与APE,减少对独立、任务特定模型的依赖。

提出的方法

  • 在大规模单语平行语料上使用双向变换器解码器预训练神经双语专家模型,以学习联合的源-目标潜在表征。
  • 利用预训练模型为给定源句生成目标标记的条件概率分布,从而实现缺失或错误标记的间隙预测。
  • 通过比较模型在每个标记位置的预测标记分布与实际机器翻译输出,提取四维不匹配特征。
  • 将提取的特征——包括模型生成的特征与不匹配特征——输入到简单的双向LSTM架构中,实现端到端的质量评估。
  • 通过使用可学习的稀疏矩阵对子词特征进行平均以支持BPE分词,实现分词过程中的可微反向传播。
  • 通过将插入/删除操作建模为间隙预测,将框架扩展为支持QE与APE的联合训练,未来工作将探索端到端优化。

实验结果

研究问题

  • RQ1基于平行数据的预训练条件语言模型能否作为零参考翻译质量评估的稳健先验?
  • RQ2四维不匹配特征在无参考译文的情况下检测翻译错误的效率如何?
  • RQ3同一预训练双语模型能否同时支持质量评估与自动后编辑?
  • RQ4BPE分词是否能提升QE性能,以及如何将其集成到具有可微操作的特征提取流程中?
  • RQ5能否通过单一预训练模型实现统一框架,联合优化质量评估与自动后编辑?

主要发现

  • 所提方法在WMT 2017和2018翻译质量评估基准的大多数公开数据集上实现了最先进性能。
  • 即使仅使用四维不匹配特征且未进行额外模型微调,该方法仍取得具有竞争力的结果,证明了特征设计的鲁棒性。
  • BPE分词的使用提升了在词级别标注任务上的QE性能,尤其在对预测分数进行阈值调优时效果更明显。
  • 预训练的双语专家模型可实现缺失标记的间隙预测,可直接用于自动后编辑,表明QE与APE存在统一路径。
  • 该框架支持在BPE分词下的可微特征提取,为未来实现QE与APE组件的联合训练提供了可能。
  • 该模型在无需黄金参考译文的情况下检测翻译错误的能力,使其适用于生产环境中端到端机器翻译系统的实际部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。