[论文解读] Human-Paraphrased References Improve Neural Machine Translation
本文提出在训练和调优神经机器翻译(NMT)系统时,使用人类改写的参考译文而非标准参考译文。通过优化基于改写版本的BLEU(BLEU-P),系统在人类评分的流利度和充分性方面显著提升——尽管在标准参考译文上的BLEU分数下降了5点——表明改写参考译文作为人类评估的代理指标优于标准参考译文。
Automatic evaluation comparing candidate translations to human-generated paraphrases of reference translations has recently been proposed by Freitag et al. When used in place of original references, the paraphrased versions produce metric scores that correlate better with human judgment. This effect holds for a variety of different automatic metrics, and tends to favor natural formulations over more literal (translationese) ones. In this paper we compare the results of performing end-to-end system development using standard and paraphrased references. With state-of-the-art English-German NMT components, we show that tuning to paraphrased references produces a system that is significantly better according to human judgment, but 5 BLEU points worse when tested on standard references. Our work confirms the finding that paraphrased references yield metric scores that correlate better with human judgment, and demonstrates for the first time that using these scores for system development can lead to significant improvements.
研究动机与目标
- 探究在NMT系统开发过程中使用人类改写的参考译文作为目标是否能带来更好的人类评分翻译结果。
- 比较标准参考译文与改写参考译文对系统性能的影响,特别是在人类评估与标准BLEU分数方面的差异。
- 识别在NMT设计中哪些选择通过改写参考译文微调能获益,尤其是那些能提升翻译流利度与充分性的设计。
- 评估改写参考译文是否能缓解标准参考译文中固有的“翻译腔”偏差,该偏差倾向于偏好字面翻译而非自然表达。
提出的方法
- 作者使用相同的组件和超参数重新实现了WMT2019最佳英德NMT系统,但通过使用人类改写的参考译文替代标准参考译文进行模型的再训练与调优。
- 改写参考译文由语言学家对标准人工参考译文进行重述,以生成更自然、更流畅的表达形式。
- 系统同时使用标准BLEU和基于改写的BLEU(BLEU-P)进行调优,从而实现两种指标下的性能直接对比。
- 评估了关键系统组件(如回译、数据清洗、集成解码和重排序)对标准BLEU与BLEU-P分数的影响。
- 通过并列偏好测试和WMT newstest19的6分制充分性/流利度评分,开展了人工评估。
- 本研究将每项设计选择对标准与改写参考译文指标的影响进行隔离,以评估其相对重要性。
实验结果
研究问题
- RQ1使用人类改写的参考译文对神经机器翻译系统进行调优,是否能带来相比标准参考译文调优的更高人类评分翻译?
- RQ2诸如回译和集成等设计选择,在提升标准BLEU与基于改写的BLEU(BLEU-P)方面,其影响程度如何?
- RQ3在NMT系统开发中,改写参考译文能否作为比标准参考译文更可靠的代理指标来反映人类评估?
- RQ4为何在BLEU-P上优化的系统尽管标准BLEU下降5点,却获得了更高的真实人类评分?
主要发现
- 在改写参考译文上调优的系统在人工评估中获得4.72/6.0的充分性评分,显著优于在标准参考译文上调优的系统(4.27/6.0)。
- 在并列流利度评估中,改写优化系统的偏好得票率为63.8%,而标准参考译文调优模型仅为27.2%。
- 尽管在标准参考译文上的BLEU分数下降5点,改写优化系统在人类判断中仍表现出显著提升,表明标准BLEU在此情境下并非人类质量的可靠代理指标。
- 回译在BLEU-P上的影响大于在标准BLEU上,表明其有助于生成更自然、更接近改写风格的输出。
- 集成解码对BLEU-P的影响小于对标准BLEU的影响,表明该指标弱化了仅因常见或共识性预测而获得的性能提升。
- 结果证实,改写参考译文能减少对字面翻译‘翻译腔’的偏差,更准确地反映人类对自然、流畅翻译的偏好。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。