[论文解读] Minimum Bayes Risk Decoding with Neural Metrics of Translation Quality.
本文提出使用最小贝叶斯风险(MBR)解码并结合神经评分指标(如BLEURT),通过优化人类评分的翻译质量而非表面指标来提升机器翻译质量。该方法生成的翻译虽然似然度较低,但与人类判断的相关性显著提高,在自动评估和人类评估中均优于标准束搜索。
This work applies Minimum Bayes Risk (MBR) decoding to optimize diverse automated metrics of translation quality. Automatic metrics in machine translation have made tremendous progress recently. In particular, neural metrics, fine-tuned on human ratings (e.g. BLEURT, or COMET) are outperforming surface metrics in terms of correlations to human judgements. Our experiments show that the combination of a neural translation model with a neural reference-based metric, BLEURT, results in significant improvement in automatic and human evaluations. This improvement is obtained with translations different from classical beam-search output: these translations have much lower likelihood and are less favored by surface metrics like BLEU.
研究动机与目标
- 通过优化神经评分指标而非BLEU等表面指标来提升机器翻译质量。
- 探究使用基于参考的神经评分指标进行MBR解码是否能更好地与人类判断对齐。
- 探讨神经机器翻译输出中似然度与质量之间的权衡。
- 评估BLEURT等神经评分指标在标准束搜索之外的解码策略中的影响。
提出的方法
- 应用最小贝叶斯风险(MBR)解码,选择在神经评分指标(如BLEURT)下期望损失最小的翻译。
- 在解码过程中使用微调后的神经评分指标(如BLEURT)作为损失函数,替代传统的n-gram或表面指标。
- 生成多样化的翻译候选,并根据神经评分指标选择期望风险最低的输出。
- 采用以MBR目标为条件的神经翻译模型,优先选择在人类评分质量指标上得分更高的输出。
- 将基于参考的神经评分指标整合到解码过程中,引导生成更高质量的翻译。
实验结果
研究问题
- RQ1使用BLEURT等神经评分指标进行MBR解码是否能将翻译质量提升至超过标准束搜索的水平?
- RQ2与束搜索输出相比,MBR生成的翻译在人类评估和自动指标上的表现如何?
- RQ3尽管似然度较低,MBR输出在多大程度上仍能与人类判断保持更高相关性?
- RQ4在解码过程中使用基于参考的神经评分指标是否能生成更自然或更流畅的翻译?
主要发现
- 使用BLEURT的MBR解码生成的翻译与人类判断的对齐程度显著优于束搜索输出。
- MBR生成的翻译在自动指标(如BLEURT、COMET)和人类评估中均获得更高分数。
- 尽管似然度较低,MBR输出在人类评估中仍优于束搜索,表明在流畅性与质量之间进行权衡是有益的。
- 该方法生成的翻译在BLEU等表面指标上得分较低,凸显了n-gram基指标的局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。