[论文解读] Machine Translation Evaluation using Bi-directional Entailment
本文提出了一种基于微调 BERT 的双向文本蕴涵机制的新型机器翻译评估指标,用于衡量机器生成翻译与参考翻译之间的语义相似性。通过双向蕴涵评估,该方法在 WMT'14 数据集上与人类判断的相关性达到 0.957 的平均值,高于 BLEU 和 LAYERED 等传统指标,展现出在捕捉语义充分性方面的优越性能。
In this paper, we propose a new metric for Machine Translation (MT) evaluation, based on bi-directional entailment. We show that machine generated translation can be evaluated by determining paraphrasing with a reference translation provided by a human translator. We hypothesize, and show through experiments, that paraphrasing can be detected by evaluating entailment relationship in the forward and backward direction. Unlike conventional metrics, like BLEU or METEOR, our approach uses deep learning to determine the semantic similarity between candidate and reference translation for generating scores rather than relying upon simple n-gram overlap. We use BERT's pre-trained implementation of transformer networks, fine-tuned on MNLI corpus, for natural language inferencing. We apply our evaluation metric on WMT'14 and WMT'17 dataset to evaluate systems participating in the translation task and find that our metric has a better correlation with the human annotated score compared to the other traditional metrics at system level.
研究动机与目标
- 开发一种机器翻译评估指标,使其在捕捉语义相似性方面优于基于 n-gram 重叠的指标(如 BLEU)。
- 探究双向蕴涵是否可作为翻译质量评估中释义与语义等价性的可靠代理指标。
- 通过利用深度学习进行语义相似性计算而非词法重叠,提升系统级评估与人类判断的相关性。
- 评估微调后的 BERT 在 MNLI 上进行跨语言蕴涵任务在翻译评估中的有效性。
- 探究单向蕴涵的局限性,并提出一种基于乘积的评分机制,以惩罚语义关系不对称的情况。
提出的方法
- 在 MNLI 语料库上微调 BERT 的 base uncased 模型,构建用于翻译评估的句子对蕴涵分类器。
- 使用蕴涵模型计算候选翻译与参考翻译之间的正向和反向蕴涵得分。
- 将最终得分计算为正向与反向蕴涵概率的乘积,以强制实现双向语义等价性。
- 将该模型应用于 WMT’14 和 WMT’17 数据集,评估其系统级性能与人工标注得分的一致性。
- 使用 BERT 的分词器实现端到端分词,训练序列长度为 128,批量大小为 8,学习率为 2e-5,共训练 3 个周期。
- 采用单尾配对 t 检验,在 99% 置信水平下进行统计显著性检验以验证结果。
实验结果
研究问题
- RQ1双向蕴涵检测能否作为机器翻译评估中语义相似性的可靠度量?
- RQ2基于 BERT 的蕴涵模型与 BLEU 和 METEOR 等传统 n-gram 指标相比,在与人类判断的相关性方面表现如何?
- RQ3正向与反向蕴涵得分的乘积是否比单向得分更能反映人类对翻译质量的感知?
- RQ4与其它语义相似性方法相比,将 BERT 在 MNLI 上进行微调后,在翻译评估任务中的性能提升程度如何?
- RQ5所提出的指标是否能在系统级与人类评分的相关性上超越当前最先进指标(如 LAYERED 和 DiscoTK-Party)?
主要发现
- 在 WMT’14 数据集上,所提出的 Bi-Di-Ent 指标与人类判断的平均系统级相关性达到 0.957,优于 BLEU(0.871)和 LAYERED(0.915)。
- 在 WMT’17 上,Bi-Di-Ent 达到第二高的平均相关性(0.956),仅次于最高性能指标的 0.960,且在除 lv-en 和 tr-en 外的所有语言对上均优于 BLEU。
- 在 WMT’17 上,该指标在 de-en 和 ru-en 语言对中达到所有评估指标中的最高相关性。
- 统计显著性检验表明,结果在单尾配对 t 检验的 99% 置信水平下具有显著性。
- 人工分析表明,该指标对人类判断为更优的翻译赋予更高分,并能正确惩罚仅存在单向蕴涵(因语义泛化)的情况。
- 该方法表明,双向蕴涵是机器翻译中释义与语义充分性的强有力指标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。