Skip to main content
QUICK REVIEW

[论文解读] Confidence through Attention

Matīss Rikters, Mark Fishel|arXiv (Cornell University)|Oct 10, 2017
Natural Language Processing Techniques参考文献 18被引用 20
一句话总结

本文提出使用神经机器翻译(NMT)模型的注意力分布作为置信度度量,以评估翻译质量。通过量化诸如翻译不足、过度翻译和未对齐词符等错位现象,该方法在英语-德语和英语-拉脱维亚语任务中,将翻译过滤的BLEU得分提升最高达2.22点,混合系统选择的BLEU得分提升0.99点。

ABSTRACT

Attention distributions of the generated translations are a useful bi-product of attention-based recurrent neural network translation models and can be treated as soft alignments between the input and output tokens. In this work, we use attention distributions as a confidence metric for output translations. We present two strategies of using the attention distributions: filtering out bad translations from a large back-translated corpus, and selecting the best translation in a hybrid setup of two different translation systems. While manual evaluation indicated only a weak correlation between our confidence score and human judgments, the use-cases showed improvements of up to 2.22 BLEU points for filtering and 0.99 points for hybrid translation, tested on EnglishGerman and EnglishLatvian translation.

研究动机与目标

  • 通过将注意力分布用作翻译质量的代理指标,开发一种NMT输出的置信度度量方法。
  • 解决在大规模后翻译流水线中识别低质量翻译的挑战。
  • 通过基于注意力的置信度选择两个NMT系统中最佳输出,改进混合翻译系统。
  • 提供一种事后、与模型无关的置信度估计方法,无需重新训练或额外监督。
  • 评估该度量与人类判断及BLEU等自动指标的一致性。

提出的方法

  • 通过测量翻译不足(缺失源词符)、过度翻译(多余目标词符)和未对齐输入/输出词符,定义基于注意力的置信度分数。
  • 计算三个分量:CDP(覆盖率偏差惩罚)、AP_in(每个输入词符的平均注意力)和AP_out(每个输出词符的平均注意力),以量化错位程度。
  • 通过丢弃置信度得分最低的50%样本,将置信度分数应用于后翻译流水线中低质量翻译的过滤。
  • 通过选择置信度得分更高的输出,利用置信度分数在两个NMT系统之间执行混合选择。
  • 实现并发布开源工具,用于评分、过滤、混合选择以及可视化注意力对齐情况。
  • 在200个句子上进行人工手动评估,将基于置信度的选择与人类偏好进行比较。

实验结果

研究问题

  • RQ1NMT模型的注意力分布能否作为翻译质量的可靠置信度度量?
  • RQ2基于注意力的置信度分数在过滤低质量后翻译输出方面有多有效?
  • RQ3与仅使用BLEU分数相比,该置信度分数在混合翻译选择中能多大程度上提升性能?
  • RQ4该置信度分数与人类对翻译质量的判断有多高的相关性?
  • RQ5该置信度分数是否可在低资源设置下或在质量差异较大的系统中有效使用?

主要发现

  • 在英语-德语和英语-拉脱维亚语翻译任务中,基于注意力的置信度分数在后翻译过滤中最高实现了2.22 BLEU点的提升。
  • 在混合翻译选择中,该方法使BLEU得分提升了0.99点,证明了其在整合两个NMT系统输出方面的有效性。
  • 置信度分数与人类判断表现出中等程度的相关性,在四个语种对中,人类评估者与基于置信度的选择在偏好翻译上的重叠率为57%至62.5%。
  • 在四个翻译方向中的三个,人类评估者更倾向于选择BLEU分数较低的系统,表明BLEU本身作为质量代理指标效果较差。
  • 在混合设置中,该置信度度量优于简单的BLEU基选择方法,尤其当两个系统性能相近时效果更明显。
  • 即使系统质量差异显著,该方法依然有效,但弱模型的置信度可能具有误导性,提示应与质量估计模型结合使用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。