[论文解读] Beyond BLEU: Training Neural Machine Translation with Semantic Similarity
本文提出 SimiLe,一种基于连续语义相似度的奖励函数,用于训练神经机器翻译(NMT)模型,替代传统的基于 BLEU 的优化方法。通过利用预训练的句子嵌入模型,衡量生成翻译与参考翻译之间的语义相似度,SimiLe 允许对语义正确但词汇不同的输出给予部分得分,从而在四个语种对上实现更快的收敛速度和在 BLEU、语义相似度以及人工评估中性能的提升。
While most neural machine translation (NMT) systems are still trained using maximum likelihood estimation, recent work has demonstrated that optimizing systems to directly improve evaluation metrics such as BLEU can substantially improve final translation accuracy. However, training with BLEU has some limitations: it doesn't assign partial credit, it has a limited range of output values, and it can penalize semantically correct hypotheses if they differ lexically from the reference. In this paper, we introduce an alternative reward function for optimizing NMT systems that is based on recent work in semantic similarity. We evaluate on four disparate languages translated to English, and find that training with our proposed metric results in better translations as evaluated by BLEU, semantic similarity, and human evaluation, and also that the optimization procedure converges faster. Analysis suggests that this is because the proposed metric is more conducive to optimization, assigning partial credit and providing more diversity in scores than BLEU.
研究动机与目标
- 为解决 BLEU 作为 NMT 训练目标时的局限性,特别是其缺乏部分得分以及对词汇变化的敏感性。
- 探索连续的、基于语义相似度的度量是否可作为比 n-gram 精度更有效且更稳定的训练信号。
- 通过鼓励语义准确的翻译,不仅提升自动度量的表现,也提升人工评估中的表现。
- 证明优化语义相似度可实现更快的收敛速度和更好的泛化能力。
提出的方法
- 该方法使用在释义数据上预训练的句子嵌入模型,计算生成翻译与参考翻译之间的语义相似度。
- 奖励函数 SimiLe 定义为生成假设的嵌入与参考翻译之间的余弦相似度。
- 使用子词单元(例如 BPE 标记)来构建句子嵌入,相较于词级别或字符三元组方法,提升了性能和效率。
- 应用长度惩罚以抑制过短的翻译。
- 使用最小风险训练(MRT)对模型进行微调,基于 SimiLe 奖励反向传播梯度,以优化更高的语义相似度。
- 该方法在 WMT 2018 基准的四个英译语种翻译任务上进行了评估。
实验结果
研究问题
- RQ1像 SimiLe 这样的连续语义相似度度量能否在神经机器翻译中超越 BLEU 作为训练目标?
- RQ2优化语义相似度是否能带来更好的泛化能力,并在自动度量和人工评估指标上均实现性能提升?
- RQ3与 BLEU 相比,SimiLe 在优化稳定性和收敛速度方面表现如何?
- RQ4与 BLEU 相比,SimiLe 在多大程度上减少了对语义正确但词汇上存在差异的翻译的惩罚?
- RQ5使用 SimiLe 训练是否能更准确地翻译语义重要的词汇?
主要发现
- 使用 SimiLe 训练的 NMT 模型在所有四个语种对(捷克语、德语、俄语、土耳其语)译为英语的任务中,BLEU 分数均有显著提升,表明与标准评估指标的对齐性更好。
- 与 BLEU 训练的模型相比,SimiLe 训练的模型在语义相似度得分上更高,证明其与语义内容的对齐性更优。
- 人工评估显示,除一种语言外,所有语言的翻译质量均达到统计显著提升,证实 SimiLe 能带来更自然、更准确的翻译。
- 由于语义相似度度量提供了更连续且信息更丰富的梯度信号,优化过程在 SimiLe 下收敛更快。
- 分析表明,与 BLEU 相比,SimiLe 更能促使模型更准确地保留语义重要的词汇。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。