Skip to main content
QUICK REVIEW

[论文解读] Differentiable lower bound for expected BLEU score

V. B. Zhukov, Eugène Golikov|arXiv (Cornell University)|Dec 13, 2017
Topic Modeling参考文献 15被引用 6
一句话总结

本文提出了一种可微分的期望BLEU得分下界(LB),使得神经机器翻译模型能够通过梯度优化实现端到端训练,而无需像强化学习那样进行采样。该方法在IWSLT’14上实现了最高+1.23 BLEU点的提升,在WMT’14上实现了最高+1.53 BLEU点的提升,同时保持了计算效率和完全可微性,BLEU得分高于交叉熵或基于REINFORCE的训练方法。

ABSTRACT

In natural language processing tasks performance of the models is often measured with some non-differentiable metric, such as BLEU score. To use efficient gradient-based methods for optimization, it is a common workaround to optimize some surrogate loss function. This approach is effective if optimization of such loss also results in improving target metric. The corresponding problem is referred to as loss-evaluation mismatch. In the present work we propose a method for calculation of differentiable lower bound of expected BLEU score that does not involve computationally expensive sampling procedure such as the one required when using REINFORCE rule from reinforcement learning (RL) framework.

研究动机与目标

  • 通过优化与不可微分BLEU指标相关的代理损失,解决NLP中的损失-评估不匹配问题。
  • 消除基于强化学习的BLEU优化中计算成本高昂的REINFORCE式采样需求。
  • 开发一种完全可微分的训练目标,近似期望BLEU得分,且无需方差缩减技术。
  • 通过标准训练协议的简单修改,提升序列到序列翻译模型的泛化能力和最终BLEU性能。
  • 通过用所提出的LB损失替换最后的训练阶段,实现从交叉熵训练到BLEU优化训练的平滑过渡。

提出的方法

  • 使用独热编码的词序列将BLEU得分表示为矩阵形式,并通过矩阵乘积计算n-gram重叠。
  • 通过近似重叠计算中的min(1, v_y^n / v_x^n)项,定义期望BLEU得分的可微分下界(LB)。
  • 将LB构建为模型输出的可微函数,从而实现通过BLEU计算图的反向传播。
  • 对精确度估计应用加法平滑以提高训练稳定性:(LB[O_n] + 1) / (len_x - n + 2)。
  • 通过在后期训练阶段用LB损失替换交叉熵损失,将LB损失集成到标准训练流程中。
  • 使用带有注意力机制和教师强制的标准序列到序列模型,采用Adam优化器,并为REINFORCE训练降低初始学习率。

实验结果

研究问题

  • RQ1能否在不依赖采样的前提下,构建期望BLEU得分的可微分下界,如REINFORCE方法所示?
  • RQ2优化该下界是否能带来相比标准交叉熵训练更高的最终BLEU得分?
  • RQ3与基于REINFORCE的直接BLEU优化相比,所提出的LB损失在BLEU增益和训练效率方面表现如何?
  • RQ4LB损失在多大程度上减少了序列生成任务中的损失-评估不匹配?
  • RQ5LB损失能否在最小化架构修改的前提下,无缝集成到标准训练协议中?

主要发现

  • 在IWSLT’14 DE-EN数据集上,使用束搜索大小为1时,优化所提出的可微分下界(LB)损失,BLEU得分为27.83 ± 0.17,优于交叉熵(26.60 ± 0.14)和REINFORCE(27.16 ± 0.18)。
  • 在WMT’14 DE-EN数据集上,LB损失在束搜索大小为1时达到18.65 ± 0.13 BLEU,超过交叉熵(17.12 ± 0.2),表明在大规模数据集上具有持续的性能提升。
  • 当束搜索大小为5时,LB损失在WMT’14上达到19.23 ± 0.19 BLEU,略高于交叉熵(19.03 ± 0.15),表明在较高束搜索大小下具有更好的鲁棒性。
  • LB损失消除了强化学习中对方差缩减技术与采样的依赖,简化了训练流程。
  • 该方法在BLEU得分上优于交叉熵和REINFORCE基线模型,最大提升达+1.23 BLEU点(IWSLT’14)。
  • LB损失计算高效且完全可微,支持端到端训练,无需引入采样或复杂正则化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。