Skip to main content
QUICK REVIEW

[论文解读] Straight to the Gradient: Learning to Use Novel Tokens for Neural Text Generation

Xiang Lin, Simeng Han|arXiv (Cornell University)|Jun 14, 2021
Topic Modeling被引用 8
一句话总结

本文提出 ScaleGrad,一种在反向传播过程中直接修改梯度的训练目标,以鼓励神经文本生成模型使用新颖、多样的标记,而非重复的标记。通过基于标记频率缩放梯度,ScaleGrad 在无需架构修改的情况下,在开放式和定向文本生成任务中均提升了生成质量,优于标准最大似然估计(MLE)及其他基于训练的方法,在人工与自动评估中表现更优。

ABSTRACT

Advanced large-scale neural language models have led to significant success in many language generation tasks. However, the most commonly used training objective, Maximum Likelihood Estimation (MLE), has been shown problematic, where the trained model prefers using dull and repetitive phrases. In this work, we introduce ScaleGrad, a modification straight to the gradient of the loss function, to remedy the degeneration issue of the standard MLE objective. By directly maneuvering the gradient information, ScaleGrad makes the model learn to use novel tokens. Empirical results show the effectiveness of our method not only in open-ended generation, but also in directed generation tasks. With the simplicity in architecture, our method can serve as a general training objective that is applicable to most of the neural text generation tasks.

研究动机与目标

  • 为解决使用最大似然估计(MLE)训练的神经语言模型中持续存在的重复、呆板文本生成问题。
  • 开发一种基于训练的解决方案,在梯度层面修改学习信号,以鼓励模型探索罕见或新颖的标记。
  • 创建一种简单、与架构无关的方法,适用于多种神经文本生成任务,包括摘要生成、对话和文本续写。
  • 在定向生成场景中,实现超越基于解码方法(如核采样)所能达到的生成质量。
  • 证明直接修改梯度更新可获得优于标准 MLE 或辅助损失方法的标记级分布。

提出的方法

  • ScaleGrad 通过在反向传播期间根据每个预测标记的频率反向缩放损失函数的梯度来修改损失函数的梯度。
  • 该方法对梯度应用基于频率的缩放因子,使稀有标记获得更高的更新,而频繁标记获得更低的更新,从而鼓励模型探索新颖标记。
  • 梯度缩放直接应用于交叉熵损失,使其可作为标准 MLE 训练的即插即用替代方案,无需架构修改。
  • 缩放因子基于训练数据中每个标记的频率计算,确保低频标记获得更强的梯度信号。
  • 该方法兼容 RNN(LSTM)和 Transformer 模型,并可在训练中使用教师强制策略。
  • 它与温度缩放或基于采样的解码策略不同,因为它在优化过程中直接改变了基本学习信号。

实验结果

研究问题

  • RQ1能否通过直接操纵梯度信号来提升神经序列模型生成文本的多样性和质量?
  • RQ2基于标记频率修改梯度是否能减少开放式和定向文本生成任务中的重复与呆板现象?
  • RQ3在生成质量方面,ScaleGrad 与核采样或 top-k 采样等基于解码的方法相比如何,特别是在定向生成中?
  • RQ4简单的梯度级修改能否优于使用辅助损失或覆盖向量等更复杂的基于训练的方法?
  • RQ5ScaleGrad 在不同架构(如 LSTM、Transformer)和多样化的文本生成任务中是否均有效?

主要发现

  • ScaleGrad 显著减少了多个数据集(包括 PTB、IMDB 和 CNN/DM 摘要数据集)上的重复现象,并提升了文本的流畅性与多样性。
  • 在人工评估中,ScaleGrad 生成的文本在开放式生成任务中被评价为比 MLE 和 Unlikelihood 训练模型更具多样性和吸引力。
  • 在 CNN/DM 摘要数据集上,ScaleGrad 达到了 ROUGE-1 为 44.3 和 ROUGE-L 为 22.1 的成绩,优于 MLE 和其他基于训练的基线方法。
  • 在抽象摘要等定向生成任务中,ScaleGrad 超过了核采样和 top-k 采样,后者在这些任务中未能生成高质量输出。
  • 该方法在 LSTM 和 Transformer 架构上均一致地提升了生成质量,证明了其广泛适用性。
  • 消融研究证实,基于频率的梯度缩放是关键组件,移除后性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。