Skip to main content
QUICK REVIEW

[论文解读] Discourse-Aware Neural Rewards for Coherent Text Generation

Antoine Bosselut, Aslı Çelikyılmaz|arXiv (Cornell University)|May 10, 2018
Topic Modeling参考文献 34被引用 7
一句话总结

本文提出了一种基于两种类型神经教师——绝对顺序与相对顺序——的对话感知神经奖励机制,通过强化学习提升长文本生成的连贯性。通过在食谱的句子排序模式上训练教师模型,该方法生成的文本比交叉熵或标准强化学习基线模型更具连贯性且重复性更低。

ABSTRACT

In this paper, we investigate the use of discourse-aware rewards with reinforcement learning to guide a model to generate long, coherent text. In particular, we propose to learn neural rewards to model cross-sentence ordering as a means to approximate desired discourse structure. Empirical results demonstrate that a generator trained with the learned reward produces more coherent and less repetitive text than models trained with cross-entropy or with reinforcement learning with commonly used scores as rewards.

研究动机与目标

  • 解决现有文本生成模型在高n-gram重叠度得分下仍无法生成连贯长文本的问题。
  • 克服BLEU和ROUGE等自动指标的局限性,这些指标侧重于局部模式,难以反映话语结构。
  • 开发一种无需人工标注奖励信号的方法,使生成器能够学习全局话语结构。
  • 通过隐式学习食谱中类似脚本的时序模式,利用神经教师提升文本生成质量。
  • 通过基于相对顺序得分的句子级奖励分配,改善策略学习中的信用分配机制。

提出的方法

  • 训练一个绝对顺序教师模型,通过使用基于GRU的编码器与词袋句子嵌入,最小化正向与反向句子序列之间的相似度。
  • 训练一个相对顺序教师模型,比较正向与反向顺序下不同长度(3–6个句子)的子序列,以捕捉长距离连贯性。
  • 将两个教师模型的输出作为密集奖励,集成到生成器的自critical强化学习框架中。
  • 设计一种双通道奖励机制,将生成序列与正向和反向的黄金序列进行比较,以防止奖励利用。
  • 实施一种混合训练目标,结合最大似然估计(MLE)与策略梯度学习,并引入系数γ以平衡稳定性与优化效果。
  • 基于相对顺序得分分配句子级奖励,以提升信用分配效率与模型学习效率。

实验结果

研究问题

  • RQ1能否通过建模句子排序模式的神经奖励,使长文本生成的连贯性超越基于n-gram的指标?
  • RQ2使用无监督、对话感知的神经教师与使用BLEU或ROUGE等自动指标的标准强化学习相比,表现如何?
  • RQ3在奖励函数中同时引入正向与反向序列比较,是否能防止奖励欺骗并提升鲁棒性?
  • RQ4超参数ℓ_max与γ对策略优化生成器性能的影响程度如何?
  • RQ5所学习的神经教师能否隐式捕捉食谱中类似脚本的时序结构,如食材准备、烹饪步骤与上菜顺序?

主要发现

  • 使用对话感知神经奖励训练的生成器,其生成的文本连贯性显著优于使用交叉熵或标准强化学习训练的模型。
  • 人工评估确认,该方法的主要改进体现在长序列上的语义连贯性,而不仅仅是表面流畅性。
  • 相对顺序教师在ℓ_max = 6时表现最佳,表明长距离上下文建模有助于提升连贯性。
  • γ值为0.97时在MLE稳定性与策略学习效率之间达到最佳平衡,较低值导致欠拟合,较高值则会损害语言模型性能。
  • 同时与正向和反向序列进行双重比较,有效减少了奖励利用现象,例如在简单序列如“Serve.”和“Here’s direction.”中表现更稳健。
  • 该方法在衡量话语结构的自动指标上优于强基线模型,表明其与人类对连贯性的判断高度一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。