Skip to main content
QUICK REVIEW

[论文解读] Improving Language Generation with Sentence Coherence Objective

Ruixiao Sun, Jie Yang|arXiv (Cornell University)|Sep 7, 2020
Topic Modeling参考文献 9被引用 4
一句话总结

本文提出一种两阶段方法,通过微调基于 GPT-2 的一致性分类器,并使用 REINFORCE 算法通过强化学习目标联合训练语言模型,以改善条件文本生成中的主题连贯性。该方法显著减少了长文本生成中的主题漂移,同时保持了较高的连贯性,尽管在流畅性方面略有损失。

ABSTRACT

Conditional story generation and contextual text continuation have become increasingly popular topics in NLP community. Existing models are often prone to output paragraphs of texts that gradually diverge from the given prompt. Although the generated text may have a reasonable perplexity and diversity, it could easily be identified by human as gibberish. The goal of our project is to improve the coherence and consistency across sentences in a language-generation model. We aim to solve this issue by first training a sentence pair coherence classifier with GPT-2 pretrained model, and then co-train the GPT-2 language model with this new coherence objective using a method analogous to the REINFORCE algorithm. This fine-tuned language model is able to generate lengthy paragraph conditioned on a given topic without diverging too much. The simplicity of this model allows it to be applicable to a variety of underlying language model architecture since it only modifies the final layer of the pre-trained model.

研究动机与目标

  • 解决条件文本生成中的主题漂移问题,即自回归模型(如 GPT-2)逐渐偏离提示文本。
  • 在不修改底层语言模型架构的前提下,增强生成文本与输入提示之间的一致性。
  • 开发一种可训练的轻量化一致性目标,可通过强化学习集成到预训练模型中。
  • 评估微调的一致性目标是否能在保持流畅性的同时,提升长文本生成的一致性。

提出的方法

  • 微调一个 GPT-2 模型,通过在段落相邻句对与随机句对上进行二分类任务,以预测句子对的一致性。
  • 使用微调后的 GPT-2 的 [CLS] token 表示作为句子嵌入,用于一致性预测。
  • 在句子嵌入之上训练一个逻辑回归头,以预测两个句子是否属于同一段落。
  • 使用 REINFORCE 算法,通过强化学习目标联合训练 GPT-2 语言模型,以最大化生成文本与提示之间的一致性。
  • 在第二轮训练之后引入基于一致性分类器输出的加权辅助损失,以稳定学习过程。
  • 在生成过程中应用一致性目标,通过分类器得分引导下一个词的预测,使其与提示的主题保持一致。

实验结果

研究问题

  • RQ1微调后的 GPT-2 模型能否作为有效的句子一致性分类器,用于检测句子间的话题一致性?
  • RQ2通过 REINFORCE 优化的一致性目标联合训练语言模型,是否能减少长文本条件生成中的主题漂移?
  • RQ3与标准 GPT-2 相比,引入一致性目标如何影响生成文本的流畅性和自然度?
  • RQ4该一致性目标能否以最小的架构修改应用于任何预训练的 Transformer 模型?
  • RQ5训练调度(如延迟引入一致性目标)对收敛性和性能有何影响?

主要发现

  • 一致性分类器在测试集上达到 94.21% 的准确率,接近人类水平表现(92%),并优于交叉注意力基线模型(94.52%)。
  • 联合训练模型显示出一致性损失随时间递减的趋势,表明尽管存在梯度噪声,REINFORCE 算法仍能有效优化。
  • 验证集上的困惑度收敛至 15,表明语言建模性能稳定。
  • 联合训练模型生成的文本在主题一致性方面显著优于标准 GPT-2,且在长序列中与提示的偏离程度更低。
  • 对提示嵌入进行非线性变换优于线性投影,后者导致输出退化、重复。
  • 该模型在保持强一致性的前提下,与原始 GPT-2 相比,词法选择和语法的流畅性与自然度略有下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。