Skip to main content
QUICK REVIEW

[论文解读] Long Text Generation by Modeling Sentence-Level and Discourse-Level Coherence

Jian Guan, Xiaoxi Mao|arXiv (Cornell University)|May 19, 2021
Topic Modeling参考文献 32被引用 4
一句话总结

本文提出 Hint,一种长文本生成模型,通过在解码过程中学习句子级和话语级表征来提升连贯性。通过引入专用标记和预训练目标——句子间相似性预测与句子顺序判别——Hint 在保持逻辑事件序列和减少不连贯重复方面显著优于 BART 等强基线模型。

ABSTRACT

Generating long and coherent text is an important but challenging task, particularly for open-ended language generation tasks such as story generation. Despite the success in modeling intra-sentence coherence, existing generation models (e.g., BART) still struggle to maintain a coherent event sequence throughout the generated text. We conjecture that this is because of the difficulty for the decoder to capture the high-level semantics and discourse structures in the context beyond token-level co-occurrence. In this paper, we propose a long text generation model, which can represent the prefix sentences at sentence level and discourse level in the decoding process. To this end, we propose two pretraining objectives to learn the representations by predicting inter-sentence semantic similarity and distinguishing between normal and shuffled sentence orders. Extensive experiments show that our model can generate more coherent texts than state-of-the-art baselines.

研究动机与目标

  • 为解决开放域文本生成中保持长距离连贯性的挑战,特别是在故事和小说生成中的应用。
  • 改进现有模型仅关注标记级共现但未能捕捉高层语义和话语结构的问题。
  • 开发一种在解码过程中能够理解并表征上下文的生成模型,涵盖句子级和话语级两个层面。
  • 设计预训练目标,明确教导模型预测句子间的语义相似性,并区分正确与打乱的句子顺序。
  • 评估高层表征是否能生成更连贯且逻辑结构更清晰的长篇文本。

提出的方法

  • 在每个句子后引入特殊标记 [S] 和 [D],以在解码器中实现句子级和话语级表征学习。
  • 使用三项预训练目标进行模型预训练:下一项标记预测、利用 SentenceBERT 作为教师的句子间语义相似性预测,以及正常序列与打乱序列之间的句子顺序判别。
  • 使用 SentenceBERT 提供高质量的句子嵌入用于相似性预测,使模型能够学习有意义的句子级表征。
  • 训练话语级表征以区分正确顺序与打乱顺序的句子序列,从而促使模型学习时间与逻辑依赖关系。
  • 在故事和小说生成任务上微调模型,解码过程中使用学习到的高层表征。
  • 通过自动评估与人工标注相结合的方式,评估模型在连贯性、流畅性及语言建模性能方面在连贯与不连贯输入上的表现。

实验结果

研究问题

  • RQ1建模句子级和话语级表征是否能提升开放生成中长文本的连贯性?
  • RQ2在句子间相似性与句子顺序判别上进行预训练,是否能增强模型维持逻辑事件序列的能力?
  • RQ3高层表征的引入如何影响模型在连贯与不连贯输入上的语言建模表现?
  • RQ4句子级与话语级表征在不同类型连贯性(如因果、时间、否定)中的贡献程度如何?
  • RQ5所提出的方法是否能在不同生成任务和模型架构间实现泛化?

主要发现

  • 在故事和小说生成的人工评估中,Hint 显著优于 BART 及其他强基线模型,连贯性得分具有统计显著性提升(p < 0.01)。
  • 模型在连贯样本上表现出更低的困惑度,在不连贯样本上表现出更高的困惑度,表明其对高层连贯性的建模能力更强。
  • 消融实验表明,句子级表征在相关性、否定和语义重复任务上提升性能,而话语级表征在因果与时间关系任务上最为有效。
  • 模型在保持与基线相当的流畅性的同时实现了更优的连贯性,表明性能提升并非源于表面流畅性的改善。
  • 使用 SentenceBERT 作为相似性预测的教师模型,有助于模型学习更具语义意义的句子级表征。
  • 错误分析显示,Hint 显著减少了 BART 生成故事中常见的重复情节与逻辑不一致问题,尤其在事件排序与因果逻辑方面。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。