Skip to main content
QUICK REVIEW

[论文解读] Towards Coherent and Consistent Use of Entities in Narrative Generation

Pinelopi Papalampidi, Kris Cao|arXiv (Cornell University)|Feb 3, 2022
Topic Modeling被引用 9
一句话总结

本文提出了一种用于大规模预训练语言模型的动态实体记忆模块,以提升叙事生成中的实体连贯性与一致性。通过将可学习的实体记忆与标记级实体注释结合使用交叉注意力机制,该模型显著增强了长距离实体追踪能力,尤其在上下文窗口受限的情况下表现突出,该结论得到了自动指标与人工评估的双重验证。

ABSTRACT

Large pre-trained language models (LMs) have demonstrated impressive capabilities in generating long, fluent text; however, there is little to no analysis on their ability to maintain entity coherence and consistency. In this work, we focus on the end task of narrative generation and systematically analyse the long-range entity coherence and consistency in generated stories. First, we propose a set of automatic metrics for measuring model performance in terms of entity usage. Given these metrics, we quantify the limitations of current LMs. Next, we propose augmenting a pre-trained LM with a dynamic entity memory in an end-to-end manner by using an auxiliary entity-related loss for guiding the reads and writes to the memory. We demonstrate that the dynamic entity memory increases entity coherence according to both automatic and human judgment and helps preserving entity-related information especially in settings with a limited context window. Finally, we also validate that our automatic metrics are correlated with human ratings and serve as a good indicator of the quality of generated stories.

研究动机与目标

  • 系统分析预训练语言模型在长篇叙事生成过程中维持实体连贯性与一致性的局限性。
  • 识别出当前模型在长篇叙事中,尤其在上下文窗口受限时,难以保持与实体相关的信息。
  • 提出一种端到端可训练的动态实体记忆机制,以增强实体连贯性,同时不损害流畅性或一致性。
  • 验证所提出的自动指标是否与人类判断相关,并可作为叙事质量的可靠指标。

提出的方法

  • 提出一组自动指标——连贯性(C)、控制(精确匹配与子集匹配)和一致性(V)——以量化生成故事中的实体使用情况。
  • 在预训练语言模型中引入动态实体记忆模块,通过在每个Transformer层使用交叉注意力机制存储并更新实体表示。
  • 引入门控机制,将上下文上的自注意力与实体记忆上的交叉注意力相结合,实现多实体条件控制。
  • 在训练过程中,利用标准标注的标记级实体注释对交叉注意力得分进行正则化,以指导记忆的读写操作。
  • 通过引入辅助的与实体相关的损失函数,端到端训练整个模型,以提升实体记忆的利用效率与连贯性。
  • 在两个叙事数据集——WritingPrompts 和 WikiPlots 上进行评估,通过调整上下文窗口大小来模拟长篇生成任务。

实验结果

研究问题

  • RQ1当前的预训练语言模型在长篇叙事生成中维持实体连贯性与一致性的表现如何?
  • RQ2用于实体连贯性与一致性的自动指标与人类判断的相关性有多大?
  • RQ3在上下文窗口受限的条件下,动态实体记忆能否提升实体连贯性并保留与实体相关的信息?
  • RQ4与原始语言模型相比,所提出的记忆增强模型在人类评分的质量与实体使用方面表现如何?
  • RQ5连贯性、控制与一致性对人类对生成叙事偏好的相对影响是什么?

主要发现

  • 与原始语言模型相比,动态实体记忆模型(S-MnemeLM)在自动指标与人工评估中均显著提升了实体连贯性。
  • 人工评判者认为该记忆增强模型更具连贯性,并更常将其选为首选,而原始模型常被判定为最差。
  • 连贯性指标(C)与人类判断的皮尔逊相关系数为 rₐ = 0.32,表明其是叙事质量的可靠自动指标。
  • 在上下文窗口受限的条件下,该模型显著保留了更多与实体相关的信息,减少了长篇叙事中实体信息的丢失。
  • 一致性是最难评估的方面,其自动指标与人类评分的相关性最低(rₐ = 0.08),表明其仍是评估中的挑战。
  • 尽管相关性较低,人类撰写的叙事在一致性方面远高于生成叙事,表明未来工作仍需弥补这一差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。