[论文解读] Strategies for Structuring Story Generation
本文提出了一种从粗到细的故事生成框架,将叙事生成分解为三个阶段:生成动作的谓词-论元结构,生成包含占位符实体的故事,以及用上下文敏感的引用替换占位符。该方法提升了故事的连贯性和多样性,人工评估显示其输出优于先前的方法。
Writers generally rely on plans or sketches to write long stories, but most current language models generate word by word from left to right. We explore coarse-to-fine models for creating narrative texts of several hundred words, and introduce new models which decompose stories by abstracting over actions and entities. The model first generates the predicate-argument structure of the text, where different mentions of the same entity are marked with placeholder tokens. It then generates a surface realization of the predicate-argument structure, and finally replaces the entity placeholders with context-sensitive names and references. Human judges prefer the stories from our models to a wide range of previous approaches to hierarchical text generation. Extensive analysis shows that our methods can help improve the diversity and coherence of events and entities in generated stories.
研究动机与目标
- 为解决使用自回归语言模型进行长篇故事生成时保持情节连贯性和角色一致性的问题。
- 探索有效的分解策略,将高层规划与表层文本生成分离。
- 在无需人工标注的情况下,改进生成叙事中的实体追踪与指代消解。
- 开发一种可扩展的、端到端可训练的框架,适用于任何文本数据集。
提出的方法
- 该模型首先使用语义角色标注(SRL)生成故事动作的结构化谓词-论元表示,抽象出表面形式。
- 然后使用占位符标记(例如 ent0)生成故事,保留事件之间的结构连贯性。
- 最后通过一个具备共指意识的生成模块,将占位符替换为上下文敏感的引用。
- 该方法采用变分推理框架,通过抽象表示的确定性后验来优化联合似然。
- 解码器中专门设计的自注意力机制仅关注先前生成的动词,以强化动作序列建模。
- 该架构基于带有门控多头注意力的卷积序列到序列模型,支持长距离上下文建模。
实验结果
研究问题
- RQ1哪种故事生成的分解策略能产生最连贯且多样的叙事?
- RQ2在分离的、结构化的阶段中建模动作和实体,是否能提升故事生成中的长距离连贯性?
- RQ3与端到端自回归模型相比,从粗到细的生成方式在实体一致性和指代多样性方面有何影响?
- RQ4该模型在无监督条件下,能在多大程度上生成新颖且符合上下文的姓名(如角色和地点)?
主要发现
- 人工评判员更偏好该模型生成的故事,相较于多种先前方法,表明叙事质量有所提升。
- 该模型通过先生成动作序列,显著提高了动词多样性,减少了通用事件的生成。
- 该模型产生了更多非单例共指链,并在实体簇内表现出更高的提及多样性,表明连贯性和指代管理能力更强。
- 实体替换模块成功生成了上下文敏感的名称和引用,即使在复杂的语篇情境中亦然。
- 在衡量连贯性和实体一致性的自动指标上,该模型优于基线模型,核心指代链长度和多样性均有提升。
- 定性分析表明,具备共指意识的模型能正确解析隐含指代(例如将一只狗与过敏联系起来),而融合模型仅依赖局部上下文。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。