[论文解读] Re3: Generating Longer Stories With Recursive Reprompting and Revision
Re3 提出了一种递归提示与修订框架,采用零样本、基于计划的方法,用于生成 2,000–2,500 字的长篇连贯故事。通过迭代式地利用动态重提示、重排序和事实编辑来优化故事延续,该方法在长程情节连贯性和前提相关性方面实现提升,相较于基线方法,人类评分的剧情连贯性提高 14%,前提相关性提高 20%。
We consider the problem of automatically generating longer stories of over two thousand words. Compared to prior work on shorter stories, long-range plot coherence and relevance are more central challenges here. We propose the Recursive Reprompting and Revision framework (Re3) to address these challenges by (a) prompting a general-purpose language model to construct a structured overarching plan, and (b) generating story passages by repeatedly injecting contextual information from both the plan and current story state into a language model prompt. We then revise by (c) reranking different continuations for plot coherence and premise relevance, and finally (d) editing the best continuation for factual consistency. Compared to similar-length stories generated directly from the same base model, human evaluators judged substantially more of Re3's stories as having a coherent overarching plot (by 14% absolute increase), and relevant to the given initial premise (by 20%).
研究动机与目标
- 为解决生成 2,000–2,500 字长篇故事时保持情节连贯性和前提相关性的挑战。
- 开发一种完全自动化的零样本框架,无需人工干预即可模拟人类写作过程。
- 通过递归提示与迭代修订,提升故事生成中的长程连贯性与事实一致性。
- 在人类对连贯性、相关性及人类写作风格相似度的评估下,对框架进行评估。
- 证明递归重提示与修订显著优于标准滚动窗口自回归生成方法,适用于长篇故事生成。
提出的方法
- 规划模块使用零样本提示,基于初始前提生成包含设定、角色和情节节点的结构化故事大纲。
- 草稿模块通过动态整合初始计划和不断演化的故事状态上下文,递归地向大语言模型重提示,以生成每一新段落。
- 重写模块利用重排序模型,基于情节连贯性和前提相关性对多个候选延续进行排序。
- 编辑模块对排名最高的延续进行局部编辑,以修正其与先前故事内容的事实性不一致。
- 所有组件——规划、草稿、重写和编辑——均为零样本,无需在特定故事数据集上进行微调。
- 该框架端到端且完全自动化,生成与修订过程中均无需人工输入。
实验结果
研究问题
- RQ1零样本、递归提示与修订框架是否能生成比标准自回归基线更长篇且情节连贯性更高的故事(2,000–2,500 字)?
- RQ2引入结构化计划与迭代修订在多大程度上提升了长篇故事生成中的前提相关性?
- RQ3在人类对连贯性与事实一致性的评估中,该框架与滚动窗口自回归基线相比表现如何?
- RQ4生成的故事在叙事质量与连贯性方面是否可与人类写作的作品难以区分?
- RQ5递归重提示与多阶段修订对减少长生成周期内的事实矛盾有何影响?
主要发现
- 人类评估者认为 Re3 生成的故事中,有 14% 的比例在整体情节连贯性方面优于滚动窗口基线。
- 与基线模型相比,Re3 生成的故事在初始前提相关性方面实现了 20% 的绝对提升。
- 评估者预测高达 83% 的 Re3 生成故事是由人类撰写的,表明其叙事质量与自然度极高。
- 该框架成功生成了一篇 7,500 字的故事,证明其可扩展至超过 2,000–2,500 字的目标长度。
- 递归重提示、重排序与编辑的结合显著提升了长程连贯性与事实一致性,且无需微调。
- 所有模块的零样本特性使其可广泛应用于各类领域,而无需针对特定故事进行微调。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。