Skip to main content
QUICK REVIEW

[论文解读] Goal-Directed Story Generation: Augmenting Generative Language Models with Reinforcement Learning

Amal Alabdulkarim, Winston Li|arXiv (Cornell University)|Dec 16, 2021
Topic Modeling被引用 11
一句话总结

本文提出了一种强化学习框架,通过知识图谱状态表示和策略网络,引导基于 GPT-2 的故事生成朝着特定目标事件发展。通过将生成与控制解耦,该方法在保持流畅性的同时实现了超过 90% 的目标达成率,在人类评估中优于微调语言模型和基线模型。

ABSTRACT

The advent of large pre-trained generative language models has provided a common framework for AI story generation via sampling the model to create sequences that continue the story. However, sampling alone is insufficient for story generation. In particular, it is hard to direct a language model to create stories to reach a specific goal event. We present two automated techniques grounded in deep reinforcement learning and reward shaping to control the plot of computer-generated stories. The first utilizes proximal policy optimization to fine-tune an existing transformer-based language model to generate text continuations but also be goal-seeking. The second extracts a knowledge graph from the unfolding story, which is used by a policy network with graph attention to select a candidate continuation generated by a language model. We report on automated metrics pertaining to how often stories achieve a given goal event as well as human participant rankings of coherence and overall story quality compared to baselines and ablations.

研究动机与目标

  • 为解决大型预训练语言模型(如 GPT-2)在故事生成中难以达成指定终点状态的挑战,因为它们通常无法达到指定的最终状态。
  • 克服在大型模型中使用奖励塑造微调的局限性,尽管其流畅性有所提升,但目标达成率仅达到 50%。
  • 开发一种两阶段系统,其中策略网络基于抽象的知识图谱状态选择后续内容,实现在不微调语言模型的前提下实现目标导向行为。
  • 通过自动化指标和人类参与者研究,评估系统在目标达成率、连贯性和流畅性方面的表现。
  • 证明知识图谱状态表示在故事生成中的强化学习中具有关键作用。

提出的方法

  • 从故事内容动态构建知识图谱,将实体和关系表示为 <主体, 关系, 宾语> 三元组,以建模故事世界的状态。
  • 基于图注意力网络(GAT)的策略网络根据候选后续内容向目标推进的潜力,评估来自 GPT-2 的候选内容,使用与剩余到达目标步数成反比的奖励信号。
  • 系统使用近端策略优化(PPO)训练策略网络,以优化目标达成率,同时保持自然语言质量。
  • 基于 DQN 的智能体从 GPT-2 生成的候选内容中选择故事后续内容,使用知识图谱作为输入以估计状态效用。
  • 该方法将语言生成与控制解耦:GPT-2 生成多样化且流畅的后续内容,而策略网络选择最有利于目标达成的内容。
  • 对策略网络应用奖励塑造机制,其中减少估计到达目标步数的后续内容获得更高的奖励。

实验结果

研究问题

  • RQ1强化学习能否有效应用于引导大型预训练语言模型(如 GPT-2)在故事生成中实现特定目标事件?
  • RQ2与依赖语言模型隐藏状态相比,使用知识图谱作为状态表示是否能提升目标导向故事生成的性能?
  • RQ3在知识图谱上训练的策略网络的性能,与直接使用奖励塑造对语言模型进行微调相比如何?
  • RQ4知识图谱表示在人类评估中对故事连贯性和目标达成的贡献程度如何?
  • RQ5两阶段系统(语言模型生成候选,策略选择)是否能实现比端到端微调更高的目标成功率达?

主要发现

  • KG-DQN 模型在达成指定目标事件方面取得了超过 90% 的成功率,显著优于基线模型 GPT2-Sci-Fi 和 GPT2-RS。
  • 在所有维度上,人类参与者显著更偏好 KG-DQN 模型,包括连贯性、重复避免、合理性以及局部因果性(p < 0.01)。
  • 移除知识图谱的 DQN 消融实验显示性能显著下降,表明知识图谱是实现有效策略学习的关键组件。
  • 尽管流畅性有所提升,但使用奖励塑造微调的 GPT2-RS 模型仅实现了 50% 的目标达成率,表明直接微调对大型模型无效。
  • 在 KG-DQN 模型中添加奖励塑造(KG-DQN-RS)仅提升了重复避免的表现,未改善目标达成率或连贯性,表明策略网络基于图的推理比语言模型微调更为关键。
  • 基于 DQN 的模型生成的故事更简洁(平均 4–5 个事件即可达成目标),而 GPT2-RS 生成的故事更长,且更易出现幻觉,包含随机引入的角色。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。