[论文解读] Exploring Story Generation with Multi-task Objectives in Variational Autoencoders
本文提出一种领域特定的变分自编码器(VAE),结合 BERT 和 GPT-2,通过引入两个辅助目标——故事主题预测和话语关系判别——来提升故事生成质量。增强后的 VAE 学习到更具信息量的潜在变量,在多个数据集上实现了优于 GPT-2 和普通 VAE 的质量-多样性权衡。
GPT-2 has been frequently adapted in story generation models as it provides powerful generative capability. However, it still fails to generate consistent stories and lacks diversity. Current story generation models leverage additional information such as plots or commonsense into GPT-2 to guide the generation process. These approaches focus on improving generation quality of stories while our work look at both quality and diversity. We explore combining BERT and GPT-2 to build a variational autoencoder (VAE), and extend it by adding additional objectives to learn global features such as story topic and discourse relations. Our evaluations show our enhanced VAE can provide better quality and diversity trade off, generate less repetitive story content and learn a more informative latent variable.
研究动机与目标
- 为解决 GPT-2 在故事生成中的局限性,特别是多样性较低和情节不一致的问题。
- 通过引入全局故事特征,提升 VAE 中潜在变量的信息量,以优化故事生成。
- 探索能够引导 VAE 捕捉故事主题与话语质量的多任务学习目标。
- 开发一种领域特定的 VAE,使其在故事生成任务中实现优于 GPT-2 和普通 VAE 的质量-多样性权衡。
提出的方法
- 使用 BERT 作为编码器、GPT-2 作为解码器构建 VAE,并在领域特定的故事数据上进行预训练。
- 引入多任务学习框架,使潜在变量同时优化故事主题分类与原始/损坏故事判别任务。
- 采用负采样策略模拟常见生成错误,使模型能够学习话语层面的连贯性。
- 使用不同 p 值的 top-p 采样策略,评估多种超参数设置下的生成质量与多样性。
- 通过重构损失、KL 散度以及两个辅助目标的联合训练,对潜在空间进行正则化。
- 在故事数据集上微调 VAE,并使用负向语料 BLEU、自相似 BLEU 和 ROC AUC 等指标评估话语质量。
实验结果
研究问题
- RQ1基于 BERT 和 GPT-2 构建的 VAE 是否能学习到比标准 GPT-2 更具信息量的潜在表征,以用于故事生成?
- RQ2在主题建模和话语质量方面增加辅助目标,是否能改善故事生成中的质量-多样性权衡?
- RQ3VAE 的潜在空间是否能被有效正则化,以捕捉主题和连贯性等全局故事特征,而非仅学习局部模式?
- RQ4在不同数据集上,所提出的多任务 VAE 与 GPT-2 和普通 VAE 相比,在生成质量与多样性方面表现如何?
主要发现
- 增强后的 VAE(VAE + t、VAE + d、VAE + td)在所有测试数据集上均实现了优于 GPT-2 和普通 VAE 的质量-多样性权衡,如图 3 所示的权衡曲线所示。
- 引入主题建模(VAE + t)和话语判别(VAE + d)的 VAE 均优于普通 VAE,而联合目标(VAE + td)在大多数数据集上表现最强。
- 话语判别任务的 AUC 达到 0.75,主题预测任务的 AUC 为 0.25,表明模型有效学习了全局故事特征。
- 在低 p 值(如 p=0.4)下,增强 VAE 的 4-gram 重复自相似 BLEU 分数显著降低,表明重复减少、多样性提高。
- 在高 p 值(如 p=1.0)下,所有模型(包括 GPT-2)的自相似 BLEU 分数均接近人类写作水平(0.021),但增强 VAE 在低 p 值下仍保持更优的生成质量。
- 自编码器基线模型尽管重复率低,但生成了不连贯的故事,证实低自相似 BLEU 并不意味着高质量,凸显了所提 VAE 在质量与多样性之间平衡的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。