Skip to main content
QUICK REVIEW

[论文解读] StoryGAN: A Sequential Conditional GAN for Story Visualization

Yitong Li, Zhe Gan|arXiv (Cornell University)|Dec 6, 2018
Multimodal Machine Learning Applications参考文献 40被引用 22
一句话总结

本文提出 StoryGAN,一种序列条件生成对抗网络,通过利用带有 GRU 和 Text2Gist 单元的上下文编码器来建模故事流,结合双层判别器实现图像和故事的一致性,从而从多句故事生成连贯的图像序列。StoryGAN 在 CLEVR-SV 和 Pororo-SV 数据集上的图像质量、上下文一致性以及人工评估方面均优于当前最先进模型。

ABSTRACT

We propose a new task, called Story Visualization. Given a multi-sentence paragraph, the story is visualized by generating a sequence of images, one for each sentence. In contrast to video generation, story visualization focuses less on the continuity in generated images (frames), but more on the global consistency across dynamic scenes and characters -- a challenge that has not been addressed by any single-image or video generation methods. We therefore propose a new story-to-image-sequence generation model, StoryGAN, based on the sequential conditional GAN framework. Our model is unique in that it consists of a deep Context Encoder that dynamically tracks the story flow, and two discriminators at the story and image levels, to enhance the image quality and the consistency of the generated sequences. To evaluate the model, we modified existing datasets to create the CLEVR-SV and Pororo-SV datasets. Empirically, StoryGAN outperforms state-of-the-art models in image quality, contextual consistency metrics, and human evaluation.

研究动机与目标

  • 为解决现有文本到图像或视频生成模型因缺乏全局故事建模而无法处理从多句故事生成连贯、上下文一致图像序列的挑战。
  • 通过在图像生成过程中整合跨句子的上下文信息,建模故事中的长距离依赖关系和动态场景变化。
  • 通过在故事和图像两个层级引入双层判别器框架,提升生成图像序列的全局一致性和视觉质量。
  • 通过修改 CLEVR 和 Pororo 数据集创建并评估一个新的基准任务——故事可视化(CLEVR-SV 和 Pororo-SV 数据集)。

提出的方法

  • StoryGAN 采用序列条件生成对抗网络框架,其中生成器根据当前句子和先前句子的上下文记忆,逐句生成一张图像。
  • 上下文编码器模块由 GRU 和一种新型 Text2Gist 单元组成,通过将句子描述转换为可适应的滤波器,动态编码故事流,从而调制图像生成的特征图。
  • Text2Gist 单元学习生成一个‘概要’向量,捕捉故事中的语义和结构变化,使生成器能够在帧间保持对象和场景的一致性。
  • 使用两个判别器:图像级判别器用于验证每句话与其生成图像之间的相关性,故事级判别器用于评估整个图像序列相对于完整故事的全局连贯性。
  • 模型通过对抗损失进行端到端训练,生成器最小化对抗损失和感知损失,而判别器则被优化以区分真实序列与生成序列。
  • 该框架在两个新数据集——CLEVR-SV 和 Pororo-SV 上进行评估,这些数据集通过将现有 CLEVR 和 Pororo 数据集改造为包含多句故事输入和对应图像序列而构建。

实验结果

研究问题

  • RQ1序列条件生成对抗网络能否有效从多句故事生成连贯的图像序列,同时保持场景和角色之间的全局一致性?
  • RQ2与静态或非循环条件相比,引入具有 Text2Gist 模块的动态上下文编码器在建模故事进展方面有何改进?
  • RQ3与单判别器或无判别器基线相比,双层判别器(图像级和故事级)在多大程度上提升了生成图像序列的质量和一致性?
  • RQ4模型在未见角色名称和故事结构上的泛化能力如何?通过零样本迁移生成图像的能力可证明其性能。
  • RQ5在图像质量、上下文一致性和人工偏好方面,StoryGAN 相较于最先进模型的相对性能如何?

主要发现

  • 在 Pororo-SV 数据集上,StoryGAN 的角色分类准确率达到 0.27,显著优于 ImageGAN(0.23)、SVC(0.21)和 SVFN(0.24),表明其在描绘与故事相关角色方面的一致性更强。
  • 在成对人工评估中,StoryGAN 在视觉质量方面被偏好 74.17% 的案例,一致性方面 79.15%,相关性方面 78.08%,且标准误差较低,显示出强烈的人工偏好。
  • 在基于排名的人工评估中,StoryGAN 的平均排名最高(1.94 ± 0.05),显著优于 ImageGAN(2.91 ± 0.05),证实其整体质量与连贯性更优。
  • 消融实验表明,双层判别器和循环式上下文编码器结构对于维持全局一致性和提升图像质量均至关重要。
  • 模型能成功泛化到新角色名称:当使用不同名称重用故事模板时,StoryGAN 生成了连贯且语义准确的图像,证明其对身份变化具有鲁棒性。
  • 真实图像上角色分类准确率的上限为 0.86,表明生成图像上 0.27 的性能虽具意义但仍可进一步提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。