[论文解读] Synthesizing Coherent Story with Auto-Regressive Latent Diffusion Models
本文提出 AR-LDM,一种自回归潜在扩散模型,通过同时依赖文本描述和先前生成的图像进行条件控制,实现连贯视觉故事的生成,在视觉故事生成与延续任务中达到最先进性能。该工作引入了 VIST 数据集以实现真实世界故事合成,并通过适配方法实现对未见角色的泛化,显著提升了生成结果的一致性与质量。
Conditioned diffusion models have demonstrated state-of-the-art text-to-image synthesis capacity. Recently, most works focus on synthesizing independent images; While for real-world applications, it is common and necessary to generate a series of coherent images for story-stelling. In this work, we mainly focus on story visualization and continuation tasks and propose AR-LDM, a latent diffusion model auto-regressively conditioned on history captions and generated images. Moreover, AR-LDM can generalize to new characters through adaptation. To our best knowledge, this is the first work successfully leveraging diffusion models for coherent visual story synthesizing. Quantitative results show that AR-LDM achieves SoTA FID scores on PororoSV, FlintstonesSV, and the newly introduced challenging dataset VIST containing natural images. Large-scale human evaluations show that AR-LDM has superior performance in terms of quality, relevance, and consistency.
研究动机与目标
- 为解决从多句叙述中生成连贯、一致的视觉故事这一挑战,该任务在扩散模型中尚未得到充分探索。
- 通过利用文本上下文和先前生成的图像作为条件,提升故事帧之间图像生成的一致性。
- 通过一种简单的适配方法,实现对未见角色(例如代词指代者)的泛化能力。
- 通过新构建的数据集 VIST,在真实世界故事合成任务上评估模型性能,该数据集包含基于自然图像的故事序列。
- 通过大规模人类评估,证明模型在视觉质量、相关性与一致性方面表现更优。
提出的方法
- AR-LDM 采用一种历史感知编码模块,结合 CLIP 用于文本理解,以及 BLIP 用于多模态图文理解。
- 模型采用自回归生成策略,其中每一帧均基于当前描述和先前生成的图像与描述的历史进行条件控制。
- 利用在图像潜在空间上训练的潜在扩散框架,生成高保真度、多样化且一致的图像。
- 提出一种新颖的适配方法,通过在参考图像-文本对上微调,以保留未见角色的身份一致性。
- 模型在故事序列上端到端训练,其交叉注意力机制同时关注当前描述和历史视觉-文本上下文。
- 该架构支持通过条件控制源图像或初始描述序列,实现视觉故事生成与延续两种任务。
实验结果
研究问题
- RQ1扩散模型能否被有效适配以在多帧图像上生成连贯的视觉故事,而非孤立图像?
- RQ2如何在从多句叙述生成的图像序列中保持视觉一致性和相关性?
- RQ3模型能否在无显式监督的情况下,对未见角色(如代词指代者)实现泛化?
- RQ4与以往基于 GAN 和自回归的模型相比,所提方法在图像质量、相关性与一致性方面表现如何?
- RQ5是否可通过包含自然图像和基于序列的描述的新数据集,更有效地评估真实世界故事合成能力?
主要发现
- 在 PororoSV 数据集上,AR-LDM 达到 16.59 的最先进 FID 分数,相比之前的故事生成方法相对提升 70%。
- 在所有评估数据集(包括 FlintstonesSV 和 VIST)上,AR-LDM 在故事延续任务中相对性能提升约 20%。
- 大规模人类评估确认,AR-LDM 在视觉质量、相关性与一致性方面均优于先前方法,人类标注者在所有评估维度上更偏好其输出。
- 通过适配方法,模型成功实现对未见角色的泛化,显著减少了因代词或描述模糊导致的不一致生成。
- VIST 数据集的引入使真实世界故事合成评估更加真实,AR-LDM 在该基准上表现出色,尤其在自然图像内容上。
- 失败案例显示,注意力机制可能将不相关句子的语义内容混合,表明未来工作需改进文本编码。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。