Skip to main content
QUICK REVIEW

[论文解读] Video Generation from Single Semantic Label Map

Junting Pan, Chengyu Wang|arXiv (Cornell University)|Mar 11, 2019
Generative Adversarial Networks and Image Synthesis参考文献 42被引用 13
一句话总结

本文提出了一种仅基于单一语义标签图的新型视频生成任务,将问题分解为两个阶段:首先从标签图生成高质量的初始帧,然后利用条件变分自编码器(VAE)预测光流以实现场景动画化。该方法在Cityscapes、KTH和UCF-101数据集上取得了最先进性能,在FID分数以及时间连贯性和视觉质量的人工偏好方面均优于现有方法。

ABSTRACT

This paper proposes the novel task of video generation conditioned on a SINGLE semantic label map, which provides a good balance between flexibility and quality in the generation process. Different from typical end-to-end approaches, which model both scene content and dynamics in a single step, we propose to decompose this difficult task into two sub-problems. As current image generation methods do better than video generation in terms of detail, we synthesize high quality content by only generating the first frame. Then we animate the scene based on its semantic meaning to obtain the temporally coherent video, giving us excellent results overall. We employ a cVAE for predicting optical flow as a beneficial intermediate step to generate a video sequence conditioned on the initial single frame. A semantic label map is integrated into the flow prediction module to achieve major improvements in the image-to-video generation process. Extensive experiments on the Cityscapes dataset show that our method outperforms all competing methods.

研究动机与目标

  • 为解决从单一语义标签图生成高质量、时间连贯视频的挑战,该方法相较于无条件或基于多帧条件生成,提供了更高的控制力与灵活性。
  • 克服端到端视频生成模型在多样化物体运动和复杂场景下表现不佳的局限性。
  • 通过将语义信息整合到光流估计过程中,提升运动预测性能,增强真实感与一致性。
  • 在多样化数据集上展示泛化能力,包括城市场景(Cityscapes)、人类动作(KTH、UCF-101)以及驾驶场景(KITTI)。

提出的方法

  • 该方法采用两阶段框架:首先,利用条件图像转换网络从语义标签图生成高保真初始帧。
  • 其次,利用条件VAE同时以生成帧和语义标签图为输入,预测双向光流,实现鲁棒的运动建模。
  • 将预测的光流应用于初始帧进行时间前向传播,以生成后续视频帧。
  • 在非遮挡区域应用几何一致性损失,以增强光流的可靠性,提升图像扭曲的准确性。
  • 使用后处理网络对扭曲后的帧进行优化,校正扭曲过程中引入的伪影。
  • 通过对抗性损失和感知损失进行模型训练,以增强生成结果的真实感与结构保真度。

实验结果

研究问题

  • RQ1能否在保持高视觉质量和时间连贯性的前提下,有效以单一语义标签图为条件进行视频生成?
  • RQ2与仅使用外观特征相比,将语义信息融入光流预测中,如何提升运动估计性能?
  • RQ3两阶段方法在细节表现与运动一致性方面,相较于端到端视频生成模型,优势有多大?
  • RQ4该方法在训练分布之外的多样化场景与动作上,泛化能力如何?

主要发现

  • 在Cityscapes数据集上,所提方法的Fréchet Inception Distance(FID)达到12.8,为所有对比方法中最低,表明视频质量更优。
  • 即使仅以单帧作为输入,该方法在相同数据集上的FID为14.2,仍优于当前最先进视频预测模型,展现出强大性能。
  • 人工偏好研究表明,在视频预测任务中,82%的参与者更偏好本方法而非FG基线模型,78%更偏好本方法而非MoCoGAN模型。
  • 在KTH与UCF-101数据集上,模型成功生成了滑雪、小提琴演奏等人类动作的逼真、时间连贯视频,有效保留了人体结构与运动动态。
  • 消融实验证实,语义标签图与光流预测均不可或缺:移除任一组件均导致视觉质量与运动一致性显著下降。
  • 该模型在KITTI数据集上也表现出良好泛化能力,能从Cityscapes训练模型生成合理的驾驶场景,表明具备强大的域迁移能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。