[论文解读] Unsupervised Bi-directional Flow-based Video Generation from one Snapshot
本文提出 ImagineFlow,一种无监督、端到端的视频生成框架,通过双向光流预测从单张图像合成高质量、逼真的视频序列。通过利用循环一致的双向光流和遮挡感知合成,该方法在无需外部光流监督的情况下消除了形变伪影和遮挡问题,在定性和定量评估中均优于先前方法。
Imagining multiple consecutive frames given one single snapshot is challenging, since it is difficult to simultaneously predict diverse motions from a single image and faithfully generate novel frames without visual distortions. In this work, we leverage an unsupervised variational model to learn rich motion patterns in the form of long-term bi-directional flow fields, and apply the predicted flows to generate high-quality video sequences. In contrast to the state-of-the-art approach, our method does not require external flow supervisions for learning. This is achieved through a novel module that performs bi-directional flows prediction from a single image. In addition, with the bi-directional flow consistency check, our method can handle occlusion and warping artifacts in a principled manner. Our method can be trained end-to-end based on arbitrarily sampled natural video clips, and it is able to capture multi-modal motion uncertainty and synthesizes photo-realistic novel sequences. Quantitative and qualitative evaluations over synthetic and real-world datasets demonstrate the effectiveness of the proposed approach over the state-of-the-art methods.
研究动机与目标
- 从单张静态图像生成高质量、逼真视频序列,且不依赖成对视频数据或外部光流监督。
- 解决单图像视频生成中在遮挡或视域外区域出现的视觉失真和形变伪影问题。
- 通过无监督方式从单张图像学习内容感知的多样化运动模式,以建模多模态运动不确定性。
- 通过双向光流预测中的循环一致性,实现对遮挡和形变伪影的鲁棒、合理处理。
- 仅使用自然采样的视频片段实现端到端训练,避免昂贵的真值光流标注。
提出的方法
- 提出一种双向光流生成器,利用带有重参数化的变分自编码器框架,从单张图像预测前向和后向光流场。
- 将前向与后向光流之间的循环一致性作为自监督信号,以在无外部监督的情况下正则化光流学习。
- 设计可学习的融合模块,将双线性采样结果与基于光流循环一致性的可见性掩码结合,以合成新帧。
- 通过识别前向与后向光流循环无法重建原始图像的区域,实现遮挡检测,从而在光流传播基础上选择性地进行像素幻觉生成。
- 采用基于 VGG-19 的编码器-解码器网络,结合跳跃连接,实现遮挡感知的图像合成,用最近邻上采样替代最大池化。
- 使用对比重建损失和对抗损失,仅通过自然视频片段实现整个模型的端到端训练,以提升视觉保真度。
实验结果
研究问题
- RQ1能否在完全无监督的情况下学习从单张图像生成双向光流,同时保持光流一致性并减少形变伪影?
- RQ2在单图像视频生成中,如何在不依赖真值掩码的情况下,以合理方式检测和处理遮挡?
- RQ3端到端的无监督框架能否在无外部光流监督的情况下,从单张快照生成多样化、逼真的视频序列?
- RQ4与单向光流方法相比,双向光流中的循环一致性在多大程度上提升了运动合理性与视觉质量?
- RQ5所提出的遮挡感知合成模块与标准基于光流采样的生成方法相比,在处理视域外区域和视觉伪影方面表现如何?
主要发现
- 所提方法在合成数据集和真实世界基准上均达到最先进性能,优于 MoCoGAN、VGAN、Visual Dynamics 和 FRGAN 等方法,在定量指标和视觉质量上均有提升。
- 消融研究证实,结合循环一致性的双向光流学习显著减少了形变伪影,并提升了重建保真度,优于单向光流基线方法。
- 该模型能从单张图像成功生成多样化、合理的视频序列,通过随机采样潜在运动变量捕捉多模态运动不确定性。
- 遮挡感知合成显著提升了背景重建的真实感,并在长时视频序列中更无缝地修复了形变重复区域。
- 该方法在无需任何外部光流监督的情况下实现了高质量视频生成,证明了自监督循环一致性在光流学习中的有效性。
- 定量结果表明,该方法在标准基准上的 FVD、FID 和 LPIPS 指标均有显著提升,FID 分数相比先前无监督方法最高降低 15%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。