Skip to main content
QUICK REVIEW

[论文解读] Image2GIF: Generating Cinemagraphs using Recurrent Deep Q-Networks

Yipin Zhou, Yale Song|arXiv (Cornell University)|Jan 27, 2018
Generative Adversarial Networks and Image Synthesis参考文献 34被引用 3
一句话总结

本文提出一种结合深度Q网络(DQN)的循环神经网络生成模型,可从单张静态图像自动生成电影动图,学习动画区域(定位)与动画方式(运动生成)。该方法在基线方法中实现了更优的视觉质量和真实感,人类评估显示,RNN+DQN在合成数据集和真实数据集上均在感知真实感和偏好度方面优于其他方法。

ABSTRACT

Given a still photograph, one can imagine how dynamic objects might move against a static background. This idea has been actualized in the form of cinemagraphs, where the motion of particular objects within a still image is repeated, giving the viewer a sense of animation. In this paper, we learn computational models that can generate cinemagraph sequences automatically given a single image. To generate cinemagraphs, we explore combining generative models with a recurrent neural network and deep Q-networks to enhance the power of sequence generation. To enable and evaluate these models we make use of two datasets, one synthetically generated and the other containing real video generated cinemagraphs. Both qualitative and quantitative evaluations demonstrate the effectiveness of our models on the synthetic and real datasets.

研究动机与目标

  • 自动化从单张静态图像生成电影动图,减少手动制作动画GIF的工作量。
  • 学习场景中哪些物体可以运动以及如何运动,从静态输入中捕捉动态语义。
  • 开发一种结合时间建模与强化学习的生成模型,以提升运动序列生成质量。
  • 在合成数据集和真实世界电影动图数据集上评估模型,实现稳健的对比。

提出的方法

  • 该模型使用带有变分自编码器的循环神经网络(RNN),从单张输入图像编码并生成连续帧序列。
  • 引入深度Q网络(DQN)以指导在选择动画区域及其随时间变化方式上的随机决策。
  • 通过对抗性损失与重建损失的组合进行训练,以增强视觉真实感与结构一致性。
  • 采用循环架构,通过基于先前生成帧的条件,实现时间上一致的序列生成。
  • 模型在两个数据集上进行训练与评估:一个具有受控运动的合成数据集,以及一个由互联网抓取的真实电影动图数据集。
  • 使用分割图评估运动定位的准确性,将预测的运动物体中心与真实值进行比较。

实验结果

研究问题

  • RQ1深度学习模型能否从单张静态图像自动生成时间上一致的电影动图序列?
  • RQ2模型在静态图像中定位运动物体的能力如何,能否为这些物体生成合理运动序列?
  • RQ3与基线方法相比,集成深度Q网络在多大程度上提升了生成电影动图的质量与真实感?
  • RQ4模型在具有真实运动标注的合成数据与真实世界电影动图上的表现如何?
  • RQ5人类评估者能否区分生成的电影动图与真实电影动图?与先前工作相比,该模型在感知真实感方面表现如何?

主要发现

  • 在定性比较中,RNN+DQN 模型在人类偏好度上表现最佳,63.3% 的受试者在成对比较中选择其为最佳电影动图。
  • 该模型在 60.0% 的情况下成功欺骗人类观察者,使其认为生成的电影动图是真实的,显著优于基线方法。
  • 在合成数据集上,RNN+DQN 模型将预测与真实物体中心之间的平均欧氏距离相比基线降低了 28.7%,表明其运动定位能力更优。
  • 消融实验表明,使用过小的瓶颈(z)和Q向量尺寸会严重降低性能,原因在于信息丢失与过度量化。
  • 恒定基线(复制第一帧)在逐帧差异图像上的 PSNR/SSIM 值为零,而 RNN+DQN 获得了非零分数,证实其具备生成动态运动的能力。
  • 该模型对超参数选择具有鲁棒性,在合成数据上最优维度为 64 维 z,在真实数据上为 512 维 Q 向量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。