Skip to main content
QUICK REVIEW

[论文解读] Learning to Take Directions One Step at a Time

Qiyang Hu, Adrian Wälchli|arXiv (Cornell University)|Dec 5, 2018
Generative Adversarial Networks and Image Synthesis参考文献 45被引用 6
一句话总结

本文提出了一种新颖的循环神经网络视频生成框架,通过一系列运动笔画作为方向控制信号,实现单张图像的动画化。通过利用具有自编码状态表示的RNN与截断反向传播训练方案,该模型能够生成长时序、时间上一致且逼真的视频序列,且无退化现象,在MNIST、KTH、Human3.6M、Push和Weizmann数据集上的定性和定量评估中均优于先前方法。

ABSTRACT

We present a method to generate a video sequence given a single image. Because items in an image can be animated in arbitrarily many different ways, we introduce as control signal a sequence of motion strokes. Such control signal can be automatically transferred from other videos, e.g., via bounding box tracking. Each motion stroke provides the direction to the moving object in the input image and we aim to train a network to generate an animation following a sequence of such directions. To address this task we design a novel recurrent architecture, which can be trained easily and effectively thanks to an explicit separation of past, future and current states. As we demonstrate in the experiments, our proposed architecture is capable of generating an arbitrary number of frames from a single image and a sequence of motion strokes. Key components of our architecture are an autoencoding constraint to ensure consistency with the past and a generative adversarial scheme to ensure that images look realistic and are temporally smooth. We demonstrate the effectiveness of our approach on the MNIST, KTH, Human3.6M, Push and Weizmann datasets.

研究动机与目标

  • 通过使用直观的运动笔画序列作为控制信号,实现仅从单张静态图像生成可控视频。
  • 解决长期视频生成中保持时间一致性与视觉真实感的挑战,避免随时间推移产生帧质量退化。
  • 设计一种循环神经网络架构,通过单步截断时间反向传播实现高效训练,无需完整BPTT。
  • 在包含刚性与非刚性运动(如人体动作与物体运动)的多样化数据集上实现良好泛化能力。
  • 尽管仅使用一张图像,仍实现与使用多帧输入的模型相当的感知质量与运动合理性。

提出的方法

  • 模型采用一种新型RNN架构,其输入状态包含编码后的初始图像、当前帧、完整运动路径以及下一步运动指令。
  • 通过自编码器组件显式建模每一帧的潜在表示,约束状态空间并确保与历史帧的一致性。
  • RNN基于当前状态预测下一帧的潜在码,从而在无误差累积的情况下实现长视频生成。
  • 训练采用重建损失以对齐生成帧与真实帧,同时结合对抗损失与感知损失以提升真实感与时间平滑性。
  • 通过边界框跟踪从源视频中提取运动笔画,实现运动控制信号的自动迁移。
  • 该架构支持单步截断时间反向传播,实现高效且稳定的训练。

实验结果

研究问题

  • RQ1深度学习模型能否仅使用运动笔画序列作为控制信号,从单张图像生成长时序、逼真的视频序列?
  • RQ2循环网络如何在长时间视频生成过程中保持时间一致性与视觉质量,而不发生退化?
  • RQ3具有自编码状态的新型RNN架构能否通过截断反向传播实现高效训练,同时保持运动的合理性?
  • RQ4与需要多帧输入或控制性较差的最先进方法相比,该模型的性能如何?
  • RQ5该模型在分布外运动轨迹上的泛化能力如何?其在不同数据集上的多样化运动类型处理能力如何?

主要发现

  • 在KTH数据集上,该模型实现了最先进水平的感知质量,LPIPS得分为0.09,优于Li等人(0.14)与Denton等人(0.11)。
  • 在姿态平滑性评估中,该模型在除跑步外的所有运动类别中均实现了最低的关节位移均值与标准差(行走类为7.2%与7.7%)。
  • 在KTH序列上,该模型实现了87.1%的目标检测率,显著高于Li等人(54.9%)与Denton等人(54.2%),表明其图像质量与运动合理性更优。
  • 定性结果表明,生成帧比竞争方法更清晰、更逼真,尽管仅使用一张图像,其性能与使用10帧输入的模型相当。
  • 该模型在MNIST、KTH、Human3.6M、Push与Weizmann等多样化数据集上均表现出良好泛化能力,能为刚性与非刚性运动生成逼真动画。
  • 该方法成功实现了对任意长度输出的可控视频合成,展示了在长视频序列生成中具备鲁棒性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。