Skip to main content
QUICK REVIEW

[论文解读] Learning Dynamic Generator Model by Alternating Back-Propagation Through Time

Jianwen Xie, Ruiqi Gao|arXiv (Cornell University)|Dec 27, 2018
Generative Adversarial Networks and Image Synthesis参考文献 23被引用 6
一句话总结

本文提出一种基于非线性神经网络的动态生成器模型,用于建模动态纹理和动作等时空过程。该方法引入了一种交替时间反向传播(ABPTT)算法,通过迭代采样噪声向量并利用梯度上升更新参数,联合学习状态转移网络与生成器网络,实现了无需对抗生成网络(GAN)或变分自编码器(VAE)推理网络的逼真视频生成。

ABSTRACT

This paper studies the dynamic generator model for spatial-temporal processes such as dynamic textures and action sequences in video data. In this model, each time frame of the video sequence is generated by a generator model, which is a non-linear transformation of a latent state vector, where the non-linear transformation is parametrized by a top-down neural network. The sequence of latent state vectors follows a non-linear auto-regressive model, where the state vector of the next frame is a non-linear transformation of the state vector of the current frame as well as an independent noise vector that provides randomness in the transition. The non-linear transformation of this transition model can be parametrized by a feedforward neural network. We show that this model can be learned by an alternating back-propagation through time algorithm that iteratively samples the noise vectors and updates the parameters in the transition model and the generator model. We show that our training method can learn realistic models for dynamic textures and action patterns.

研究动机与目标

  • 开发一种灵活的非线性生成模型,用于建模动态纹理和人类动作等时空视频数据。
  • 通过用深度神经网络替代线性映射,解决线性模型在捕捉复杂运动模式方面的局限性。
  • 消除在训练动态视频模型时对判别器(GAN)或推理网络(VAE)等辅助网络的需求。
  • 通过统一且高效的优化框架,实现状态转移模型与观测模型的端到端联合学习。
  • 通过潜在变量推理,展示模型在视频修复和图像到视频生成任务中的能力。

提出的方法

  • 将视频序列建模为非线性状态空间过程,其中每一帧由从潜在状态向量通过自顶向下的反卷积网络(生成器)生成。
  • 将状态转移定义为当前状态与独立高斯噪声向量的非线性变换,由前馈神经网络参数化。
  • 应用交替时间反向传播(ABPTT):首先通过Langevin动力学基于后验概率对数的梯度推断潜在噪声向量,然后通过对数似然的梯度上升更新模型参数。
  • 使用时间反向传播计算状态转移模型(Fα)和生成器模型(Gβ)相对于观测视频序列的梯度。
  • 引入一种条件变体,通过编码器(Eγ)将初始图像帧映射为内容向量和状态向量,以实现图像到视频生成。
  • 采用联合训练策略,通过ABPTT联合优化编码器、状态转移模型和生成器,实现端到端学习。

实验结果

研究问题

  • RQ1基于神经网络的非线性动态生成器模型,其状态转移与观测函数采用神经网络实现,能否有效建模复杂的时空视频模式?
  • RQ2ABPTT算法能否在无需判别器或推理网络的情况下,高效且有效地训练此类模型?
  • RQ3通过潜在变量采样推断缺失内容,该模型在视频修复任务中的表现如何?
  • RQ4通过在单张静态图像帧上进行条件控制,该模型能否泛化至图像到视频生成任务?
  • RQ5与基于GAN或VAE的替代方法相比,交替时间反向传播方法是否能生成更稳定、更逼真的视频?

主要发现

  • ABPTT算法成功在真实世界视频数据集(包括动态纹理和人类动作序列)上训练了动态生成器模型。
  • 该模型通过学习状态转移与图像生成中的复杂非线性动态,生成了逼真的视频序列。
  • 视频修复结果表明,该模型能通过Langevin动力学推断潜在噪声向量,有效重建缺失内容(如行走的人、移动的船)。
  • 图像到视频预测实验表明,该模型能从静态图像生成合理运动,生成序列展现出连贯的时间演化过程。
  • 该方法在不依赖对抗训练或复杂推理网络的情况下实现了具有竞争力的性能,凸显其高效性与简洁性。
  • 该模型在多种视频生成任务中表现出良好泛化能力,包括背景修复与条件视频合成,定性结果表明其具有强视觉合理性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。