Skip to main content
QUICK REVIEW

[论文解读] TwoStreamVAN: Improving Motion Modeling in Video Generation

Ximeng Sun, Huijuan Xu|arXiv (Cornell University)|Dec 3, 2018
Generative Adversarial Networks and Image Synthesis参考文献 43被引用 7
一句话总结

TwoStreamVAN 提出了一种解耦的双流变分对抗网络,通过多尺度融合与运动掩码,在视频生成中分离运动与内容生成,显著提升了时间一致性与视觉质量。该方法在 Weizmann、MUG、VoxCeleb 以及一个新构建的大规模合成数据集 SynAction 上显著优于当前最先进方法,实现了运动建模与内容保真度的优越定量与定性结果。

ABSTRACT

Video generation is an inherently challenging task, as it requires modeling realistic temporal dynamics as well as spatial content. Existing methods entangle the two intrinsically different tasks of motion and content creation in a single generator network, but this approach struggles to simultaneously generate plausible motion and content. To im-prove motion modeling in video generation tasks, we propose a two-stream model that disentangles motion generation from content generation, called a Two-Stream Variational Adversarial Network (TwoStreamVAN). Given an action label and a noise vector, our model is able to create clear and consistent motion, and thus yields photorealistic videos. The key idea is to progressively generate and fuse multi-scale motion with its corresponding spatial content. Our model significantly outperforms existing methods on the standard Weizmann Human Action, MUG Facial Expression, and VoxCeleb datasets, as well as our new dataset of diverse human actions with challenging and complex motion. Our code is available at https://github.com/sunxm2357/TwoStreamVAN/.

研究动机与目标

  • 为解决现有耦合生成器架构中运动建模不佳导致内容质量下降的问题。
  • 通过在解码阶段解耦运动与内容生成,提升时间一致性与视觉真实感。
  • 开发一种可扩展的多尺度融合机制,在不同分辨率下精细化优化运动与内容。
  • 引入运动掩码,聚焦于与运动相关的区域,同时保留静态内容。
  • 构建并发布一个大规模合成人类动作数据集(SynAction),用于评估复杂运动建模能力。

提出的方法

  • TwoStreamVAN 采用两个并行生成器:一个用于内容,一个用于运动,分别由解耦的潜在码 εc 和 εm 条件控制。
  • 通过在不同分辨率的中间特征层应用多尺度优化机制,实现运动与内容的融合。
  • 在每个尺度上应用学习得到的运动掩码,抑制无关区域,使模型聚焦于受运动影响的区域,同时保留静态内容。
  • 采用双任务学习策略:内容使用图像级监督,运动使用视频级监督,独立提升两个分支的性能。
  • 多尺度融合采用小卷积核大小(n=5),在多层中逐步提升空间粒度,精细化优化运动与内容。
  • 框架基于变分对抗网络(VAN)架构,结合 VAE 式的解耦机制与 GAN 式的对抗训练,实现逼真图像生成。

实验结果

研究问题

  • RQ1在解码阶段解耦运动与内容生成,是否能相比耦合生成器显著提升视频生成质量?
  • RQ2运动与内容的多尺度融合,如何影响生成视频序列的真实感与清晰度?
  • RQ3运动掩码在提升运动建模保真度的同时,对静态内容的保留程度如何?
  • RQ4分别采用图像级与视频级监督进行独立训练,是否能有效提升内容与运动生成质量?
  • RQ5该模型在标准基准之外的复杂、多样化人类动作上,泛化能力如何?

主要发现

  • 在 SynAction 数据集上,TwoStreamVAN 的 Fréchet 视频距离(FVD)达到 102.4,显著优于 MoCoGAN(142.3)及其他基线方法。
  • 在 Weizmann 人类动作数据集上,TwoStreamVAN 的 Inception Score(IS)达到 77.83,超过单融合基线(75.89),且运动清晰度明显提升。
  • 对于大范围运动(如跑步),模型将条件熵 H(y|v) 降低至 0.062,表明帧间运动生成更加一致且逼真。
  • 消融实验表明,采用 n=5 的多尺度融合(4 层)优于使用大卷积核(n=17)的单尺度融合,尤其在腿部等高运动区域表现更优。
  • 运动掩码有效减少静态区域(如背景图案与眼部纹理)的伪影,而 TwoStreamVAN(−M) 在此类区域生成模糊或失真的图案。
  • 用户研究表明,与基线方法相比,TwoStreamVAN 生成的视频更具真实感与连贯性,尤其在复杂运动序列中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。