Skip to main content
QUICK REVIEW

[论文解读] Compositional Video Synthesis with Action Graphs

Amir Bar, Roei Herzig|arXiv (Cornell University)|Jun 27, 2020
Generative Adversarial Networks and Image Synthesis参考文献 70被引用 6
一句话总结

本文提出 Action Graph to Video (AG2Vid),一种新型组合式视频生成框架,通过编码定时、协调动作的结构化动作图来控制生成过程。通过使用时钟边来调度动作,并采用分层模型预测场景布局和像素,AG2Vid 生成的视频在语义一致性和视觉质量方面均有提升,在 CATER 和 Something-Something V2 上对新型动作组合展现出强大的零样本泛化能力。

ABSTRACT

Videos of actions are complex signals containing rich compositional structure in space and time. Current video generation methods lack the ability to condition the generation on multiple coordinated and potentially simultaneous timed actions. To address this challenge, we propose to represent the actions in a graph structure called Action Graph and present the new ``Action Graph To Video'' synthesis task. Our generative model for this task (AG2Vid) disentangles motion and appearance features, and by incorporating a scheduling mechanism for actions facilitates a timely and coordinated video generation. We train and evaluate AG2Vid on the CATER and Something-Something V2 datasets, and show that the resulting videos have better visual quality and semantic consistency compared to baselines. Finally, our model demonstrates zero-shot abilities by synthesizing novel compositions of the learned actions. For code and pretrained models, see the project page https://roeiherz.github.io/AG2Video

研究动机与目标

  • 解决当前视频生成模型在多个协调且定时动作控制方面的不足。
  • 通过结构化输入表示,实现对视频生成中动作的精确时空控制。
  • 开发一种生成模型,能够从学习到的动作的复杂新颖组合中合成逼真视频。
  • 评估模型对未见过的动作组合及时间变化的零样本泛化能力。

提出的方法

  • 使用动作图(AG)表示动作,其中节点代表物体,边编码带有起始/结束时间及空间属性的动作。
  • 引入“时钟边”以跟踪动作随时间的进展,实现在生成过程中的时间调度。
  • 使用在带有时钟边的动作图上运行的图神经网络,逐帧预测中间场景布局。
  • 利用扩散模型或自回归模型,基于预测的布局进行像素级视频生成。
  • 通过时空损失端到端训练模型,确保动作图与生成视频之间的对齐。
  • 引入解耦的运动与外观特征,以提升生成质量和控制能力。

实验结果

研究问题

  • RQ1视频生成模型能否有效基于结构化输入,对多个同时发生且定时的动作进行条件控制?
  • RQ2模型能否对训练中未见过的动作组合实现零样本泛化?
  • RQ3模型在生成视频中对动作精确时间的控制能力达到何种程度?
  • RQ4与现有基线方法相比,模型在语义一致性和视觉质量方面表现如何?

主要发现

  • AG2Vid 在人类评估中实现了 89.45% 的动作定时准确率,证实了对动作调度的精确控制。
  • 模型展现出强大的零样本泛化能力,在 CATER 上达到 96.65% 的平均类别召回率,在 Something-Something V2 上达到 87.5%,适用于新型复合动作。
  • AG2Vid 生成的视频在 CATER 和 Something-Something V2 上均展现出优于基线方法的视觉质量和语义一致性。
  • 尽管训练中从未见过此类配置,该模型仍成功生成了包含四个物体和两个同时动作、以及三个连续动作的复杂动作图视频。
  • 时钟边的使用实现了对动作进展的有效跟踪,支持在多个智能体和动作之间进行协调生成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。