Skip to main content
QUICK REVIEW

[论文解读] GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions

Chenfei Wu, Lun Huang|arXiv (Cornell University)|Apr 30, 2021
Multimodal Machine Learning Applications参考文献 31被引用 78
一句话总结

GODIVA 是一个文本到视频的预训练模型,使用带三维稀疏注意力机制的 VQ-VAE,从自然语言描述生成开放领域的视频。该模型在 Howto100M 上进行预训练,并使用新的 Relative Matching 指标进行评价。

ABSTRACT

Generating videos from text is a challenging task due to its high computational requirements for training and infinite possible answers for evaluation. Existing works typically experiment on simple or small datasets, where the generalization ability is quite limited. In this work, we propose GODIVA, an open-domain text-to-video pretrained model that can generate videos from text in an auto-regressive manner using a three-dimensional sparse attention mechanism. We pretrain our model on Howto100M, a large-scale text-video dataset that contains more than 136 million text-video pairs. Experiments show that GODIVA not only can be fine-tuned on downstream video generation tasks, but also has a good zero-shot capability on unseen texts. We also propose a new metric called Relative Matching (RM) to automatically evaluate the video generation quality. Several challenges are listed and discussed as future work.

研究动机与目标

  • 解决从自然语言描述生成语义连贯的视频的挑战。
  • 提出一种三维稀疏注意力机制,以高效地建模视频标记生成中的时序、行和列关系。
  • 引入基于 VQ-VAE 的框架,将视频映射到离散标记以进行自回归生成。
  • 在大规模文本-视频数据集(Howto100M)上进行预训练,并在现实世界和合成基准上进行评估。
  • 开发一种相对指标(Relative Matching)以自动评估视频生成与文本的一致性。

提出的方法

  • 使用 VQ-VAE 自编码器将视频帧编码为离散标记,并从这些标记重构帧。
  • 用自回归生成器建模 P(z|t),其输入为文本嵌入和离散视频标记。
  • 应用三维稀疏注意力,包含时序、行和列组件,将二次复杂度降低到接近线性。
  • 以交叉熵损失训练,目标是预测序列中的下一个视觉标记。
  • 在 Howto100M 上进行预训练,并在 MSR-VTT 上微调;可选地应用基于 CLIP 的排序以提升 RM 分数。

实验结果

研究问题

  • RQ1GODIVA 是否能够从文本生成语义连贯的开放领域视频?
  • RQ2三维稀疏注意力机制是否能够实现高效且可扩展的文本到视频生成?
  • RQ3模型在未见文本上的零-shot 以及下游数据集上的微调能力如何?

主要发现

  • GODIVA 展示了从文本生成语义连贯视频的能力,并支持对未见描述的零-shot 生成。
  • 三维稀疏注意力在保持性能的同时,显著将计算量从二次复杂度降到接近线性。
  • 一种新的 Relative Matching (RM) 指标在各实验中与语义对齐和视觉质量相关。
  • 消融显示 Row Attention 对性能特别重要;CLIP 排序进一步提升 RM。
  • 在 Howto100M 的预训练使在 MSR-VTT 上进行有效微调和具竞争力的零-shot结果成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。