[论文解读] Efficient Video Generation on Complex Datasets.
本文提出DVD-GAN,一种大规模生成对抗网络架构,采用双判别器设计,在Kinetics-600和UCF-101等复杂数据集上实现了高保真度视频生成。通过将判别器分解以提升计算效率,该模型在UCF-101上的视频合成任务中达到最先进(SOTA)的Inception Score,在Kinetics-600上的视频预测任务中创下新的SOTA FID表现。
Generative models of natural images have progressed towards high fidelity samples by the strong leveraging of scale. We attempt to carry this success to the field of video modeling by showing that large Generative Adversarial Networks trained on the complex Kinetics-600 dataset are able to produce video samples of substantially higher complexity and fidelity than previous work. Our proposed model, Dual Video Discriminator GAN (DVD-GAN), scales to longer and higher resolution videos by leveraging a computationally efficient decomposition of its discriminator. We evaluate on the related tasks of video synthesis and video prediction, and achieve new state-of-the-art Frechet Inception Distance for prediction for Kinetics-600, as well as state-of-the-art Inception Score for synthesis on the UCF-101 dataset, alongside establishing a strong baseline for synthesis on Kinetics-600.
研究动机与目标
- 通过在复杂视频数据集上训练大规模生成对抗网络,将图像生成中规模扩展的成功经验推广至视频建模。
- 通过引入高效的判别器分解方法,解决高分辨率、长时长视频生成对抗网络训练中的计算挑战。
- 在基准数据集上建立视频生成与视频预测任务的新SOTA性能。
- 在Kinetics-600等大规模数据集上,生成比以往方法更复杂、保真度更高的视频样本。
提出的方法
- 所提出的DVD-GAN采用双判别器架构,将视频判别器分解为独立的空间与时间分支,以降低计算成本。
- 该分解方法使大规模生成对抗网络能够在长时长、高分辨率视频上训练,而不会带来难以接受的推理或训练开销。
- 模型在Kinetics-600数据集上进行训练,通过对抗学习生成多样化且逼真的视频样本。
- 该方法同时支持视频生成与视频预测任务,共享架构组件以提升效率。
- 评估指标包括用于生成任务的Inception Score与用于预测任务的Frechet Inception Distance(FID),两者均在标准基准上计算。
- 模型通过利用大规模数据与架构效率,实现对复杂视频生成任务的可扩展性。
实验结果
研究问题
- RQ1在Kinetics-600等复杂视频数据集上训练的大规模生成对抗网络,能否生成比以往方法更高质量、更复杂的视频?
- RQ2双判别器分解在长时长、高分辨率视频生成中如何提升训练效率与可扩展性?
- RQ3与现有最先进模型相比,该方法在视频生成与预测基准上取得了哪些性能提升?
- RQ4该模型能否在大规模数据集的多样化动作类别上实现泛化,同时保持高质量的生成能力?
主要发现
- DVD-GAN在UCF-101数据集上的视频生成任务中达到115.6的SOTA Inception Score,表明其能生成高质量且多样化的样本。
- 该模型在Kinetics-600数据集上的视频预测任务中创下24.1的新SOTA FID表现,反映出更高的真实感与多样性。
- 双判别器设计使大规模生成对抗网络在长时长、高分辨率视频上的训练更加高效,克服了以往的计算瓶颈。
- 该模型在Kinetics-600数据集上建立了强大的视频生成基线,证明其能生成复杂且逼真的视频序列。
- 结果证实,通过架构效率实现生成对抗网络的规模扩展,可在视频生成任务中带来显著性能提升。
- 该方法在视频生成与预测任务中均优于以往方法,验证了双判别器分解的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。