[论文解读] Diverse Video Generation from a Single Video
本文提出 VGPNN,一种非参数化、基于最近邻的方法,通过 PatchMatch 实现时空块匹配,实现从单个输入视频的多样化视频生成,能够快速、高分辨率地合成视频。该方法在视觉质量和速度方面优于单视频 GAN 模型,将训练时间从数天缩短至数秒,同时支持视频类比、时空重定向等新应用。
GANs are able to perform generation and manipulation tasks, trained on a single video. However, these single video GANs require unreasonable amount of time to train on a single video, rendering them almost impractical. In this paper we question the necessity of a GAN for generation from a single video, and introduce a non-parametric baseline for a variety of generation and manipulation tasks. We revive classical space-time patches-nearest-neighbors approaches and adapt them to a scalable unconditional generative model, without any learning. This simple baseline surprisingly outperforms single-video GANs in visual quality and realism (confirmed by quantitative and qualitative evaluations), and is disproportionately faster (runtime reduced from several days to seconds). Our approach is easily scaled to Full-HD videos. We also use the same framework to demonstrate video analogies and spatio-temporal retargeting. These observations show that classical approaches significantly outperform heavy deep learning machinery for these tasks. This sets a new baseline for single-video generation and manipulation tasks, and no less important -- makes diverse generation from a single video practically possible for the first time.
研究动机与目标
- 解决现有单视频 GAN 模型在视频生成中训练时间过长、视觉质量差的问题。
- 复兴并扩展经典基于块的视频生成方法,实现在单个输入下高分辨率、多样化的视频合成。
- 建立一个实用的、无需学习的视频生成与操作基线,其性能优于基于深度学习的替代方案。
- 将框架扩展至新应用,如视频类比、草图到视频生成、时空重定向。
- 证明在特定视频生成任务中,简单经典的算法可超越复杂的深度学习模型。
提出的方法
- 在多个分辨率下构建输入视频的时空金字塔,实现从粗到精的处理。
- 在金字塔的每一层应用视频块最近邻(VPNN)模块,将输入视频的空间和时间特征传递至输出。
- 使用 PatchMatch 算法在三维时空块中实现快速近似最近邻搜索,提升可扩展性。
- 在最粗的金字塔层级注入随机噪声,以增强生成结果的多样性。
- 采用基于光流的描述符(如 RAFT)提取动态结构,用于视频类比和布局引导生成。
- 通过金字塔层级中的特征拼接,融合内容视频的动力学特征与风格视频的外观和运动信息。
实验结果
研究问题
- RQ1非参数化、无学习的方法能否在视频生成的质量和速度上超越基于深度学习的单视频 GAN 模型?
- RQ2是否可行使用经典基于块的方法,从单个输入视频生成多样化、高分辨率(如全高清)的视频?
- RQ3该框架能否扩展至无条件生成之外的任务,如视频类比和时空重定向?
- RQ4在视频生成中,使用 PatchMatch 进行近似最近邻搜索对运行时间和内存效率有何影响?
- RQ5经典时空块匹配在多大程度上可实现与现代深度生成模型相当的视觉真实感和连贯性?
主要发现
- VGPNN 将单个视频生成的推理时间从 HP-VAE-GAN 的 8 天缩短至仅 18 秒,提速达 30,000 倍。
- 该方法在视觉质量上表现更优,SVFID 得分为 0.0072,优于 HP-VAE-GAN 的 0.0081,表明其块分布相似性更佳。
- 在用户研究中,67.84% 的参与者更偏好 VGPNN 生成的视频,认为其在清晰度、自然性和连贯性方面更优。
- VGPNN 可生成全高清(1280×1920)视频,而 HP-VAE-GAN 和 SinGAN-GIF 仅限于低分辨率输出(如 144×256)。
- 该框架支持多样化、无条件的视频生成、视频类比、草图到视频转换以及条件视频修复。
- 该方法在定量指标和定性感知上均优于单视频 GAN 模型,确立了单视频视频生成的新实用基线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。