[论文解读] Flexible Diffusion Modeling of Long Videos
提出灵活扩散模型(FDM),基于 DDPM 的框架,能够在给定任意子集的条件下对任意子集的视频帧进行采样,从而实现长视频生成/补全,并对采样方案进行数据集特定优化;发布 CARLA Town01 数据集。
We present a framework for video modeling based on denoising diffusion probabilistic models that produces long-duration video completions in a variety of realistic environments. We introduce a generative model that can at test-time sample any arbitrary subset of video frames conditioned on any other subset and present an architecture adapted for this purpose. Doing so allows us to efficiently compare and optimize a variety of schedules for the order in which frames in a long video are sampled and use selective sparse and long-range conditioning on previously sampled frames. We demonstrate improved video modeling over prior work on a number of datasets and sample temporally coherent videos over 25 minutes in length. We additionally release a new video modeling dataset and semantically meaningful metrics based on videos generated in the CARLA autonomous driving simulator.
研究动机与目标
- 解决超越短序列的連贯且真实感强的长视频生成挑战。
- 开发一个基于 DDPM 的模型,能够在测试时灵活地对任意数量的过去/未来帧进行条件设定和边缘化。
- 探索并优化采样方案,在计算约束与视频质量之间取得平衡。
- 引入一个新的自治驾驶场景视频数据集(CARLA Town01)及基于语义的视频建模评估指标。
提出的方法
- 在 DDPM 基于的图像架构中加入时序注意力与新颖的相对帧位置编码。
- 以支持在固定计算预算 K 下对任意数量的过去/未来帧进行条件设定的元学习目标来训练一个条件 DDPM。
- 在潜在帧索引与观测帧索引上定义广义的训练任务分布 u(X, Y),以实现对可变帧集合的灵活条件学习。
- 将视频表示为 4 维张量,并使用带时序与时空注意力的 4-D U-Net 在帧之间传播信息。
- 通过训练批次填充来高效处理固定批次大小下的可变长度条件。
- 提供多种测试时采样方案(自回归、长程、分层变体)及优化过程以选择最小化扩散损失的条件帧。
实验结果
研究问题
- RQ1如何在测试时将扩散为基础的视频模型对任意子集的帧进行条件设定?
- RQ2是否可以训练单一模型来处理多样化的条件设定任务,并在计算约束下仍能生成高质量的长视频?
- RQ3哪些采样方案在不同数据集上能够在视频保真度与连贯性之间达到最佳权衡?
- RQ4在测试时优化条件设定策略是否比固定方案能提升定量视频建模指标?
- RQ5有哪些以语义为驱动的指标可用于评估在驾驶仿真环境中生成的长视频的真实感与语义一致性?
主要发现
- FDM 能在跨数据集的前提下对任意子集帧进行条件设定,采样长视频(最长可达 25 分钟)。
- 各种采样方案(自回归、长程、分层变体)在数据集上呈现依赖性差异的性能,分层方案在某些任务上通常提升 FVD,而自回归在其他任务上表现出色。
- 通过离线方案优化(Opt. autoreg、Opt. hierarchy-2)对条件帧进行优化,在若干数据集上提升 FVD 及相关指标。
- 与基线方法(CWVAE、TATS、VDM)相比,FDM 在数据集与方案不同的情况下达到更低的 FVD 或更高的准确性,并提供测试时灵活性以在不重新训练的情况下探索不同方案。
- 发布了新的 CARLA Town01 视频数据集,并提供语义导向的评估(离群百分比、Wasserstein 距离),用于评估长视频的真实感与语义一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。