[论文解读] Temporally Consistent Transformers for Video Generation
本文提出TECO,一种用于视频生成的时序一致Transformer模型,通过将视频帧压缩为离散潜在表示,对压缩序列应用轻量级时序Transformer,并通过空间MaskGit重建高保真视频,从而实现长时程的时序一致性。TECO在源自3D环境的复杂长时程视频基准测试中,于时序一致性和采样速度方面均优于先前模型。
To generate accurate videos, algorithms have to understand the spatial and temporal dependencies in the world. Current algorithms enable accurate predictions over short horizons but tend to suffer from temporal inconsistencies. When generated content goes out of view and is later revisited, the model invents different content instead. Despite this severe limitation, no established benchmarks on complex data exist for rigorously evaluating video generation with long temporal dependencies. In this paper, we curate 3 challenging video datasets with long-range dependencies by rendering walks through 3D scenes of procedural mazes, Minecraft worlds, and indoor scans. We perform a comprehensive evaluation of current models and observe their limitations in temporal consistency. Moreover, we introduce the Temporally Consistent Transformer (TECO), a generative model that substantially improves long-term consistency while also reducing sampling time. By compressing its input sequence into fewer embeddings, applying a temporal transformer, and expanding back using a spatial MaskGit, TECO outperforms existing models across many metrics. Videos are available on the website: https://wilson1yan.github.io/teco
研究动机与目标
- 解决视频生成模型在长期时序一致性方面缺乏严格评估基准的问题。
- 识别并量化现有视频生成模型在重新访问先前观察过的场景区域时,维持一致性的失败模式。
- 提出一种新颖且高效的架构,可在保持时序连贯性的同时扩展至长视频序列。
- 通过分层压缩与重建解耦空间与时序建模,实现快速采样与高保真生成。
提出的方法
- 通过在3D程序化场景中渲染摄像机路径,构建三个新的视频数据集——DMLab、Minecraft和Habitat,以创建长距离时序依赖关系。
- 使用基于VQ-GAN的编码器将输入视频帧压缩为离散潜在码,降低序列长度与计算成本。
- 在压缩的潜在序列上应用轻量级时序Transformer,以高效建模长距离依赖关系,避免二次方复杂度的自注意力机制。
- 通过独立应用于每帧的空间MaskGit重建高保真视频帧,实现空间细节的自回归优化。
- 设计两阶段生成流程:首先通过时序Transformer预测压缩潜在表示,然后通过MaskGit重建像素级图像。
- 采用余弦退火学习率调度、Adam优化器,并在所有模型与数据集上固定总训练步数进行训练优化。
实验结果
研究问题
- RQ1在长视频序列中,当重新访问先前观察过的区域时,最先进视频生成模型在维持时序一致性方面的表现如何?
- RQ2当应用于压缩潜在表示时,基于Transformer的模型能否有效建模视频生成中的长距离依赖关系?
- RQ3与端到端自回归模型相比,分层压缩与重建在提升采样速度与时序一致性方面有多大的改善?
- RQ4不同架构选择(如下采样因子、模型深度)对长时程视频生成任务的性能与效率有何影响?
- RQ5统一框架是否能够在保持数百帧内一致性的前提下,同时实现高保真生成与快速推理?
主要发现
- TECO在长时程视频预测任务中达到最先进性能,在DMLab与Minecraft数据集上生成264帧以上的时序一致视频,LPIPS值低至0.15–0.25。
- 与先前模型相比,TECO将采样时间降低了一个数量级以上,实现在保持高感知质量的同时实现快速推理。
- 当重新访问先前观察过的区域时,该模型能保持场景内容的一致性,而先前模型则会产生不一致或全新内容。
- 在DMLab与Minecraft数据集上,TECO在FVD与LPIPS指标上均优于强基线模型FitVid与CW-VAE,FVD指标最高提升达15%。
- 使用空间MaskGit进行帧级细节优化,显著提升了视觉质量,尤其在高分辨率设置下相比标准自回归头表现更优。
- 通过增加模型深度与宽度扩展时序Transformer,可提升长序列上的性能,其中12层模型在质量与效率之间实现了最佳平衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。