[论文解读] Generative Video Transformer: Can Objects be the Words?
本文提出物体中心视频变换器(OCVT),一种完全无监督的生成式视频模型,将物体视为视觉标记以实现高效、长期的视频生成与推理。通过结合物体中心表征、二分图匹配以及自回归变换器,OCVT在CATER抓拍定位任务上达到最先进性能,并能生成具有复杂时空动态的高质量未来帧。
Transformers have been successful for many natural language processing tasks. However, applying transformers to the video domain for tasks such as long-term video generation and scene understanding has remained elusive due to the high computational complexity and the lack of natural tokenization. In this paper, we propose the Object-Centric Video Transformer (OCVT) which utilizes an object-centric approach for decomposing scenes into tokens suitable for use in a generative video transformer. By factoring the video into objects, our fully unsupervised model is able to learn complex spatio-temporal dynamics of multiple interacting objects in a scene and generate future frames of the video. Our model is also significantly more memory-efficient than pixel-based models and thus able to train on videos of length up to 70 frames with a single 48GB GPU. We compare our model with previous RNN-based approaches as well as other possible video transformer baselines. We demonstrate OCVT performs well when compared to baselines in generating future frames. OCVT also develops useful representations for video reasoning, achieving start-of-the-art performance on the CATER task.
研究动机与目标
- 为解决视频变换器中计算成本高且缺乏自然标记化的问题,提出一种物体中心方法。
- 通过建模物体间随时间的交互,实现有效的长期视频生成与推理。
- 在无需物体级别标注的情况下,学习解耦且结构化的视频场景表征。
- 证明物体可作为视频变换器架构中的有意义“词汇”。
- 在视频生成与下游视频理解任务(如CATER)中均实现优异性能。
提出的方法
- 使用物体中心潜在表征模型(SPACE)提取物体级别特征,包括位置、大小和外观。
- 在连续帧的物体集合之间应用二分图匹配,对齐物体并实现时间建模。
- 在物体标记上训练一个自回归变换器,以预测下一帧为目标,将每个物体视为离散标记。
- 引入CLS标记以关注所有物体标记,用于下游分类任务(如抓拍定位)。
- 采用基于物体级别重建与时间一致性的对比损失,以提升表征质量。
- 仅使用单张48GB GPU训练70帧视频,与基于像素的变换器相比显著降低显存占用。
实验结果
研究问题
- RQ1物体能否作为视频变换器中用于长期生成的有效视觉标记?
- RQ2与基于像素或RNN的方法相比,物体中心表征学习在视频生成与推理方面有何改进?
- RQ3完全无监督的物体中心模型在多大程度上能学习到视频动态中的长期依赖?
- RQ4所学习的物体表征能否泛化到需要时间推理的下游视频理解任务?
- RQ5在质量与效率方面,自回归物体级别生成与端到端像素级别生成相比如何?
主要发现
- OCVT在CATER抓拍定位任务上达到最先进性能,Top 1准确率为76.0%,Top 5准确率为94.4%,且无需辅助损失。
- 在增加L1损失用于定位预测后,OCVT的L1距离最低,仅为0.39,优于Hopper与OPNet等先前方法。
- 在强制生成设置下,OCVT优于基于RNN的基线模型(如LSTM+GNN)及其他视频变换器基线,在长期动态(如颜色变化)方面表现更优。
- 即使在物体延迟交互等复杂长程依赖场景下,模型仍能生成高质量的未来帧。
- 与基于像素的变换器相比,OCVT显著降低了显存占用,使单张48GB GPU即可训练70帧视频。
- 自回归物体级别生成(OCVT-AR)在性能上优于RNN基线,但逊于完整OCVT,表明完整自注意力机制优于自回归误差累积。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。