[论文解读] Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising
该论文提出 Gen-L-Video,一种新颖的框架,通过利用现成的短视频扩散模型(无需额外训练),实现了多文本条件下的长视频生成与编辑。通过采用重叠短视频片段的时序协同去噪以及双向跨帧注意力机制,该方法在数百帧的视频中实现了极高的帧一致性与语义对齐,显著优于独立去噪和现有方法,在定量与定性评估中均表现优异。
Leveraging large-scale image-text datasets and advancements in diffusion models, text-driven generative models have made remarkable strides in the field of image generation and editing. This study explores the potential of extending the text-driven ability to the generation and editing of multi-text conditioned long videos. Current methodologies for video generation and editing, while innovative, are often confined to extremely short videos (typically less than 24 frames) and are limited to a single text condition. These constraints significantly limit their applications given that real-world videos usually consist of multiple segments, each bearing different semantic information. To address this challenge, we introduce a novel paradigm dubbed as Gen-L-Video, capable of extending off-the-shelf short video diffusion models for generating and editing videos comprising hundreds of frames with diverse semantic segments without introducing additional training, all while preserving content consistency. We have implemented three mainstream text-driven video generation and editing methodologies and extended them to accommodate longer videos imbued with a variety of semantic segments with our proposed paradigm. Our experimental outcomes reveal that our approach significantly broadens the generative and editing capabilities of video diffusion models, offering new possibilities for future research and applications. The code is available at https://github.com/G-U-N/Gen-L-Video.
研究动机与目标
- 解决现有文本到视频模型受限于短视频(通常 <24 帧)且仅支持单文本条件的问题。
- 实现在多个语义片段中,使用多样化文本提示,实现一致且连贯的长视频生成。
- 开发一种通用框架,扩展现有短视频扩散模型以实现无需额外训练的长视频生成与编辑。
- 在长视频中保持高帧一致性与文本对齐,同时支持对象替换、风格迁移和姿态控制等编辑任务。
- 通过重叠片段去噪方法,克服自回归长视频生成中的内容退化与推理低效问题。
提出的方法
- 该框架将长视频视为一系列重叠的短视频片段序列,实现在时间边界上的联合去噪。
- 每个短视频片段在不同文本条件下,使用现有的现成文本到视频扩散模型独立去噪。
- 通过重叠相邻片段(例如,步长=4,片段长度=16帧)应用时序协同去噪策略,以提升片段边界处的一致性。
- 引入双向跨帧注意力机制,通过在去噪过程中实现时间上的正向与反向信息流动,增强时间连贯性。
- 在一次微调流水线中使用视频片段标识符,以在使用随机噪声时保持运动连续性并防止内容不一致。
- 将去噪后的片段合并并反向转换为更少噪声的长视频,形成无需训练的抽象长视频生成器。
实验结果
研究问题
- RQ1能否在不进行额外训练的情况下,有效扩展现成的短视频扩散模型,以生成包含数百帧的长视频?
- RQ2在长视频生成中,如何在保持不同视频片段间语义一致性的前提下,支持多文本条件?
- RQ3在片段独立去噪的情况下,何种时序去噪策略能实现长视频中的高帧一致性?
- RQ4与稀疏因果注意力相比,双向跨帧注意力在提升时间连贯性方面有多大改善?
- RQ5所提出的框架能否支持多样化的编辑任务,如对象替换、风格迁移和带掩码引导的视频修复?
主要发现
- Gen-L-Video 的帧一致性得分为 93.18(对比独立去噪的 91.65),表明时间连贯性有显著提升。
- 文本对齐得分为 21.18(对比独立去噪的 21.16),方差为 0.48(对比 0.57),表明文本-视频对齐更稳定且准确。
- 人工偏好评估显示,85.38% 的受试者更偏好 Gen-L-Video 在帧一致性与文本对齐方面的表现。
- 该框架成功支持多样化的编辑任务,包括对象替换、背景更换、风格迁移和姿态控制,结果一致。
- 消融实验证实,与稀疏因果注意力相比,双向跨帧注意力能显著降低早期帧的不一致性。
- 该方法仅使用预训练模型即可实现长达数百帧的视频生成,避免了自回归方法的内容退化与效率低下问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。