Skip to main content
QUICK REVIEW

[论文解读] StableVideo: Text-driven Consistency-aware Diffusion Video Editing

Wenhao Chai, Xun Guo|arXiv (Cornell University)|Aug 18, 2023
Generative Adversarial Networks and Image Synthesis被引用 5
一句话总结

StableVideo 引入了一种基于文本的扩散视频编辑框架,通过利用帧间传播和分层全景图表示,确保编辑对象在几何和时间上的一致性。该方法在计算复杂度低于当前最先进方法的前提下,实现了更优的编辑质量,在定性和定量指标上均优于 Tune-A-Video 和 Text2LIVE 等方法。

ABSTRACT

Diffusion-based methods can generate realistic images and videos, but they struggle to edit existing objects in a video while preserving their appearance over time. This prevents diffusion models from being applied to natural video editing in practical scenarios. In this paper, we tackle this problem by introducing temporal dependency to existing text-driven diffusion models, which allows them to generate consistent appearance for the edited objects. Specifically, we develop a novel inter-frame propagation mechanism for diffusion video editing, which leverages the concept of layered representations to propagate the appearance information from one frame to the next. We then build up a text-driven video editing framework based on this mechanism, namely StableVideo, which can achieve consistency-aware video editing. Extensive experiments demonstrate the strong editing capability of our approach. Compared with state-of-the-art video editing methods, our approach shows superior qualitative and quantitative results. Our code is available at \href{https://github.com/rese1f/StableVideo}{this https URL}.

研究动机与目标

  • 为解决基于扩散模型的视频编辑中,尤其在视角变化下对象外观跨帧缺乏时间一致性的问题。
  • 克服直接全景图编辑的局限性,后者因视角变化导致几何失真。
  • 在保持原始几何结构和运动的前提下,实现对前景和背景对象的高保真、基于文本的编辑。
  • 相比现有基于扩散模型的视频编辑方法,降低计算复杂度。

提出的方法

  • 引入帧间传播机制,通过部分全景图表示对齐关键帧之间的外观,以维持几何一致性。
  • 使用扩散模型基于文本提示编辑关键帧,去噪过程由前一帧传播的外观信息引导。
  • 采用聚合网络从关键帧编辑结果重建编辑后的全景图,确保准确映射回所有视频帧。
  • 利用神经分层全景图(NLA)将视频分解为前景和背景图层,实现精确的对象级编辑。
  • 在帧间传播模块中引入超参数 $ t_0 $,以平衡真实感与外观一致性,通过二分查找进行优化。
  • 前景和背景编辑共享相同的扩散主干网络,实现高效且可扩展的推理。

实验结果

研究问题

  • RQ1基于文本的扩散模型能否在具有复杂运动和视角变化的长视频序列中实现一致的外观编辑?
  • RQ2在使用扩散模型编辑视频特定对象时,如何保持时间一致性?
  • RQ3与直接全景图编辑相比,通过帧间传播编辑关键帧是否在视觉保真度和一致性方面表现更优?
  • RQ4在基于扩散模型的视频编辑中,真实感与外观一致性之间的最优权衡是什么?
  • RQ5能否基于预训练的扩散模型与分层表示,构建一个轻量化且一致的视频编辑框架?

主要发现

  • StableVideo 的 CLIP 得分为 0.2713,与 Tune-A-Video(0.2787)相当,但在 LPIPS-P(0.1613 vs. 0.6346)和 LPIPS-T(0.0386 vs. 0.1851)上显著优于后者,表明其一致性更优。
  • 在密集光流一致性评估中,StableVideo 的前景编辑得分为 3.34,合成编辑得分为 11.48,优于 Tune-A-Video(4.63 和 12.74)和 Text2LIVE(1.99 和 7.39)。
  • 消融实验表明,当 $ t_0 \approx 0.8 $ 时,帧间传播在真实感与外观一致性之间达到最佳平衡。
  • 直接全景图编辑导致严重形变与不一致,证明了结合传播机制的关键帧编辑的必要性。
  • 在长距离运动和视角变化下,该方法仍能保持高度一致性,如‘雪天冬季的橙色SUV’编辑示例所示。
  • 在非刚性形变情况下出现失败,表明当前方法在处理复杂物体动态方面仍存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。