Skip to main content
QUICK REVIEW

[论文解读] A Survey on Video Diffusion Models

Zhen Xing, Qijun Feng|arXiv (Cornell University)|Oct 16, 2023
Generative Adversarial Networks and Image Synthesis被引用 5
一句话总结

本综述首次系统性地回顾了AIGC时代下的视频扩散模型,将研究系统性地划分为视频生成、编辑与理解三大领域。综述分析了方法论、基准数据集、评估指标及开放性挑战,提供了一个包含100多个关键模型的精选资源库,并指出了未来研究在数据集、效率与评估框架方面存在的关键空白。

ABSTRACT

The recent wave of AI-generated content (AIGC) has witnessed substantial success in computer vision, with the diffusion model playing a crucial role in this achievement. Due to their impressive generative capabilities, diffusion models are gradually superseding methods based on GANs and auto-regressive Transformers, demonstrating exceptional performance not only in image generation and editing, but also in the realm of video-related research. However, existing surveys mainly focus on diffusion models in the context of image generation, with few up-to-date reviews on their application in the video domain. To address this gap, this paper presents a comprehensive review of video diffusion models in the AIGC era. Specifically, we begin with a concise introduction to the fundamentals and evolution of diffusion models. Subsequently, we present an overview of research on diffusion models in the video domain, categorizing the work into three key areas: video generation, video editing, and other video understanding tasks. We conduct a thorough review of the literature in these three key areas, including further categorization and practical contributions in the field. Finally, we discuss the challenges faced by research in this domain and outline potential future developmental trends. A comprehensive list of video diffusion models studied in this survey is available at https://github.com/ChenHsing/Awesome-Video-Diffusion-Models.

研究动机与目标

  • 为解决现有综述主要聚焦于图像生成而缺乏针对视频扩散模型的最新、全面回顾的问题。
  • 系统性地概述视频扩散模型在三大核心领域(视频生成、视频编辑与视频理解)中的发展情况。
  • 分析并比较近期视频扩散研究中采用的实验设置、基准数据集与评估指标。
  • 识别关键挑战,如小规模视频-文本数据集、高昂的训练成本以及评估指标不足。
  • 通过指出开放性问题与潜在发展趋势,为未来研究提供指导。

提出的方法

  • 本综述对100余篇近期视频扩散模型相关研究进行了系统性文献回顾,按任务分类为视频生成、编辑与理解。
  • 介绍了扩散模型的基础概念,包括反向去噪过程及视频生成中使用的U-Net架构。
  • 分析并比较了多个基准数据集(如WebVid、MSVD与ActivityNet)在视频生成与编辑任务中的实验设置。
  • 评估了现有评估指标,包括Fréchet Video Distance(FVD)、Inception Score(IS)与人工评估,指出了主观与客观评估中的局限性。
  • 采用结构化流程提取共享技术组件,如文本条件控制、逐帧去噪与时间建模策略。
  • 建立了一个公开的GitHub仓库(https://github.com/ChenHsing/Awesome-Video-Diffusion-Models),用于持续维护关键模型与资源的最新列表。

实验结果

研究问题

  • RQ1在视频生成、编辑与理解任务中,视频扩散模型的核心技术进展与架构设计是什么?
  • RQ2当前视频扩散模型在标准基准上的表现如何?其训练与评估协议的关键差异是什么?
  • RQ3现有数据集在规模、质量与标注准确性方面存在哪些主要局限,特别是在文本到视频任务中?
  • RQ4为何当前模型在视频编辑中仍难以保持时间一致性与结构保真度,特别是在对象替换任务中?
  • RQ5在训练效率、推理速度与评估指标方面,视频扩散模型面临的最紧迫挑战是什么?

主要发现

  • 自2022年以来,视频扩散模型在视频生成、编辑与理解方面迅速发展,尤其在文本到视频与视频编辑领域发表数量显著增长。
  • 尽管性能强劲,现有文本到视频数据集(如WebVid)在规模(1000万样本)与质量(360P分辨率、水印伪影)方面仍受限,制约了模型的泛化能力。
  • 现有评估指标如FVD与IS不足以准确捕捉视频质量,原因在于文本到视频生成任务中缺乏真实视频序列作为参考。
  • 许多模型依赖源视频的关键帧来保持结构完整性,但该方法在插入新对象时往往难以维持时空一致性。
  • 时间不一致性仍是视频编辑中的主要问题,尤其在将人类等复杂实体替换为动物时,反映出模型在长程时间推理能力上的不足。
  • 训练成本依然过高,部分模型需数百张GPU训练,凸显了对更高效训练与推理策略的迫切需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。