Skip to main content
QUICK REVIEW

[논문 리뷰] A Survey on Video Diffusion Models

Zhen Xing, Qijun Feng|arXiv (Cornell University)|2023. 10. 16.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

이 종합 검토는 AIGC 시대의 비디오 확산 모델에 대해 처음으로 종합적인 리뷰를 제공하며, 비디오 생성, 편집, 이해 분야로 연구를 체계적으로 분류한다. 방법론, 벤치마크, 평가 지표 및 열린 과제를 분석하여 100개 이상의 핵심 모델을 담은 정제된 리포지터리를 제공하며, 향후 연구를 위한 데이터셋, 효율성, 평가 프레임워크 분야의 핵심 격차를 규명한다.

ABSTRACT

The recent wave of AI-generated content (AIGC) has witnessed substantial success in computer vision, with the diffusion model playing a crucial role in this achievement. Due to their impressive generative capabilities, diffusion models are gradually superseding methods based on GANs and auto-regressive Transformers, demonstrating exceptional performance not only in image generation and editing, but also in the realm of video-related research. However, existing surveys mainly focus on diffusion models in the context of image generation, with few up-to-date reviews on their application in the video domain. To address this gap, this paper presents a comprehensive review of video diffusion models in the AIGC era. Specifically, we begin with a concise introduction to the fundamentals and evolution of diffusion models. Subsequently, we present an overview of research on diffusion models in the video domain, categorizing the work into three key areas: video generation, video editing, and other video understanding tasks. We conduct a thorough review of the literature in these three key areas, including further categorization and practical contributions in the field. Finally, we discuss the challenges faced by research in this domain and outline potential future developmental trends. A comprehensive list of video diffusion models studied in this survey is available at https://github.com/ChenHsing/Awesome-Video-Diffusion-Models.

연구 동기 및 목표

  • 기존 리뷰가 주로 이미지 생성을 다루고 있음에 비해, 비디오 확산 모델에 특화된 최신이고 종합적인 검토가 부족한 점을 보완하기 위함.
  • 비디오 생성, 비디오 편집, 비디오 이해 작업이라는 세 핵심 영역에서 비디오 확산 모델의 체계적인 개요 제공.
  • 최근 비디오 확산 연구에서 사용된 실험 설정, 벤치마크 데이터셋, 평가 지표를 분석하고 비교하기 위함.
  • 한정된 규모의 비디오-텍스트 데이터셋, 높은 학습 비용, 평가 지표의 부족함 등의 주요 과제 규명.
  • 비디오 확산 모델링 분야의 열린 문제와 잠재적 발전 추세를 제시하여 향후 연구를 이끌기 위함.

제안 방법

  • 비디오 생성, 편집, 이해로 분류된 과제별로 100개 이상의 최근 비디오 확산 연구를 체계적으로 문헌 검토.
  • 비디오 생성에 사용되는 확산 모델의 기초 개념, 즉 역방향 노이즈 제거 과정과 U-Net 기반 아키텍처 소개.
  • 비디오 생성 및 편집 분야에서 WebVid, MSVD, ActivityNet 등의 주요 벤치마크 데이터셋을 기반으로 한 실험 설정 분석 및 비교.
  • Fréchet Video Distance (FVD), Inception Score (IS), 인간 평가 등 기존 평가 지표 평가하며 주관적 및 객관적 평가의 한계 강조.
  • 공통 기술 구성 요소(예: 텍스트 조건, 프레임 단위 노이즈 제거, 시간적 모델링 전략 등)를 추출하기 위해 체계적인 파이프라인 활용.
  • 핵심 모델 및 자원의 최신 목록을 유지하기 위해 공개 GitHub 리포지터리(https://github.com/ChenHsing/Awesome-Video-Diffusion-Models) 구축.

실험 결과

연구 질문

  • RQ1생성, 편집, 이해를 위한 비디오 확산 모델의 핵심 기술적 발전과 아키텍처 설계는 무엇인가?
  • RQ2기존 비디오 확산 모델은 표준 벤치마크에서 어떻게 성능을 내며, 학습 및 평가 프로토콜의 주요 차이는 무엇인가?
  • RQ3특히 텍스트-비디오 작업에서, 데이터셋의 규모, 품질, 주석 정확도 측면에서 기존 데이터셋의 주요 제약은 무엇인가?
  • RQ4왜 현재 모델들은 특히 객체 교체 시 복잡한 실체(예: 인간을 동물로 교체)를 다룰 때 시간적 일관성과 구조적 정확성을 유지하지 못하는가?
  • RQ5비디오 확산 모델의 학습 효율성, 추론 속도, 평가 지표 분야에서 가장 시급한 과제는 무엇인가?

주요 결과

  • 2022년 이후 급격한 증가세를 보이며 비디오 확산 모델은 비디오 생성, 편집, 이해 분야에서 급속도로 발전함. 특히 텍스트-비디오 생성 및 비디오 편집 분야에서 두드러진다.
  • 강력한 성능에도 불구하고, WebVid와 같은 기존 텍스트-비디오 데이터셋은 규모(1000만 건)와 품질(360P 해상도, 워터마크 아티팩트) 측면에서 제한되어 있어 모델 일반화 능력 저하.
  • FVD 및 IS와 같은 기존 평가 지표는 텍스트-비디오 생성에서 기준 영상 시퀀스가 존재하지 않아 영상 품질을 충분히 반영하지 못함.
  • 다수의 모델가 원본 비디오의 关건 프레임을 활용해 구조를 유지하려 하지만, 새로운 객체 삽입 시 시간적·공간적 일관성이 떨어지는 경우가 많음.
  • 시간적 일관성은 여전히 주요 과제로 남아 있으며, 특히 인간을 동물로 교체하는 복잡한 엔티티 교체 시 장기적 시간적 추론 능력 부족으로 인해 문제가 발생함.
  • 학습 비용은 여전히 매우 높아 일부 모델는 수백 개의 GPU를 요구할 정도이며, 이는 더 효율적인 학습 및 추론 전략의 긴급한 필요성을 시사함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.