Skip to main content
QUICK REVIEW

[논문 리뷰] Photorealistic Video Generation with Diffusion Models

Agrim Gupta, Lijun Yu|arXiv (Cornell University)|2023. 12. 11.
Generative Adversarial Networks and Image Synthesis인용 수 7
한 줄 요약

이 논문은 인과 인코더를 사용해 이미지 및 영상 잠재변수를 통합하고, 윈도우형 어텐션을 통해 효율적인 시공간 모델링을 수행하는 트랜스포머 기반 잠재 확산 모델인 W.A.L.T.을 소개한다. UCF-101에서 분류기 자유 지도 없이도 최신 기준(FVD) 점수를 달성하며, 512×896 해상도와 8 fps에서 텍스트 기반 영상 생성의 뛰어난 품질과 효율성을 입증한다.

ABSTRACT

We present W.A.L.T, a transformer-based approach for photorealistic video generation via diffusion modeling. Our approach has two key design decisions. First, we use a causal encoder to jointly compress images and videos within a unified latent space, enabling training and generation across modalities. Second, for memory and training efficiency, we use a window attention architecture tailored for joint spatial and spatiotemporal generative modeling. Taken together these design decisions enable us to achieve state-of-the-art performance on established video (UCF-101 and Kinetics-600) and image (ImageNet) generation benchmarks without using classifier free guidance. Finally, we also train a cascade of three models for the task of text-to-video generation consisting of a base latent video diffusion model, and two video super-resolution diffusion models to generate videos of $512 imes 896$ resolution at $8$ frames per second.

연구 동기 및 목표

  • U-Net 기반 확산 모델의 영상 생성 한계를 극복하기 위해 확장성 있고 효율적이며 고품질의 영상 생성 프레임워크를 개발하는 것.
  • 인과 인코더를 사용해 이미지 및 영상 모델링을 동일한 잠재공간에 통합함으로써 대규모 이미지 및 영상 데이터셋에서의 공동 학습을 가능하게 하는 것.
  • 자기어텐션을 국소적 공간 및 시공간 윈도우로 제한하는 윈도우형 어텐션 메커니즘을 도입해 영상 확산의 계산 비용을 감소시키는 것.
  • 분류기 자유 지도에 의존하지 않고도 이미지 및 영상 생성에서 최신 기준 성능을 달성하는 것.
  • 3개의 확산 모델 캐스케이드를 통해 512×896 해상도와 8 fps에서 고해상도, 시간적으로 일관된 텍스트 기반 영상 생성을 가능하게 하는 것.

제안 방법

  • 인과 인코더가 이미지 및 영상 데이터를 통합된 낮은 차원의 잠재공간으로 압축하여 이미지 및 영상 데이터셋에서의 공동 학습을 가능하게 한다.
  • 트랜스포머 본딩은 메모리 및 계산 비용을 줄이기 위해 번갈아가며 윈도우 제한된 공간 및 시공간 자기어텐션 레이어를 사용한다.
  • 공간 어텐션 레이어는 이미지 및 영상 프레임을 개별적으로 처리하는 반면, 시공간 어텐션 레이어는 겹치지 않는 국소 윈도우를 사용해 영상의 시간적 의존성을 모델링한다.
  • 아이덴티티 어텐션 마스크를 통해 이미지 입력이 시공간 레이어를 그대로 통과하도록 하여 모odal별 처리를 유지한다.
  • 공간 교차어텐션을 통해 텍스트 조건을 적용함으로써 자연어 프롬프트를 사용한 텍스트 기반 영상 생성을 가능하게 한다.
  • 3단계 캐스케이드 모델을 학습한다: 기본 잠재 영상 확산 모델과 이후 두 개의 영상 초해상도 확산 모델을 통해 512×896 해상도로 확장한다.
Figure 2 : W.A.L.T. We encode images and videos into a shared latent space. The transformer backbone processes these latents with blocks having two layers of window-restricted attention: spatial layers capture spatial relations in both images and video, while spatiotemporal layers model temporal dyn
Figure 2 : W.A.L.T. We encode images and videos into a shared latent space. The transformer backbone processes these latents with blocks having two layers of window-restricted attention: spatial layers capture spatial relations in both images and video, while spatiotemporal layers model temporal dyn

실험 결과

연구 질문

  • RQ1트랜스포머 기반 아키텍처가 계산 효율성을 유지하면서도 영상 생성에서 최신 기준 성능을 달성할 수 있는가?
  • RQ2이미지 및 영상 데이터셋에서의 공동 학습이 잠재 영상 확산 모델의 생성 품질을 향상시키는가?
  • RQ3윈도우형 어텐션 메커니즘이 풀어텐션 또는 U-Net 뒷받침 없이도 영상 확산에서 품질을 손상시키지 않고 효과적으로 대체 가능한가?
  • RQ4모델 스케일링 및 공동 이미지-영상 프리트레인의 영향은 텍스트 기반 영상 생성 성능에 어떤가?
  • RQ5캐스케이드 확산 프레임워크는 텍스트 프롬프트로부터 고해상도, 사진 수준의 영상 및 시간적으로 일관된 영상을 생성할 수 있는가?

주요 결과

  • W.A.L.T.는 이미지 및 영상 데이터에서 공동 학습한 3B 파라미터 모델을 사용해 UCF-101의 제로샷 텍스트 기반 영상 생성 벤치마크에서 최신 기준 FVD 점수 258.1을 달성한다.
  • 모델은 UCF-101에서 인ception 점수 35.1을 기록했으며, PYoCo를 제외한 모든 이전 방법보다 뛰어나다. PYoCo는 더 강력한 텍스트 인코더를 사용한다.
  • 이미지 및 영상 데이터셋에서의 공동 학습은 영상 전용 베이스라인 대비 FVD 점수를 20.5% 향상시켜 다중모달 프리트레인의 유용성을 입증한다.
  • 모델을 419M에서 3B 파라미터로 확장함으로써 FVD 점수가 116.7점 향상되었으며, 이는 프레임워크의 강력한 확장성 잠재력을 보여준다.
  • 모델은 512×896 해상도와 8 fps에서 높은 시간적 일관성과 사진 수준의 품질을 갖춘 영상을 생성하며, 정성적 샘플을 통해 검증되었다.
  • 분류기 자유 지도를 사용하지 않고도 UCF-101 및 Kinetics-600에서 클래스 조건부 영상 생성과 ImageNet에서 클래스 조건부 이미지 생성에서 최신 기준 성능을 기록했다.
Figure 3 : Qualitative evaluation. Example videos generated by W.A.L.T from natural language prompts at $512\times 896$ resolution over $3.6$ seconds duration at $8$ frames per second. The W.A.L.T model is able to generate temporally consistent photorealistic videos that align with the textual promp
Figure 3 : Qualitative evaluation. Example videos generated by W.A.L.T from natural language prompts at $512\times 896$ resolution over $3.6$ seconds duration at $8$ frames per second. The W.A.L.T model is able to generate temporally consistent photorealistic videos that align with the textual promp

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.