Skip to main content
QUICK REVIEW

[논문 리뷰] Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models

Songwei Ge, Seungjun Nah|arXiv (Cornell University)|2023. 05. 17.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

이 논문은 사전 훈련된 이미지 확산 모델에서 학습한 바탕으로 영상의 시간적 상관관계를 유지하는 새로운 영상 노이즈 사전인 PYoCo를 제안한다. 서로 다른 프레임 간의 노이즈 상관관계를 모델링함으로써 i.i.d. 노이즈를 사용하는 것과는 달리, PYoCo는 영상 생성을 위한 이미지 확산 모델의 효율적인 파인튜닝을 가능하게 하여, UCF-101과 MSR-VTT에서 SOTA 수준의 제로샷 텍스트-영상 성능을 달성하면서도 계산량과 모델 크기를 크게 줄였다.

ABSTRACT

Despite tremendous progress in generating high-quality images using diffusion models, synthesizing a sequence of animated frames that are both photorealistic and temporally coherent is still in its infancy. While off-the-shelf billion-scale datasets for image generation are available, collecting similar video data of the same scale is still challenging. Also, training a video diffusion model is computationally much more expensive than its image counterpart. In this work, we explore finetuning a pretrained image diffusion model with video data as a practical solution for the video synthesis task. We find that naively extending the image noise prior to video noise prior in video diffusion leads to sub-optimal performance. Our carefully designed video noise prior leads to substantially better performance. Extensive experimental validation shows that our model, Preserve Your Own Correlation (PYoCo), attains SOTA zero-shot text-to-video results on the UCF-101 and MSR-VTT benchmarks. It also achieves SOTA video generation quality on the small-scale UCF-101 benchmark with a $10 imes$ smaller model using significantly less computation than the prior art.

연구 동기 및 목표

  • 고비용의 계산과 대규모 영상 데이터셋의 부족으로 인해 여전히 어려운, 확산 모델을 이용한 포토레알리틱하고 시간적으로 일관된 영상 생성 문제를 해결한다.
  • 프레임 간에 독립적이고 동일하게 분포된(i.i.d.) 노이즈를 사용하는 것에 의해 영상으로 확장할 경우 성능이 열등해지는 문제를 해결한다.
  • 사전 훈련된 이미지 확산 모델을 활용하여 영상 생성의 시각적 품질을 전이하고 훈련 비용을 절감한다.
  • 영상 프레임 간의 시간적 상관관계를 명시적으로 모델링하는 노이즈 사전을 설계하여 영상 생성의 정밀도와 일관성을 향상시킨다.
  • 기존 방법보다 훨씬 작은 모델과 더 적은 계산 자원으로 제로샷 텍스트-영상 벤치마크에서 최고 성능을 달성한다.

제안 방법

  • 사전 훈련된 이미지 확산 모델의 잠재 노이즈 맵에서 학습한 바탕으로, 영상 확산 과정 중에 시간적 상관관계를 노이즈 맵 분포에 통합하는 점진적 노이즈 사전을 제안한다.
  • 동일한 영상의 프레임들에 대해 t-SNE를 사용하여 노이즈 맵 상관관계를 시각화하고 분석함으로써, 같은 영상의 프레임들이 잠재공간에서 강한 상관관계를 보임(집합적으로 군집됨)을 확인하였으며, 이는 i.i.d. 노이즈와는 대조됨을 확인한다.
  • 영상 데이터의 공간적 및 시간적 구조에서 학습함으로써 시간적 의존성을 모델링하는 구조화된 노이즈 사전으로 표준 i.i.d. 가우시안 노이즈 사전을 대체한다.
  • 통합된 이미지-영상 노이즈 제거 손실을 사용하여, 제안된 영상 노이즈 사전를 활용해 사전 훈련된 텍스트-이미지 확산 모델을 파인튜닝함으로써 효과적인 영상 생성으로의 전이를 가능하게 한다.
  • 영상 품질과 다양성을 향상시키기 위해 기존에 잘 알려진 영상 생성 기법들인 시간적 어텐션, 계층적 생성, 전문가 노이즈 제거기의 앙상블을 통합한다.
  • 이중 단계 훈련 파이프라인을 사용한다: 먼저 UCF-101의 이미지 프레임에서 사전 훈련을 수행하고, 이후 새로운 노이즈 사전를 사용하여 영상 데이터에서 파인튜닝함으로써 시간적 일관성을 유지한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 이미지 확산 모델을 영상 생성에 효과적으로 파인튜닝할 수 있는가, 즉 다시 훈련하지 않고도 가능할까?
  • RQ2이미지 확산 모델에서 유도된 i.i.d. 노이즈 사전을 영상 확산 모델에 그대로 확장할 경우, 무시된 시간적 상관관계로 인해 성능이 떨어지는가?
  • RQ3시간적 상관관계를 유지하는 학습된 노이즈 사전가 영상 생성 품질과 시간적 일관성에 크게 기여하는가?
  • RQ4더 작은, 파인튜닝된 모델이 더 큰, 다시 훈련된 영상 확산 모델에 비해 품질과 효율성 측면에서 얼마나 뛰어나게 성능을 내는가?
  • RQ5제안된 노이즈 사전는 UCF-101과 MSR-VTT와 같은 다양한 벤치마크에서 제로샷 텍스트-영상 생성에 일반화 가능한가?

주요 결과

  • PYoCo는 UCF-101과 MSR-VTT 벤치마크에서 영상 데이터에 대한 파인튜닝 없이도 SOTA 수준의 제로샷 텍스트-영상 생성 성능을 달성한다.
  • UCF-101 벤치마크에서 PYoCo는 기존 SOTA 방법보다 10배 작고, 훨씬 적은 계산 자원을 사용하면서도 SOTA 성능을 기록한다.
  • 모델은 뛰어난 시간적 일관성과 포토레알리즘을 보이며, 텍스트 프롬프트에 정확하게 부합하는 고화질 영상 클립을 생성한다.
  • 노이즈 맵 분석 결과, 동일한 영상의 프레임들이 잠재공간에서 강한 상관관계를 보임을 확인하여, 구조화된 노이즈 사전의 필요성을 검증한다.
  • 점진적 노이즈 사전 설계가 시간적 의존성을 효과적으로 포착하여, i.i.d. 노이즈 기반 베이스라인에 비해 영상 생성 품질이 향상됨을 입증한다.
  • 이 방법은 이미지 확산 모델의 영상 생성을 위한 효율적인 파인튜닝을 가능하게 하여, 훈련 비용을 줄이면서도 성능을 유지하거나 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.