Skip to main content
QUICK REVIEW

[논문 리뷰] Dreamix: Video Diffusion Models are General Video Editors

Eyal Molad, Eliahu Horwitz|arXiv (Cornell University)|2023. 02. 02.
Generative Adversarial Networks and Image Synthesis인용 수 43
한 줄 요약

Dreamix는 확산 모델에 기반한 텍스트 가이드 비디오 편집기를 도입하여 원본 비디오에 대한 충실도를 유지하면서 외관 및 모션 편집을 가능하게 한다. 또한 비디오 프레임과 저해상 입력 비디오에 대한 혼합 미세조정을 통해 이미지 애니메이션 및 피사체 주도형 비디오 생성을 가능하게 한다.

ABSTRACT

Text-driven image and video diffusion models have recently achieved unprecedented generation realism. While diffusion models have been successfully applied for image editing, very few works have done so for video editing. We present the first diffusion-based method that is able to perform text-based motion and appearance editing of general videos. Our approach uses a video diffusion model to combine, at inference time, the low-resolution spatio-temporal information from the original video with new, high resolution information that it synthesized to align with the guiding text prompt. As obtaining high-fidelity to the original video requires retaining some of its high-resolution information, we add a preliminary stage of finetuning the model on the original video, significantly boosting fidelity. We propose to improve motion editability by a new, mixed objective that jointly finetunes with full temporal attention and with temporal attention masking. We further introduce a new framework for image animation. We first transform the image into a coarse video by simple image processing operations such as replication and perspective geometric projections, and then use our general video editor to animate it. As a further application, we can use our method for subject-driven video generation. Extensive qualitative and numerical experiments showcase the remarkable editing ability of our method and establish its superior performance compared to baseline methods.

연구 동기 및 목표

  • 실제 비디오에서 텍스트 기반의 일반적인 외관 및 모션 편집을 비디오 확산 모델을 통해 가능하게 한다.
  • 혼합 미세조정 전략으로 전체 시간적 주의력과 시간적 주의 마스킹을 결합하여 모션 편집 가능성을 높인다.
  • Dreamix 편집기로 이미지를 거친 비디오로 변환한 뒤 이미지-투-비디오 애니메이션 프레임워크를 제안한다.
  • 피사체 이미지를 한 세트로 미세조정하고 텍스트 프롬프트를 이용해 가이드된 비디오 생성을 가능하게 한다.

제안 방법

  • 텍스트 프롬프트와 저해상 입력 비디오를 조건으로 고해상도 편집 비디오를 생성하기 위해 계단식 비디오 확산 모델(Imagen-Video 베이스)을 사용한다.
  • 입력 비디오를 다운샘플링하고 노이즈를 추가하여 오염시키고, 텍스트 프롬프트를 조건으로 하는 역확산 과정을 통해 텍스트 가이드를 통한 편집(오염 반전)을 달성한다.
  • 입력 비디오의 외관과 모션을 함께 최적화하는 혼합 미세조정을 도입하고, 프레임 간의 세부 정보를 보존하면서 모션 편집을 가능하게 하는 마스크된 시간적 주의가 있는 비순차 프레임 셋을 함께 최적화한다.
  • 두 가지 목표로 학습한다: L_vid는 노이즈가 있는 저해상 입력으로 주어진 입력 비디오를 재구성하고, L_frame은 마스크된 시간적 주의가 있는 개별 프레임( D^a )을 재구성한다.
  • 이미지에서 거친 비디오를 만들어 반복 복제나 원근 변환을 통해 이미지를 비디오로 변환한 다음 Dreamix 편집을 적용해 고품질의 편집 비디오를 얻는 이미지-투-비디오 워크플로우를 제공한다.
  • 특별 토큰 t*를 사용하는 피사체 이미지 세트에 대해 미세조정하고 생성에 텍스트 프롬프트를 이용하여 피사체 주도형 비디오 생성을 가능하게 한다.

실험 결과

연구 질문

  • RQ1텍스트 가이드 비디오 확산 모델이 원본 비디오에 대한 충실도를 유지하면서 외관과 모션을 모두 편집할 수 있는가?
  • RQ2혼합 미세조정이 모션 편집성과 전체 편집 품질을 비디오 전용 또는 미세조정 없는 경우보다 개선하는가?
  • RQ3Dreamix 프레임워크를 이미지 애니메이션 및 피사체 주도형 비디오 생성으로 확장할 수 있는가?
  • RQ4확산 모델을 이용한 고품질 비디오 편집에 대한 트레이드오프와 요구사항(하이퍼파라미터, 계산 비용 등)은 무엇인가?

주요 결과

  • Dreamix는 실제 세계 비디오에 대한 일반 텍스트 기반의 외관 및 모션 편집을 가능하게 하며 시간적 일관성을 개선한다.
  • 마스크된 시간적 주의가 있는 혼합 미세조정은 모션 편집을 크게 개선하고 배경 세부 정보를 보존하는 데 비해 비혼합 또는 비디오 전용 미세조정에 비해 우수하다.
  • Dreamix는 이미지를 거친 비디오로 변환하고 Dreamix 편집기로 편집하여 이미지 애니메이션 프레임워크를 제공한다.
  • 피사체 이미지를 이용한 미세조정으로 피사체 주도형 비디오 생성을 가능하게 하고 텍스트 프롬프트를 조건으로 비디오를 생성한다.
  • 베이스라인과 비교할 때 Dreamix는 사용자 평가 품질, 충실도, 프롬프트 정렬에서 더 높은 점수를 얻고 73%의 성공률(대비 40%의 ImgenVid, 15%의 PnP)을 달성한다.
  • 정량적 베이스라인은 Dreamix가 프레임 단위 편집 접근 방식보다 시간적 일관성과 충실도에서 우수하다고 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.