Skip to main content
QUICK REVIEW

[논문 리뷰] Motion-Conditioned Diffusion Model for Controllable Video Synthesis

Tsai-Shien Chen, Chieh Hubert Lin|arXiv (Cornell University)|2023. 04. 27.
Computer Graphics and Visualization Techniques인용 수 6
한 줄 요약

MCDiff는 참조 이미지와 희박한 스트로크 입력을 사용하여 전경 객체의 운동과 카메라 역학을 모두 안내하는 이중 단계의 운동 조건화 확산 모델을 제안한다. 먼저 의미 인식 흐름 보완 네트워크를 통해 희박한 스트로크를 조밀한 광학 흐름으로 보완하고, 그 다음 확산 모델을 사용해 고품질의 미래 프레임을 생성함으로써, 다양한 인간 활동과 운동 유형에서 스트로크 유도 비디오 생성 분야에서 최신 기술 수준의 시각적 품질을 달성한다.

ABSTRACT

Recent advancements in diffusion models have greatly improved the quality and diversity of synthesized content. To harness the expressive power of diffusion models, researchers have explored various controllable mechanisms that allow users to intuitively guide the content synthesis process. Although the latest efforts have primarily focused on video synthesis, there has been a lack of effective methods for controlling and describing desired content and motion. In response to this gap, we introduce MCDiff, a conditional diffusion model that generates a video from a starting image frame and a set of strokes, which allow users to specify the intended content and dynamics for synthesis. To tackle the ambiguity of sparse motion inputs and achieve better synthesis quality, MCDiff first utilizes a flow completion model to predict the dense video motion based on the semantic understanding of the video frame and the sparse motion control. Then, the diffusion model synthesizes high-quality future frames to form the output video. We qualitatively and quantitatively show that MCDiff achieves the state-the-of-art visual quality in stroke-guided controllable video synthesis. Additional experiments on MPII Human Pose further exhibit the capability of our model on diverse content and motion synthesis.

연구 동기 및 목표

  • 확산 기반 비디오 합성에서 내용과 운동을 모두 특정하는 세밀하고 직관적인 제어의 부족을 해결하기 위해.
  • 종단 간 확산 비디오 생성에서 희박한 운동 입력(예: 단일 픽셀 스트로크)의 모호성과 어려움을 극복하기 위해.
  • 합성된 비디오에서 객체 수준의 운동과 카메라 역학(예: 줌, 편향)에 대한 민첩한 제어를 가능하게 하기 위해.
  • 이중 단계 프레임워크를 사용하여 스트로크 유도 비디오 합성에서 시각적 정밀도와 운동 일관성을 향상시키기 위해.
  • MPII Human Pose와 같은 다양한 복잡한 인간 운동 데이터셋에서 일반화 성능을 평가하기 위해.

제안 방법

  • 이중 단계 프레임워크: 첫 번째 단계에서 흐름 보완 모델(F)은 의미적 맥락을 활용하여 희박한 스트로크와 초기 비디오 프레임에서 조밀한 광학 흐름을 예측한다.
  • 흐름 보완 모델은 U-Net 기반 아키텍처를 사용하며, 스트로크를 이미지 프레임의 의미 특징과 정렬하기 위해 교차 어텐션을 활용한다.
  • 두 번째 단계에서 조건부 확산 모델(G)은 초기 프레임과 예측된 조밀한 흐름을 조건 입력으로 사용하여 미래 비디오 프레임을 생성한다.
  • 전체 시스템은 흐름 보완과 프레임 생성 간의 상호 운용을 보장하기 위해 종단 간 미세조정된다.
  • 확산 모델은 시간 인코딩을 사용하여 시간 역학을 모델링하는 잠재 확산 아키텍처를 채택한다.
  • 모델은 일반화 및 제어 정밀도 평가를 위해 MPII Human Pose를 포함한 세 개의 대규모 데이터셋에서 훈련 및 평가된다.

실험 결과

연구 질문

  • RQ1희박한 운동 입력에서 모호성이 있는 상황에서 스트로크 유도 비디오 합성에서 이중 단계 확산 모델이 단일 단계 종단 간 학습보다 우수한 성능을 낼 수 있는가?
  • RQ2흐름 보완 모델은 입력 프레임의 의미 일관성을 유지하면서도 희박한 스트로크에서 조밀한 운동 필드를 효과적으로 추론할 수 있는가?
  • RQ3모델은 스트로크 입력으로부터 전경 객체 운동과 배경 카메라 운동을 구분하여 이해할 수 있는가?
  • RQ4이 프레임워크는 단순한 데이터셋을 넘어서 다양한 인간 활동과 복잡한 운동 패턴으로 일반화될 수 있는가?
  • RQ5흐름 보완을 포함함으로써, 희박한 스트로크에서 직접 확산하는 것과 비교해 시각적 품질과 운동 일관성이 얼마나 향상되는가?

주요 결과

  • MCDiff는 TaiChi-HD와 Human3.6M와 같은 표준 벤치마크에서 최신 기술 수준의 시각적 품질을 달성하여, 정성적 및 정량적 평가에서 이전의 스트로크 유도 방법들을 능가한다.
  • 제거 실험을 통해 이중 단계 설계와 흐름 보완이 직접 단일 단계 학습보다 성능을 크게 향상시키며, 운동의 모호성을 해결하기 위한 필요성을 입증한다.
  • 흐름 보완 모델은 복잡한 운동, 예를 들어 물체 간 상호작용(예: 손이 옷을 움켜쥐는 것)과 다중 물체 이동에 대해 일관된 조밀한 흐름을 성공적으로 추론한다.
  • 모델은 전경에 그린 스트로크를 객체 운동으로, 배경에 그린 스트로크를 카메라 조정으로 해석하여 현실적인 카메라 경로를 생성한다.
  • MPII Human Pose 데이터셋에서 MCDiff는 다양한 카메라 설정과 장면 조건에서 400개 이상의 다양한 인간 활동에 대해 잘 일반화된다.
  • 모델는 훈련 분포 외의 편집(예: 훈련 분포를 초월하는 물체 이동)을 처리하는 데 한계를 보이며, 패턴 기반의 흐름 추정에 의존함으로써 무늬가 없는 또는 시각적 환각적인 장면에서는 실패한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.