Skip to main content
QUICK REVIEW

[논문 리뷰] DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors

Jinbo Xing, Menghan Xia|arXiv (Cornell University)|2023. 10. 18.
Generative Adversarial Networks and Image Synthesis인용 수 6
한 줄 요약

DynamiCrafter는 이중 스트림 주입 기반으로 비디오 디퓨전 사전 지식을 활용하여 개방 도메인 이미지를 애니메이션화하는 새로운 방법을 제안한다: 하나의 스트림은 의미적 운동 이해를 위해 텍스트에 정렬된 컨텍스트 특징을 사용하고, 다른 하나는 노이즈가 첨가된 전체 이미지를 입력하여 시각적 세부 정보를 유지한다. 이 방법은 기존의 방법들에 비해 더 나은 운동 자연성, 이미지 충실도 및 텍스트 유도 운동 제어 성능을 달성한다.

ABSTRACT

Animating a still image offers an engaging visual experience. Traditional image animation techniques mainly focus on animating natural scenes with stochastic dynamics (e.g. clouds and fluid) or domain-specific motions (e.g. human hair or body motions), and thus limits their applicability to more general visual content. To overcome this limitation, we explore the synthesis of dynamic content for open-domain images, converting them into animated videos. The key idea is to utilize the motion prior of text-to-video diffusion models by incorporating the image into the generative process as guidance. Given an image, we first project it into a text-aligned rich context representation space using a query transformer, which facilitates the video model to digest the image content in a compatible fashion. However, some visual details still struggle to be preserved in the resultant videos. To supplement with more precise image information, we further feed the full image to the diffusion model by concatenating it with the initial noises. Experimental results show that our proposed method can produce visually convincing and more logical & natural motions, as well as higher conformity to the input image. Comparative evaluation demonstrates the notable superiority of our approach over existing competitors.

연구 동기 및 목표

  • 도메인 특화 또는 확률적 운동 유형을 초월하여 개방 도메인 이미지에 대한 고해상도 애니메이션을 가능하게 하기 위해.
  • 기존의 텍스트에서 비디오 모델이 이미지 세부 정보를 유지하고 애니메이션 중 시간적 일관성을 확보하는 데 한계를 극복하기 위해.
  • 이미지 애니메이션에서 운동 역학을 제어하기 위해 텍스트 프롬프트를 사용하는 것의 가능성을 탐색하기 위해.
  • 의미적 이해와 시각적 세부 정보 유지 간의 균형을 이루는 이중 스트림 이미지 주입 메커니즘을 개발하기 위해.
  • 기존의 비디오 디퓨전 모델을 최소한의 아키텍처 수정으로 일반 목적의 이미지 애니메이션에 활용할 수 있는 가능성을 입증하기 위해.

제안 방법

  • 쿼리 트랜스포머 네트워크는 사전 훈련된 CLIP 이미지 인코더를 사용하여 입력 이미지를 텍스트에 정렬된 풍부한 컨텍스트 표현 공간으로 매핑한다.
  • 컨텍스트 표현은 교차 어텐션 레이어에서 게이팅 퓨전을 통해 텍스트 조건 특징과 융합되어 운동 합성에 유도된다.
  • 두 번째 스트림은 입력 이미지를 초기 노이즈와 연결하여 정확한 시각적 세부 정보 감시를 제공한다.
  • 추론 중에는 다중 조건 분류자 자유 가이던스가 적용되어 이미지 충실도(s_img)와 텍스트 프롬프트 준수도(s_txt)를 별도로 제어할 수 있다.
  • 이 방법은 이미지 애니메이션을 위해 미세조정된 사전 훈련된 잠재 VDM 모델을 활용하며, 효율성을 위해 잠재 공간에서 작동한다.
  • 이중 스트림 설계는 의미적 컨텍스트와 픽셀 수준의 세부 정보를 보완적으로 활용하여 더 일관되고 충실한 비디오 생성을 가능하게 한다.

실험 결과

연구 질문

  • RQ1비디오 디퓨전 모델은 시각적 세부 정보를 유지하면서도 임의의 개방 도메인 이미지를 효과적으로 애니메이션화하기 위해 적절히 적응시킬 수 있는가?
  • RQ2이미지와 텍스트 조건을 함께 최적화하여 타당하고 의미적으로 일치하는 운동을 생성할 수 있는가?
  • RQ3다양한 이미지 주입 전략이 운동 품질과 이미지 일치도에 어떤 영향을 미치는가?
  • RQ4텍스트 프롬프트를 사용하여 이미지 애니메이션에서 특정 운동 유형(예: 춤추기, 손 흔들기 등)을 제어할 수 있는가?
  • RQ5이중 스트림 주입 메커니즘은 단일 스트림 또는 단순한 이미지 주입 방식에 비해 시각적 충실도와 시간적 일관성 측면에서 어떻게 비교되는가?

주요 결과

  • Qualitative 비교 및 사용자 연구를 통해 VideoComposer, I2VGen-XL, PikaLabs, Gen-2와 같은 최신 기술들에 비해 DynamiCrafter는 더 뛰어난 시각적 품질과 운동 자연성을 달성한다.
  • 복잡한 장면에서도 최소한의 왜곡과 강력한 局부 시각적 세부 정보 유지로 높은 이미지 충실도를 유지한다.
  • 사용자 연구 결과, DynamiCrafter가 생성한 애니메이션은 기준 방법들에 비해 운동 타당성과 이미지 일치도에서 유의미하게 높은 평가를 받았다.
  • 이중 스트림 주입 메커니즘은 단일 스트림 기반 방법에 비해 의미적 운동 생성과 시각적 세부 정보 유지 간의 균형을 더 잘 달성한다.
  • s_img와 s_txt의 가이던스 스케일 조정을 통해 이미지 충실도와 프롬프트 준수도를 영향을 미치는 제어가 가능하여 텍스트를 통한 효과적인 운동 제어가 가능하다.
  • 모호한 의미나 복잡한 운동 기술에 대한 한계가 존재하지만, 얼굴나 복잡한 물체를 포함한 다양한 개방 도메인 이미지에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.