Skip to main content
QUICK REVIEW

[논문 리뷰] DreamVideo: Composing Your Dream Videos with Customized Subject and Motion

Yujie Wei, Shiwei Zhang|arXiv (Cornell University)|2023. 12. 07.
Generative Adversarial Networks and Image Synthesis인용 수 6
한 줄 요약

DreamVideo는 경량형 아이덴티티 및 모션 어댑터를 통해 주체 정체성과 동작 학습을 분리하는 이중 단계의 확산 기반 방법을 도입하여, 몇 장의 이미지와 영상만으로도 주체의 외형과 동작 패턴을 맞춤 설정할 수 있는 개인화된 비디오 생성을 구현한다. 이는 기존 방법에 비해 정밀도, 정체성 유지 및 동작 다양성 측면에서 최신 기술 수준을 초월한다.

ABSTRACT

Customized generation using diffusion models has made impressive progress in image generation, but remains unsatisfactory in the challenging video generation task, as it requires the controllability of both subjects and motions. To that end, we present DreamVideo, a novel approach to generating personalized videos from a few static images of the desired subject and a few videos of target motion. DreamVideo decouples this task into two stages, subject learning and motion learning, by leveraging a pre-trained video diffusion model. The subject learning aims to accurately capture the fine appearance of the subject from provided images, which is achieved by combining textual inversion and fine-tuning of our carefully designed identity adapter. In motion learning, we architect a motion adapter and fine-tune it on the given videos to effectively model the target motion pattern. Combining these two lightweight and efficient adapters allows for flexible customization of any subject with any motion. Extensive experimental results demonstrate the superior performance of our DreamVideo over the state-of-the-art methods for customized video generation. Our project page is at https://dreamvideo-t2v.github.io.

연구 동기 및 목표

  • 확산 기반 모델에서 아직 탐색되지 않은 주체 정체성과 동작을 동시에 맞춤 설정하는 도전 과제를 해결하기 위해.
  • 기존 방법이 주로 주체 또는 동작만 최적화하므로 일반화 능력과 성능이 저하되는 한계를 극복하기 위해.
  • 주체와 동작 학습을 두 개의 경량형 트레이너블 어댑터로 분리하여 영향력 있고 효율적이며 고해상도의 비디오 생성을 가능하게 하기 위해.
  • 다양한 주체-동작 조합에 대해 광범위한 정성적 및 정량적 실험을 통해 제안된 방법의 효과성을 검증하기 위해.

제안 방법

  • 모델의 기존 가중치를 동결한 사전 학습된 비디오 확산 모델을 사용하여 비디오 맞춤 설정을 두 단계로 분리한다: 주체 학습 및 동작 학습.
  • 주체 학습 단계에서는 먼저 텍스트 기반 정체성(텍스트 인버전)을 최적화한 후, 입력 이미지에서 세밀한 외형 특징을 캡처하기 위해 맞춤형 정체성 어댑터를 미세 조정한다.
  • 동작 학습 단계에서는 입력 동작 영상에 대해 동작 어댑터를 학습시키며, CLIP 임베딩된 이미지 특징을 외형 가이던스로 사용하여 외형 특징을 학습하지 않고 오직 동작 패턴에만 집중한다.
  • 추론 단계에서 두 경량 어댑터를 결합하고, 랜덤으로 선택된 훈련 이미지를 외형 가이던스로 사용하여 원하는 동작을 갖춘 개인화된 비디오를 생성한다.
  • 모든 트랜스포머 레이어에 병렬 어댑터를 적용하여 성능 향상을 도모하고, 파라미터 융합 갈등을 방지한다.
  • 기존 모델의 가중치를 수정하지 않아 안정성과 사전 학습된 확산 모델과의 호환성을 보장한다.

실험 결과

연구 질문

  • RQ1확산 기반 비디오 생성 모델이 동시에 주체 정체성과 동작 패턴을 효과적으로 맞춤 설정할 수 있는가?
  • RQ2주체와 동작 맞춤 설정을 어떻게 분리하여 영향력 있고 최적화 복잡도를 낮출 수 있는가?
  • RQ3전용 정체성 및 동작 어댑터를 사용할 경우, LoRA와 같은 파라미터 효율적 미세 조정 방법보다 비디오 맞춤 설정 작업에서 성능이 뛰어나지 않는가?
  • RQ4소수의 입력으로 주체 정체성을 얼마나 잘 유지하고 다양한 정확한 동작 패턴을 생성할 수 있는가?
  • RQ5복잡하거나 드문 주체-동작 조합을 다룰 때 이 방법의 실패 원인과 한계는 무엇인가?

주요 결과

  • 광범위한 정성적 및 정량적 평가를 통해 DreamVideo는 최신 기술 수준의 방법에 비해 개인화된 비디오 생성에서 뛰어난 성능을 달성한다.
  • 모델은 다양한 맥락에서 주체 정체성을 효과적으로 유지하며, 입력 동작 영상과 밀도 높은 일치를 보이는 동작 패턴을 생성한다.
  • 제거 실험 결과, 정체성 어댑터와 동작 어댑터 모두 필수적이며, 둘 중 하나를 제거하면 성능이 크게 떨어진다.
  • 어댑터 기반 접근 방식은 비디오 맞춤 설정에서 LoRA를 능가하며, 특히 파라미터 융합 갈등을 방지하고 공간적·시간적 제어의 조화로운 조합을 가능하게 한다.
  • 복잡하거나 드문 조합을 포함한 임의의 주체-동작 조합에 대해 비디오 생성에서 뛰어난 강건성을 보이며, 일부 고도로 비정상적이거나 다중 객체 조합에 대해서는 실패 사례가 존재한다.
  • 실패 사례는 기본 모델의 능력에 기인한 한계를 드러내며, 예를 들어 '늑대가 자전거를 타는' 것처럼 의미적으로 드문 조합의 경우 비디오 생성이 불가능하거나, 세밀한 동작 영상에서 정확한 프레임 수준의 동작 전달이 어려운 경우가 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.