Skip to main content
QUICK REVIEW

[논문 리뷰] MotionDirector: Motion Customization of Text-to-Video Diffusion Models

Rui Zhao, Yuchao Gu|arXiv (Cornell University)|2023. 10. 12.
Generative Adversarial Networks and Image Synthesis인용 수 7
한 줄 요약

MotionDirector는 텍스트-비디오 확산 모델에서 외형과 동작 학습을 분리하기 위해 이중 경로 LoRA 아키텍처를 제안한다. 이로 인해 외형 다양성을 유지하면서도 동작 커스터마이제이션을 가능하게 한다. 외형에 편향되지 않은 시간적 손실을 도입함으로써, 새로운 외형에 대해 커스터마이즈된 동작을 일반화하는 데 있어 최신 기술을 초월하는 성능을 달성했으며, 정성적 및 정량적 평가에서 모두 뛰어난 성능을 보였다.

ABSTRACT

Large-scale pre-trained diffusion models have exhibited remarkable capabilities in diverse video generations. Given a set of video clips of the same motion concept, the task of Motion Customization is to adapt existing text-to-video diffusion models to generate videos with this motion. For example, generating a video with a car moving in a prescribed manner under specific camera movements to make a movie, or a video illustrating how a bear would lift weights to inspire creators. Adaptation methods have been developed for customizing appearance like subject or style, yet unexplored for motion. It is straightforward to extend mainstream adaption methods for motion customization, including full model tuning, parameter-efficient tuning of additional layers, and Low-Rank Adaptions (LoRAs). However, the motion concept learned by these methods is often coupled with the limited appearances in the training videos, making it difficult to generalize the customized motion to other appearances. To overcome this challenge, we propose MotionDirector, with a dual-path LoRAs architecture to decouple the learning of appearance and motion. Further, we design a novel appearance-debiased temporal loss to mitigate the influence of appearance on the temporal training objective. Experimental results show the proposed method can generate videos of diverse appearances for the customized motions. Our method also supports various downstream applications, such as the mixing of different videos with their appearance and motion respectively, and animating a single image with customized motions. Our code and model weights will be released.

연구 동기 및 목표

  • 텍스트-비디오 확산 모델에서 동작을 커스터마이즈하면서도 외형 다양성을 유지하는 데 도전 과제를 해결하기 위해.
  • 기존의 외형 기반 커스터마이제이션과는 다름없이 동작 커스터마이제이션의 작업을 정의하고 설정하기 위해.
  • 기본 미세조정 및 LoRA 방법에서 외형과 동작이 결합되어 새로운 외형으로의 일반화를 제한하는 문제를 해결하기 위해.
  • 예를 들어 한 비디오의 외형과 다른 비디오의 동작을 혼합하거나, 단일 이미지를 커스터마이즈된 동작으로 애니메이션하는 등의 응용을 가능하게 하기 위해.

제안 방법

  • MotionDirector는 이중 경로 LoRA 아키텍처를 활용한다: 외형 학습을 위한 공간 경로와 동작 학습을 위한 시간 경로이다.
  • 공간 LoRA는 단일 프레임에서 훈련되어 외형 특성을 캡처하고, 시간 LoRA는 다수의 프레임에서 훈련되어 동작 패턴을 모델링한다.
  • 두 경로는 공간 LoRA를 공유함으로써 동작 학습이 정확한 외형에 기반을 두도록 하면서도, 별도의 최적화를 가능하게 한다.
  • 외형에 편향되지 않은 시간적 손실을 신규로 도입하여, 동작 학습에서 외형의 영향을 최소화하고 동작 일반화를 향상시킨다.
  • 추론 시에는 오직 훈련된 시간 LoRA만 사용되며, 이로 인해 동일한 커스터마이즈된 동작으로 다양한 외형을 가진 비디오를 생성할 수 있다.
  • 최소한의 파rameter 추가로 효율적인 미세조정을 지원한다—공간 LoRA와 시간 LoRA에 각각 9M 및 12M 파라미터를 사용한다.

실험 결과

연구 질문

  • RQ1텍스트-비디오 확산 모델에서 외형 다양성을 훼손하지 않고도 동작 커스터마이제이션을 달성할 수 있는가?
  • RQ2미세조정 과정에서 외형과 동작를 효과적으로 분리하여 새로운 외형으로의 일반화를 가능하게 할 수 있는가?
  • RQ3시간적 동작 학습에서 외형의 편향을 줄이기 위한 훈련 목표를 설계할 수 있는가?
  • RQ4혼합된 동작과 외형을 서로 다른 비디오에서 가져오는 복잡한 작업에 대해 동작 커스터마이제이션을 어느 정도 적용할 수 있는가?
  • RQ5기존의 튜닝 및 제어 기반 방법과 비교했을 때, 제안된 방법은 성능과 효율성 면에서 어느 정도 우수한가?

주요 결과

  • MotionDirector는 외형 다양성 면에서 SOTA 기법을 초월하여, 인간 평가에서 외형 다양성 점수 72.83%를 기록했으며, VideoComposer 대비 27.17%에 그친다.
  • 동작 충실도 측면에서 MotionDirector는 시간 일관성에 대해 인간 평가 점수 61.24%를 기록했으며, VideoComposer의 38.76%에 비해 뚜렷이 높다.
  • qualitative 결과를 통해, 다른 귀 모양을 가진 곰과 아르크 드 트리omphe 등 다양한 외형에 동일한 동작을 적용함으로써 커스터마이즈된 동작이 효과적으로 일반화됨을 보였다.
  • MotionDirector는 경쟁적인 수렴 시간을 확보했다—단일 비디오에 대해 8분, 다중 비디오에 대해 20분이며, 14GB VRAM 환경에서 Tune-A-Video와 유사한 성능을 보였다.
  • 외형에 편향되지 않은 시간적 손실은 동작 학습에서 외형 편향을 효과적으로 감소시켜, 표준 LoRA 미세조정보다 더 나은 일반화 성능을 달성했다.
  • 이로 인해 외형과 동작을 서로 다른 비디오에서 혼합하거나, 분리된 비디오 생성의 가능성을 입증하는 새로운 응용이 가능해졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.