Skip to main content
QUICK REVIEW

[논문 리뷰] MagicAvatar: Multimodal Avatar Generation and Animation

Jianfeng Zhang, Hanshu Yan|arXiv (Cornell University)|2023. 08. 28.
Human Motion and Animation인용 수 5
한 줄 요약

MagicAvatar는 다중모달 아바타 생성 및 애니메이션을 위한 이단계 프레임워크를 제안하며, 다중모달 입력(텍스트, 영상, 오디오)을 운동 신호로 분리하여 고해상도이자 시간적으로 일관된 아바타 영상 생성을 가능하게 한다. 이는 텍스트 및 영상 가이드 아바타 생성을 가능하게 하며, DreamBooth 미세조정을 통해 소수의 이미지로 개인화된 아바타를 생성하여 정체성 일관성 있는 애니메이션과 뛰어난 시각적 정확도를 달성한다.

ABSTRACT

This report presents MagicAvatar, a framework for multimodal video generation and animation of human avatars. Unlike most existing methods that generate avatar-centric videos directly from multimodal inputs (e.g., text prompts), MagicAvatar explicitly disentangles avatar video generation into two stages: (1) multimodal-to-motion and (2) motion-to-video generation. The first stage translates the multimodal inputs into motion/ control signals (e.g., human pose, depth, DensePose); while the second stage generates avatar-centric video guided by these motion signals. Additionally, MagicAvatar supports avatar animation by simply providing a few images of the target person. This capability enables the animation of the provided human identity according to the specific motion derived from the first stage. We demonstrate the flexibility of MagicAvatar through various applications, including text-guided and video-guided avatar generation, as well as multimodal avatar animation.

연구 동기 및 목표

  • 가상현실, 게임, 소셜미디어 분야에서 초보자 사용자가 어려움을 겪는 복잡하고 시간이 오래 소요되는 아바타 생성 파이프라인 문제를 해결한다.
  • 동시 발생하는 다중모달 입력(예: 텍스트, 영상, 오디오)과 운동, 외형 정보가 결합된 데이터셋을 수집하는 데 어려움을 극복한다.
  • 다중모달 입력 번역과 영상 생성을 분리함으로써 아바타 생성의灵活性를 높이고, 훈련 효율성과 모델 일반화 능력을 향상시킨다.
  • 소수의 이미지만으로 특정 인간의 정체성을 주입하여 개인화된 아바타 애니메이션을 가능하게 하며, 생성된 영상 전반에 걸쳐 정체성 일관성을 유지한다.
  • 고해상도 시각적 현실감과 시간적 일관성을 확보하면서도 텍스트 가이드, 영상 가이드, 다중모달 아바타 애니메이션 응용 분야에서의 유연성을 입증한다.

제안 방법

  • 아바타 생성을 두 단계로 분해한다: (1) 다중모달에서 운동 신호로의 변환, 즉 텍스트, 영상 또는 오디오 입력이 포즈, 깊이, DensePose 등의 운동 신호로 변환되고, (2) 운동 신호에서 영상 생성으로의 전환.
  • MDM과 같은 사전 훈련된 모델을 텍스트에서 운동 신호로의 변환에, MiDaS/OpenPose를 영상에서 운동 신호로 추출하는 데 사용하여 모듈러하고 확장 가능한 입력 처리를 가능하게 한다.
  • MagicEdit를 핵심 운동에서 영상 생성기로 활용하며, 훈련 중에 콘텐츠, 구조, 운동을 분리함으로써 고해상도이자 시간적으로 일관된 영상 합성 보장을 한다.
  • 목표 인물의 5장의 이미지를 사용해 500스텝 동안 DreamBooth 모델을 미세조정함으로써 주입된 정체성을 생성된 프레임 전반에 걸쳐 유지한다.
  • 운동 신호와 외형 및 배경을 묘사하는 텍스트 프롬프트를 동시에 조건으로 삼아 운동에서 영상 생성을 조절함으로써 제어 가능하고 다양한 아바타 영상 출력을 가능하게 한다.
  • 첫 번째 단계에서 다양한 입력 모odal을 별도로 처리함으로써 공동 다중모달 데이터셋이 필요 없게 하여 데이터 수집 및 모델 훈련을 단순화한다.

실험 결과

연구 질문

  • RQ1이단계 프레임워크는 다중모달 입력 번역과 아바타 영상 생성을 효과적으로 분리하여 훈련 효율성과 모델 일반화 능력을 향상시키는가?
  • RQ2다양한 입력(텍스트, 영상, 오디오)에서 유도된 운동 신호가 고해상도이자 시간적으로 일관된 아바타 영상 생성에 얼마나 잘 활용되는가?
  • RQ3소수의 주체 이미지로 얼마나 잘 개인화되고 정체성 일관성이 유지되는가?
  • RQ4일관된 시각적 품질을 확보하면서도 텍스트 가이드, 영상 가이드, 다중모달 아바타 애니메이션 응용 분야에서의 다양한 응용을 지원할 수 있는가?
  • RQ5운동 생성과 영상 생성을 분리함으로써 희소하거나 다양한 입력 모달에서의 학습 복잡도를 감소시키는가?

주요 결과

  • 이단계 설계는 다중모달 입력 처리와 영상 생성을 성공적으로 분리하여, 동시에 발생하는 다중모달 데이터셋이 필요 없이 각 모odal에 맞는 별도의 사전 훈련된 모델을 사용할 수 있도록 한다.
  • MDM를 사용한 텍스트에서 운동 신호로의 변환은 실제적인 아바타 애니메이션을 가능하게 하며, '사람이 손으로 기립자세를 하고 있다'와 같은 프롬프트로 텍스트 가이드 생성에서 입증되었다.
  • 영상 가이드 아바타 생성은 원본 영상의 복잡한 운동을 새로운 아바타로 효과적으로 전이하며, 운동 정확도를 유지하면서도 배경과 외형을 사용자 정의할 수 있다.
  • 오직 5장의 이미지로만 DreamBooth 미세조정을 통해 주입된 정체성이 생성된 영상 프레임 전반에 걸쳐 일관되게 유지되며, 특정 개인의 정확한 애니메이션을 가능하게 한다.
  • 이 프레임워크는 텍스트 가이드 아바타 생성, 영상 기반 아바타 생성, 다중모달 애니메이션 등 다양한 응용을 지원하며, 강력한 시각적 현실감과 시간적 일관성을 입증한다.
  • MagicEdit를 운동에서 영상 생성의 핵심으로 사용함으로써 추상적이거나 희소한 입력에서도 고해상도 출력을 유지하며 일관된 구조와 운동을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.