Skip to main content
QUICK REVIEW

[논문 리뷰] DisCo: Disentangled Control for Realistic Human Dance Generation

Tan Wang, Linjie Li|arXiv (Cornell University)|2023. 06. 30.
Human Pose and Action RecognitionComputer Science인용 수 3
한 줄 요약

DisCo는 소셜 미디어 스타일의 춤 영상에서 일반화 능력과 조합 가능성(Compositionality)을 향상시키기 위해 실감나는 인간 춤 생성을 위한 분리된 제어 프레임워크를 제안한다. VAE-에인코더와 크로스 어텐션 메커니즘을 통해 전경(주체), 배경, 자세의 제어 신호를 분리함으로써, 인간 속성에 대한 프록시 재구성 작업을 통해 사전 훈련을 수행함으로써, TikTok 춤 데이터셋에서 FID 50.68과 FVD 353.35의 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Generative AI has made significant strides in computer vision, particularly in text-driven image/video synthesis (T2I/T2V). Despite the notable advancements, it remains challenging in human-centric content synthesis such as realistic dance generation. Current methodologies, primarily tailored for human motion transfer, encounter difficulties when confronted with real-world dance scenarios (e.g., social media dance), which require to generalize across a wide spectrum of poses and intricate human details. In this paper, we depart from the traditional paradigm of human motion transfer and emphasize two additional critical attributes for the synthesis of human dance content in social media contexts: (i) Generalizability: the model should be able to generalize beyond generic human viewpoints as well as unseen human subjects, backgrounds, and poses; (ii) Compositionality: it should allow for the seamless composition of seen/unseen subjects, backgrounds, and poses from different sources. To address these challenges, we introduce DISCO, which includes a novel model architecture with disentangled control to improve the compositionality of dance synthesis, and an effective human attribute pre-training for better generalizability to unseen humans. Extensive qualitative and quantitative results demonstrate that DisCc can generate high-quality human dance images and videos with diverse appearances and flexible motions. Code is available at https://disco-dance.github.io/.

연구 동기 및 목표

  • 기존의 인간 운동 이행 방법이 복잡한 자세, 새로운 주체, 또는 새로운 조합에서 실패하는 경향이 있는 소셜 미디어 스타일의 춤 영상 생성의 한계를 해결한다.
  • 표준 훈련 데이터를 초월해 새로운 인간 주체, 배경, 자세에 대한 일반화 능력을 향상시킨다.
  • 다른 소스에서 온 전경, 배경, 자세를 임의로 조합할 수 있도록 가능하게 하여 조합 가능성을 제공한다.
  • 고품질 춤 영상 데이터셋의 데이터 부족 문제를 해결하기 위해 새로운 인간 속성 사전 훈련 전략을 도입한다.

제안 방법

  • 각각 배경에 대한 VAE, 자세에 대한 경량 CNN, 인간 주체에 대한 CLIP 이미지 임베딩을 사용하는 별도의 에인코더를 갖춘 분리된 제어 아키텍처를 도입하며, 이는 노이즈 제거 U-Net 내에서 크로스 어텐션을 통해 통합된다.
  • 모델이 분리된 전경 및 배경 특징에서 완전한 이미지를 재구성하는 새로운 인간 속성 사전 훈련(HAP) 작업을 적용함으로써, 새로운 인간 속성에 대한 강건성을 향상시킨다.
  • Stable Diffusion에서 사전 훈련된 VQ-VAE를 배경 참조 이미지를 인코딩하는 데 사용하여, 무작위 컨볼루션 레이어보다 더 풍부하고 기술적인 표현을 가능하게 한다.
  • 텍스트 조건부 훈련에 의존도를 줄이기 위해 자세 애너테이션을 HAP 사전 훈련에 통합함으로써 자세 제어를 텍스트 조건부 훈련에서 분리한다.
  • 전경과 배경이 모두 포함된 참조 이미지를 사용하여 모델을 피니테인하고, 생성 품질 향상을 위해 분류기 자유 가이던스를 적용한다.
  • 새로운 개인에 대한 제로샷 일반화 능력을 향상시키기 위해 대규모 비페어링 인간 이미지 컬렉션을 활용하여 HAP 사전 훈련을 수행한다.

실험 결과

연구 질문

  • RQ1확산 기반 모델이 새로운 인간 주체, 배경, 자세에 일반화되는 고해상도 제어 가능한 춤 생성을 달성할 수 있는가?
  • RQ2주체, 배경, 자세에 대한 제어 신호를 분리함으로써 영상 생성의 조합 가능성은 향상되는가?
  • RQ3분리된 전경 및 배경 특징에서 이미지를 재구성하는 프록시 사전 훈련 작업은 쌍화된 춤 영상 데이터가 없어도 일반화 능력을 향상시킬 수 있는가?
  • RQ4배경 에인코더 선택(예: VQ-VAE 대비 무작위 컨볼루션 레이어)이 합성 품질과 일관성에 어떤 영향을 미치는가?
  • RQ5텍스트-이미지 생성에서 사전 훈련된 체크포인트를 사용해 자세 ControlNet을 초기화하면 이미지 기반 춤 생성 성능이 떨어지는가?

주요 결과

  • DisCo는 TikTok 춤 데이터셋에서 Fréchet Inception Distance(FID) 50.68을 달성하여 기본 DisCo(61.06) 및 아블레이션 모델을 크게 앞서간다.
  • 인간 속성 사전 훈련(HAP)을 적용한 DisCo는 FVD를 353.35로 낮춰 영상 수준의 정밀도와 시간적 일관성 향상을 입증한다.
  • 사전 훈련된 VQ-VAE를 배경 인코딩에 사용함으로써 FID는 83.53(무작위 컨볼루션 레이어)에서 65.14로 감소하여 의미론적으로 풍부한 표현의 이점이 있음을 입증한다.
  • HAP와 결합했을 때, 텍스트-이미지 생성에서 사전 훈련된 ControlNet-Pose 체크포인트로 자세 ControlNet을 초기화하면 무작위 U-Net 가중치보다 성능이 열 劣하므로 도메인 불일치가 발생함을 시사한다.
  • 아블레이션 결과에 따르면 HAP에 자세를 통합해도 HAP에 자세 없이 사용한 것과 유사한 성능를 기록하지만, 추가 애너테이션 작업 비용이 발생하므로 자세는 HAP의 이점에 필수적이지 않다는 것을 시사한다.
  • 스케일 1.5의 분류기 자유 가이던스가 이미지 및 영상 메트릭 모두에서 최적의 수치 성능을 달성하여 다양성과 정밀도 사이의 최적 균형을 확보함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.