Skip to main content
QUICK REVIEW

[논문 리뷰] DanceNet3D: Music Based Dance Generation with Parametric Motion Transformer.

Buyu Li, Yongchi Zhao|arXiv (Cornell University)|2021. 03. 18.
Human Motion and Animation참고 문헌 21인용 수 12
한 줄 요약

DanceNet3D는 음악의 박자에 동기화된 关건 포즈 사이의 보간 운동 곡선을 예측하는 방식으로 3D 댄스 생성 프레임워크를 제안한다. MoTrans 기반의 Transformer에 운동학적 제약 조건과 국소 시간 주의 메커니즘을 통합하여 유연하고 박자에 정확히 동기화되며 연기적인 3D 댄스를 생성한다. 새로운 PhantomDance 데이터셋에서 기존 방법들에 비해 정량적·정성적 측면에서 모두 뛰어난 성능을 달성한다.

ABSTRACT

In this work, we propose a novel deep learning framework that can generate a vivid dance from a whole piece of music. In contrast to previous works that define the problem as generation of frames of motion state parameters, we formulate the task as a prediction of motion curves between key poses, which is inspired by the animation industry practice. The proposed framework, named DanceNet3D, first generates key poses on beats of the given music and then predicts the in-between motion curves. DanceNet3D adopts the encoder-decoder architecture and the adversarial schemes for training. The decoders in DanceNet3D are constructed on MoTrans, a transformer tailored for motion generation. In MoTrans we introduce the kinematic correlation by the Kinematic Chain Networks, and we also propose the Learned Local Attention module to take the temporal local correlation of human motion into consideration. Furthermore, we propose PhantomDance, the first large-scale dance dataset produced by professional animatiors, with accurate synchronization with music. Extensive experiments demonstrate that the proposed approach can generate fluent, elegant, performative and beat-synchronized 3D dances, which significantly surpasses previous works quantitatively and qualitatively.

연구 동기 및 목표

  • 기존 방법들이 운동을 이산적인 운동 프레임으로 생성하는 데서 비롯되는 한계를 해결하기 위해, 관건 포즈 사이의 연속적인 운동 곡선으로 운동을 모델링한다.
  • 운동 전용 주의 메커니즘을 도입하여 3D 댄스 생성의 시간적 일관성과 운동학적 타당성을 향상시킨다.
  • 음악과 정확히 동기화된 대규모 전문가가 애니메이션한 3D 댄스 데이터셋을 구축하여 학습 및 평가를 지원한다.
  • 더 유연하고 우아하며 연기적인 3D 댄스 애니메이션을 구현하여 음악의 박자에 정확히 동기화된 결과를 달성한다.

제안 방법

  • DanceNet3D는 음악에서 3D 댄스 시퀀스를 생성하기 위해 적대적 훈련을 통한 인코더-디코더 아키텍처를 사용한다.
  • 운동 인식 인코더를 통해 먼저 음악의 박자에 맞는 관건 포즈를 예측한다.
  • 디코더는 관절 간 의존성을 모델링하기 위해 운동학적 체인 네트워크를 통합한 운동 전용 Transformer인 MoTrans를 활용한다.
  • 학습된 국소 주의 모듈은 인간 운동 시퀀스의 단기 시간적 상관관계를 포착한다.
  • 다양체적 보간 기법을 사용해 관건 포즈 사이의 운동 곡선을 연속적인 3D 궤적으로 예측한다.
  • 프레임워크는 전문 애니메이터들이 정밀한 음악 동기화를 고려해 제작한 신규 도입된 PhantomDance 데이터셋에서 훈련된다.

실험 결과

연구 질문

  • RQ1관건 포즈 사이의 연속적인 곡선으로 운동을 모델링할 경우, 이산적 프레임 기반 생성 방식에 비해 3D 댄스 생성의 유연성과 자연스러움이 향상되는가?
  • RQ2운동학적 체인 제약 조건과 국소 시간 주의의 통합이 운동 타당성과 시간적 일관성 향상에 얼마나 효과적인가?
  • RQ3음악 동기화가 이루어진 대규모 전문가가 애니메이션한 3D 댄스 데이터셋이 생성 품질 향상에 어느 정도 기여하는가?
  • RQ4제안된 MoTrans 아키텍처가 복잡하고 연기적인 댄스 운동 생성에서 표준 Transformer를 능가하는가?

주요 결과

  • 정량적 평가와 정성적 분석을 통해 DanceNet3D는 이전 방법들에 비해 훨씬 더 부드럽고 시간적으로 일관성 있는 3D 댄스를 생성함을 입증했다.
  • 모델은 박자 동기화 성능에서 뛰어난 성과를 보이며, 운동이 정확히 음악의 강박에 맞춰 정렬됨을 확인했다.
  • 운동학적 체인 네트워크와 학습된 국소 주의 모듈의 도입으로 운동 타당성이 향상되고 비자연스러운 관절 운동이 감소했다.
  • PhantomDance 데이터셋은 더 현실적이고 다양한 댄스 생성을 가능하게 하였으며, 전문가 수준의 운동 품질과 정확한 음악 정렬을 구현했다.
  • 정량적 평가 결과, FID 및 운동 부드러움 등의 지표에서 최신 기준 모델들에 비해 일관되게 향상된 성능을 보였다.
  • 정성적 결과는 생성된 댄스가 우아하고 연기적이며 예술적·오락적 응용에 적합하다는 것을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.