Skip to main content
QUICK REVIEW

[논문 리뷰] DanceFormer: Music Conditioned 3D Dance Generation with Parametric Motion Transformer

Buyu Li, Yongchi Zhao|arXiv (Cornell University)|2021. 03. 18.
Human Motion and Animation인용 수 7
한 줄 요약

DanceFormer는 음악에 동기화된 关절 운동을 생성하는 데 중점을 두고, 먼저 운동학적 특징을 강화한 트랜스포머(DanTrans)를 사용해 키 포즈를 생성하고, 이를 바탕으로 매개변수화된 운동 곡선을 회귀시켜 유연하고 리듬에 맞는 동작을 생성하는 이단계적 3D 댄스 생성 프레임워크를 제안한다. 이 방법은 새로운 PhantomDance 데이터셋을 기반으로 한 검증을 통해 댄스 품질, 박자 일致성, 다양성에서 최신 기술 수준을 초월하는 성능을 달성한다. 데이터셋은 전문 애니메이션과 곡선 기반 운동 표현 방식을 포함한다.

ABSTRACT

Generating 3D dances from music is an emerged research task that benefits a lot of applications in vision and graphics. Previous works treat this task as sequence generation, however, it is challenging to render a music-aligned long-term sequence with high kinematic complexity and coherent movements. In this paper, we reformulate it by a two-stage process, ie, a key pose generation and then an in-between parametric motion curve prediction, where the key poses are easier to be synchronized with the music beats and the parametric curves can be efficiently regressed to render fluent rhythm-aligned movements. We named the proposed method as DanceFormer, which includes two cascading kinematics-enhanced transformer-guided networks (called DanTrans) that tackle each stage, respectively. Furthermore, we propose a large-scale music conditioned 3D dance dataset, called PhantomDance, that is accurately labeled by experienced animators rather than reconstruction or motion capture. This dataset also encodes dances as key poses and parametric motion curves apart from pose sequences, thus benefiting the training of our DanceFormer. Extensive experiments demonstrate that the proposed method, even trained by existing datasets, can generate fluent, performative, and music-matched 3D dances that surpass previous works quantitatively and qualitatively. Moreover, the proposed DanceFormer, together with the PhantomDance dataset (https://github.com/libuyu/PhantomDanceDataset), are seamlessly compatible with industrial animation software, thus facilitating the adaptation for various downstream applications.

연구 동기 및 목표

  • 음악으로부터 장기적이고 운동학적으로 복잡하며 리듬에 맞는 3D 댄스를 생성하는 과제를 해결한다.
  • 일관성과 시간적 번짐 문제를 겪는 기존 순차 기반 생성 방법의 한계를 극복한다.
  • 더 나은 제어성과 유연성을 확보하기 위해 키 포즈 생성과 운동 곡선 회귀를 분리한 이단계 프레임워크를 도입한다.
  • 키프레임과 곡선 기반 운동 인코딩을 갖춘 고품질의 전문 애니메이션 3D 댄스 데이터셋(PhantomDance)을 개발한다.
  • 곡선 기반 표현 방식과 엔드 투 엔드 훈련을 통해 산업 애니메이션 파이프라인에 원활하게 통합할 수 있도록 한다.

제안 방법

  • 음악 조건부 3D 댄스 생성을 이단계 과정으로 재정의한다: 키 포즈 생성 → 매개변수 곡선 회귀.
  • 박자 검출 알고리즘을 활용해 음악의 박자 위치를 식별하고, 키 포즈를 이 시간 마커에 정렬한다.
  • 두 개의 연결된 DanTrans 네트워크를 구현한다: 첫 번째는 박자 중심의 음악 스펙트럼 특징을 사용해 키 포즈를 생성하고, 두 번째는 박자 간 특징을 활용해 운동 곡선의 매개변수를 회귀한다.
  • Kochanek-Bartels 스퍼링을 사용해 소수의 제어 매개변수로도 부드럽고 다양한 운동 패턴을 모델링한다.
  • 운동 디코더에 운동학적 전파 모듈(KPM)과 구조적 멀티헤드 어텐션 모듈(SMAM)을 통합해 공간적 운동학적 상관관계와 물리적 타당성을 향상시킨다.
  • 두 네트워크를 ℓ₂ 복원 손실과 함께 적대적 훈련하여 현실감과 다양성을 향상시킨다.

실험 결과

연구 질문

  • RQ1직접적인 순차 모델링 대비 키 포즈와 운동 곡선을 분리한 이단계 접근 방식이 음악 조건부 3D 댄스 생성의 유연성과 일관성 향상에 기여하는가?
  • RQ2KPM 모듈을 통한 운동학적 구조 통합이 생성된 댄스의 물리적 타당성과 품질에 어떤 영향을 미치는가?
  • RQ3제안된 곡선 기반 운동 표현 방식이 시간적 번짐을 얼마나 줄이고 리듬 일치도를 향상시키는가?
  • RQ4곡선 기반 인코딩을 갖춘 대규모 전문 애니메이션 3D 댄스 데이터셋이 복원 또는 동작 캡처 기반 데이터셋보다 훈련 품질에서 뛰어나게 성능을 내는가?
  • RQ5제안된 방법이 최신 기술 수준의 기준 대비 박자 일치도, 다양성, 시각적 품질 측면에서 뛰어난 성능을 내는가?

주요 결과

  • DanceFormer는 이전 최신 기술인 AI Choreographer 대비 NPSS(댄스 품질)에서 30% 향상, PFD에서 28% 향상, VFD에서 27% 향상하여 성능을 확보했다.
  • 46% 향상된 PVar(다양성)는 적대적 훈련을 통한 생성 다양성 향상을 입증한다.
  • BC(박자 일치도)에서 93% 향상되어 이중 단계 키 포즈 정렬 덕분에 음악 박자와 거의 완벽하게 일치함을 시사한다.
  • 100명의 참가자 대상 사용자 연구 결과, DanceFormer가 생성한 댄스는 베이스라인 대비 성능 품질과 음악 매칭도에서 유의미하게 높은 평가를 받았다.
  • 전문 애니메이터가 제작한 PhantomDance 데이터셋은 복원 또는 캡처 기반 대안보다 더 높은 시각적 품질과 정확한 운동 표현을 제공한다.
  • 삼각형 모양의 마스크를 갖는 학습 가능한 국소 어텐션을 사용함으로써 어텐션 효율성과 성능이 향상되었으며, 고정 또는 가우시안 마스크보다 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.