Skip to main content
QUICK REVIEW

[논문 리뷰] Music2Dance: DanceNet for Music-driven Dance Generation

Wenlin Zhuang, Cong‐Yi Wang|arXiv (Cornell University)|2020. 02. 02.
Human Motion and Animation인용 수 8
한 줄 요약

이 논문은 음악 스타일, 리듬, 멜로디를 제어 신호로 사용하여 현실적이고 다양한 음악 일관성 있는 3D 춤 동작을 합성하는 새로운 자동회귀 생성 모델인 DanceNet을 제안한다. 이 방법은 확장된 컨volution, 게이트드 활성화, 음악적 맥락 인식 인코더, 그리고 GMM 손실 함수를 활용하여 동작 품질과 다양성을 향상시키며, 새로 수집한 고성능 음악-춤 쌍 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Synthesize human motions from music, i.e., music to dance, is appealing and attracts lots of research interests in recent years. It is challenging due to not only the requirement of realistic and complex human motions for dance, but more importantly, the synthesized motions should be consistent with the style, rhythm and melody of the music. In this paper, we propose a novel autoregressive generative model, DanceNet, to take the style, rhythm and melody of music as the control signals to generate 3D dance motions with high realism and diversity. To boost the performance of our proposed model, we capture several synchronized music-dance pairs by professional dancers, and build a high-quality music-dance pair dataset. Experiments have demonstrated that the proposed method can achieve the state-of-the-art results.

연구 동기 및 목표

  • 음악으로부터 현실적이고 다양한 음악 일관성 있는 3D 춤 동작을 생성하는 문제를 해결하기 위해.
  • 기존의 RNN 및 컨volution 모델이 복잡하고 비정규적인 춤 시퀀스를 다루는 데에 한계를 가진다는 점을 극복하기 위해.
  • 새로운 손실 함수와 동작 표현 방식을 도입하여 모델의 강건성과 다양성을 향상시키기 위해.
  • 학습 및 평가를 지원하기 위해 고성능의 동기화된 음악-춤 쌍 데이터셋을 구축하기 위해.
  • 단일 통합 모델을 통해 다양한 춤 유형을 엔드 투 엔드로 생성할 수 있도록 하기 위해.

제안 방법

  • DanceNet은 네트워크 깊이를 늘리지 않고도 수신장역을 확장할 수 있도록 확장된 컨벌루션을 사용하는 자동회귀 아키텍처를 채택한다.
  • 복잡하고 비정규적인 춤 동작을 모델링하기 위해 게이트드 활성화 유닛을 통합한다.
  • 원시 음악 특징(발진, 비트, 크로마)을 처리하여 매끄럽고 맥락 인식이 가능한 제어 신호를 생성하기 위해 음악적 맥락 인식 인코더를 사용한다.
  • 끝단자 위치와 발바닥 접촉 상태를 동작 표현에 명시적으로 포함시켜 오차 누적을 줄이고 현실감을 향상시킨다.
  • 예측된 평균 주변의 분포에서 샘플링이 가능하게 하기 위해 MSE 손실 대신 가우시안 믹스 모델(GMM) 손실을 사용한다.
  • 학습 중에 진짜 동작에 가우시안 노이즈를 추가하여 모델의 강건성과 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1심층 생성 모델은 음악과 동기화된 현실적이고 다양한 3D 춤 동작을 생성할 수 있는가?
  • RQ2음악 특징(onset, beat, chroma)을 사용하는 것과 원시 멜-스펙트로그램을 사용하는 것 간에 춤 생성 제어 성능는 어떻게 비교되는가?
  • RQ3음악적 맥락 인식 인코더는 동작의 현실감과 다양성에 어떤 영향을 미치는가?
  • RQ4끝단자 위치를 포함시키는 것이 동작 품질과 안정성에 어떤 영향을 미치는가?
  • RQ5GMM 손실이 MSE 손실보다 다양한 현실적인 춤 시퀀스 생성에 더 우수한가?

주요 결과

  • 음악 특징(onset, beat, chroma)을 사용할 경우 멜-스펙트로그램을 사용하는 것보다 훨씬 더 다양하고 음악 일관성 있는 3D 춤 동작을 생성하지만, 멜-스펙트로그램을 사용할 경우 뻣뻣하고 진동하는 출력이 발생한다.
  • 음악적 맥락 인식 인코더는 노이즈가 많은 원시 음악 특징의 악영향을 줄이고 매끄럽고 맥락 인식이 가능한 제어 신호를 생성함으로써 동작의 현실감과 다양성을 향상시킨다.
  • 끝단자 위치를 동작 표현에 포함시킴으로써 동작의 다양성이 증가하고 오차 누적이 줄어들며, 특히 사지 궤적에서 두드러진다.
  • GMM 손실은 예측 평균 주변의 분포에서 샘플링을 가능하게 하여 MSE 손실에 비해 다양성이 크게 향상된다. MSE 손실은 일반적으로 과도하게 매끄럽고 다양성이 떨어지는 출력을 생성한다.
  • 새로 수집한 고성능 음악-춤 쌍 데이터셋에서 최신 기술 수준의 성능을 달성하여, 현실적이고 스타일 일관성 있는 3D 춤 시퀀스 생성의 효과성을 입증한다.
  • 정성적 결과에서는 동일한 모델이 현대무용과 쿠르티라지 댄스와 같은 서로 다른 춤 유형을 생성할 수 있음을 보여주며, 강력한 일반화 능력과 제어 가능성의 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.