Skip to main content
QUICK REVIEW

[논문 리뷰] Dance Generation with Style Embedding: Learning and Transferring Latent Representations of Dance Styles

Xinjian Zhang, Yi Xu|arXiv (Cornell University)|2021. 04. 30.
Music and Audio Processing참고 문헌 21인용 수 4
한 줄 요약

이 논문은 참조 무용 클립에서 잠재 스타일 표현을 학습하고 이를 통해 다양한 스타일 일관성이 유지되는 무용을 생성할 수 있도록 제어 가능한 스타일 임베딩을 갖춘 프레임 단위 음악-무용 생성 프레임워크를 제안한다. 트랜스포머 기반 음악 인코더와 스타일 인식 무용 생성기를 사용함으로써, 기준 모델 대비 뛰어난 비트 일치, 감정 일치, 스타일 일관성 및 다양성을 달성한다. 이는 애니메이션, 퍼포밍, 락킹 스타일을 포함하는 새로운 대규모 음악-무용 데이터셋을 통해 검증되었다.

ABSTRACT

Choreography refers to creation of dance steps and motions for dances according to the latent knowledge in human mind, where the created dance motions are in general style-specific and consistent. So far, such latent style-specific knowledge about dance styles cannot be represented explicitly in human language and has not yet been learned in previous works on music-to-dance generation tasks. In this paper, we propose a novel music-to-dance synthesis framework with controllable style embeddings. These embeddings are learned representations of style-consistent kinematic abstraction of reference dance clips, which act as controllable factors to impose style constraints on dance generation in a latent manner. Thus, the dance styles can be transferred to dance motions by merely modifying the style embeddings. To support this study, we build a large music-to-dance dataset. The qualitative and quantitative evaluations demonstrate the advantage of our proposed framework, as well as the ability of synthesizing diverse styles of dances from identical music via style embeddings.

연구 동기 및 목표

  • 음악-무용 생성에서 스타일 특화 지식의 명시적 모델링 부족으로 인해 다양성과 현실성이 제한되는 문제를 해결하기 위해.
  • 참조 무용 클립에서 잠재 스타일 표현을 학습하여 무용 생성에서 제어 가능한 스타일 전이를 가능하게 하기 위해.
  • 동일한 음악에서 스타일 임베딩만 수정함으로써 다양한 스타일 일관성이 유지되는 무용을 생성할 수 있는 프레임워크를 개발하기 위해.
  • 스タイル 인식 생성 모델의 훈련 및 평가를 위한 대규모 스타일 레이블이 부여된 음악-무용 데이터셋을 구축하기 위해.
  • 무용과 음악의 단계별 일치와 함께 스타일 임베딩을 사용할 경우 스타일 충실도와 운동 다양성이 향상됨을 입증하기 위해.

제안 방법

  • 스타일 임베딩 생성기는 공유 잠재 공간 내에서 프로토타입 기반 방법을 사용하여 參조 무용 클립에서 잠재 스타일 표현을 학습한다.
  • 음악-무용 생성기는 트랜스포머 인코더를 사용하여 음악 입력의 시간적 및 의미적 특징을 추출한다.
  • 무용 생성기는 음악 표현과 학습된 스타일 임베딩을 조합하여 무용 시퀀스를 프레임 단위로 생성한다.
  • 스타일 임베딩는 프로토타입 벡터의 학습 가능한 가중 조합으로 계산되어 민첩한 스타일 전이를 가능하게 한다.
  • 모델은 무용 비트와 무용 운동 간의 시간 동기화를 보장하기 위해 フレ임-레벨 동기화 생성을 사용한다.
  • 질적 평가를 위해 생성된 무용을 시각화하기 위해 현실적인 비디오 렌더링 모델을 사용한다.

실험 결과

연구 질문

  • RQ1동일한 음악에서 다양한 스타일 일관성이 유지되는 무용을 생성하기 위해 잠재 스타일 표현을 효과적으로 학습하고 전이할 수 있는가?
  • RQ2기존 방법 대비 빗트 일치, 감정 일치 및 스타일 일관성 측면에서 제안된 프레임워크는 어떻게 비교되는가?
  • RQ3재학습 없이도 스타일 임베딩가 얼마나 제어 가능한 스타일 전이를 가능하게 하는가?
  • RQ4전역 음악 표현 대비 단계별 음악-무용 일치를 사용할 경우 생성 품질이 향상되는가?
  • RQ5다른 초기 자세와 스타일 임베딩에 조건을 두었을 때 모델은 다양한 무용 운동을 얼마나 잘 생성하는가?

주요 결과

  • 제안된 프레임워크는 Dancing2Music 대비 1.3% 높은 비트 히트 레이트를 달성하여 음악과 무용 간의 시간적 일치성이 향상됨을 입증한다.
  • 모델는 강한 감정 일치를 보이며, 생성된 무용의 강도 곡선이 입력 음악의 강도 프로파일을 정확히 따라간다.
  • 스타일 일관성에 대한 FID 스코어가 기준 모델보다 낮아, 생성된 무용과 실제 무용 스타일 간 유사도가 더 높음을 나타낸다.
  • 다른 초기 자세를 가진 생성된 무용의 스타일 임베딩 간 FID를 측정한 다변화 스코어는 모델이 Dancing2Music보다 유의미하게 더 다양함을 보여준다.
  • 사용자 연구 결과, 모델가 기준 모델보다 스타일 일관성에서 뛰어나며, 참가자들이 스타일 정확도 측면에서 그 출력을 선호함을 확인했다.
  • 강력한 성능에도 불구하고 일부 경우에 지속적으로 사지 기형이 발생하여 운동의 현실성 향상 여전히 개선이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.