Skip to main content
QUICK REVIEW

[논문 리뷰] Transflower: probabilistic autoregressive dance generation with multimodal attention.

Guillermo Valle Pérez, Gustav Eje Henter|arXiv (Cornell University)|2021. 06. 25.
Human Motion and Animation참고 문헌 87인용 수 9
한 줄 요약

이 논문은 정규화 흐름을 사용하여 자세 분포를 모델링하고, 장거리 음악 및 동작 맥락에 주의를 기울이는 다중모달 트랜스포머 인코더를 갖춘 확률적 순차적 모델인 Transflower를 제안한다. 현재까지 가장 큰 3D 댄스 데이터셋에서 평가된 결과, 다양하고 현실적이며 음악에 부합하는 댄스 동작을 생성하는 데 기존 모델들을 능가한다.

ABSTRACT

Dance requires skillful composition of complex movements that follow rhythmic, tonal and timbral features of music. Formally, generating dance conditioned on a piece of music can be expressed as a problem of modelling a high-dimensional continuous motion signal, conditioned on an audio signal. In this work we make two contributions to tackle this problem. First, we present a novel probabilistic autoregressive architecture that models the distribution over future poses with a normalizing flow conditioned on previous poses as well as music context, using a multimodal transformer encoder. Second, we introduce the currently largest 3D dance-motion dataset, obtained with a variety of motion-capture technologies, and including both professional and casual dancers. Using this dataset, we compare our new model against two baselines, via objective metrics and a user study, and show that both the ability to model a probability distribution, as well as being able to attend over a large motion and music context are necessary to produce interesting, diverse, and realistic dance that matches the music.

연구 동기 및 목표

  • 다양하고 현실적이며 음악 조건부인 3D 댄스 동작을 생성하는 생성 모델을 개발하는 것.
  • 복잡한 오디오 신호에 조건부인 고차원 연속적인 동작 시퀀스를 모델링하는 데 도전하는 것.
  • 다중모달 트랜스포머 인코더를 통합하여 동작과 음악 양 측면에서 장거리 맥락 모델링을 가능하게 하는 것.
  • 객관적 지표와 인간 평가를 통해 현실성과 음악 일치도를 평가하기 위해 모델을 평가하는 것.
  • 다양한 동작 캡처 시스템(전문가 및 일반 댄서 포함)을 통해 수집된 기존 최대의 3D 댄스 동작 데이터셋을 공개하는 것.

제안 방법

  • 모델은 정규화 흐름을 사용하여 전체 조건부 분포를 모델링하면서도, 향후 자세를 단계별로 예측하는 확률적 순차적 프레임워크를 활용한다.
  • 다중모달 트랜스포머 인코더는 오디오 및 동작 시퀀스를 처리하여 두 모odal 모두에서 장거리 종속성에 대한 주의를 가능하게 한다.
  • 정규화 흐름은 이전 자세와 다중모달 맥락 임베딩에 조건부로 설정되어 있어, 민첩하고 표현력 있는 밀도 추정을 가능하게 한다.
  • 사전 훈련된 음악 인코더에서 유도된 오디오 임베딩과 트랜스포머 기반 동작 인코더에서 유도된 동작 임베딩을 아키텍처에 통합한다.
  • 관측된 동작 시퀀스의 로그우도를 최적화하기 위해 최대우도추정을 사용하여 엔드 투 엔드로 모델을 훈련한다.
  • 학습된 분포에서 샘플링이 가능하므로, 다양한 현실적인 댄스 생성이 가능하다.

실험 결과

연구 질문

  • RQ1정규화 흐름을 사용하는 확률적 순차적 모델은 결정론적 기준 모델에 비해 더 다양하고 현실적인 3D 댄스 동작을 생성할 수 있는가?
  • RQ2장거리 음악 및 동작 맥락에 대한 다중모달 주의가 댄스-음악 일치도를 향상시키는 데 얼마나 효과적인가?
  • RQ3미래 자세의 전체 분포를 모델링하는 것이 점 추정치에 비해 더 나은 생성 품질을 이끌어내는가?
  • RQ4다양한 동작 캡처 기술과 댄서 유형은 댄스 동작 데이터의 품질과 다양성에 어떤 영향을 미치는가?
  • RQ5고품질 댄스 시퀀스 생성에서 분포 모델링과 장기 맥락 주의의 상대적 기여는 각각 얼마인가?

주요 결과

  • 제안된 모델은 객관적 지표와 사용자 연구 양 측면에서 두 기준 모델을 능가하여, 뛰어난 현실성과 음악 일치도를 입증하였다.
  • 제거 실험 결과, 정규화 흐름을 통한 분포 모델링과 장기 맥락 다중모달 주의가 고품질 생성을 위해 필수적임을 확인하였다.
  • 사용자 연구 결과, 두 구성 요소가 모두 존재할 경우 생성된 동작가 더 다양하고 현실적으로 평가되었다.
  • 모델은 입력 음악과 강한 리듬적 및 톤적 동기화를 보이는 동작 시퀀스를 생성한다.
  • 최근 공개된 3D 댄스-운동 데이터셋은 더 강력한 훈련과 평가를 가능하게 하며, 향후 댄스 생성 분야의 연구를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.