Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly Supervised Deep Recurrent Neural Networks for Basic Dance Step Generation

Nelson Yalta, Shinji Watanabe|arXiv (Cornell University)|2018. 07. 03.
Human Motion and Animation참고 문헌 24인용 수 7
한 줄 요약

이 논문은 오디오 파wer 스펙트럼을 입력으로 사용하여 음악에 동기화된 기본 댄스 스텝을 생성하는 약한 감독을 받는 딥 리커런트 신경망을 제안한다. 다층 LSTM과 자동 조건부 디코딩, 비슷한 손실 함수를 활용함으로써 모델은 낮은 교차 엔트로피(1.41)와 인간 댄서 수준의 F-측정치를 달성하여 수동으로 가공된 데이터가 최소한인 실시간, 엔드 투 엔드 학습을 가능하게 한다.

ABSTRACT

Synthesizing human's movements such as dancing is a flourishing research field which has several applications in computer graphics. Recent studies have demonstrated the advantages of deep neural networks (DNNs) for achieving remarkable performance in motion and music tasks with little effort for feature pre-processing. However, applying DNNs for generating dance to a piece of music is nevertheless challenging, because of 1) DNNs need to generate large sequences while mapping the music input, 2) the DNN needs to constraint the motion beat to the music, and 3) DNNs require a considerable amount of hand-crafted data. In this study, we propose a weakly supervised deep recurrent method for real-time basic dance generation with audio power spectrum as input. The proposed model employs convolutional layers and a multilayered Long Short-Term memory (LSTM) to process the audio input. Then, another deep LSTM layer decodes the target dance sequence. Notably, this end-to-end approach has 1) an auto-conditioned decode configuration that reduces accumulation of feedback error of large dance sequence, 2) uses a contrastive cost function to regulate the mapping between the music and motion beat, and 3) trains with weak labels generated from the motion beat, reducing the amount of hand-crafted data. We evaluate the proposed network based on i) the similarities between generated and the baseline dancer motion with a cross entropy measure for large dance sequences, and ii) accurate timing between the music and motion beat with an F-measure. Experimental results revealed that, after training using a small dataset, the model generates basic dance steps with low cross entropy and maintains an F-measure score similar to that of a baseline dancer.

연구 동기 및 목표

  • 최소한의 레이블 데이터를 사용하여 장기간의 비트 동기화 댄스 시퀀스를 생성하는 문제를 해결한다.
  • 운동 방향 변화로부터 유도된 약한 레이블을 활용해 고비용의 수동으로 가공된 운동 애너테이션에 대한 의존도를 줄인다.
  • 순차적 오디오 프레임에서 비트 타이밍을 학습하는 비슷한 비용 함수를 통해 음악과 운동 비트 간의 정렬을 향상시킨다.
  • 원시 오디오 입력에서부터 엔드 투 엔드 학습이 가능하게 하여 실시간으로 작동하는 낮은 추론 지연(약 12 ms)을 제공한다.
  • 제한된 훈련 데이터로 다양한 음악 장르에 걸쳐 노이즈에 강건하고 일반화 능력이 뛰어나게 한다.

제안 방법

  • 두 개의 브랜치 아키텍처를 사용한다: 오디오 파워 스펙트럼의 주파수 변동을 줄이기 위한 컨볼루션 레이어, 그 다음에 시간적 오디오 특징을 인코딩하기 위한 다층 LSTM.
  • 자신의 출력을 다시 피드백하여 장기적인 댄스 시퀀스를 생성하는 자동 조건부 디코딩 LSTM을 활용하여 오류 누적을 최소화한다.
  • 비트가 아닌 프레임 간의 거리를 최대화하고 비트 프레임 간의 거리를 최소화함으로써 음악-운동 비트 정렬을 규제하기 위해 비슷한 손실 함수를 적용한다.
  • 명시적인 비트 애너테이션 없이도 운동 방향 변화를 사용하여 훈련을 위한 약한 레이블을 생성한다.
  • 오디오 입력과 약한 레이블이 부여된 운동 비트만을 사용하여 전체 모델을 엔드 투 엔드로 학습시켜 사전 훈련 없이도 처음부터 학습이 가능하게 한다.
  • 훈련 중에 운동 유사성(교차 엔트로피를 통해)과 비트 타이밍 정확도(F-측정치를 통해)를 동시에 최적화한다.
Figure 1: Framework.
Figure 1: Framework.

실험 결과

연구 질문

  • RQ1오디오 파워 스펙트럼과 운동 방향을 약한 레이블로 사용할 때, 약한 감독을 받는 딥 리커런트 모델이 현실적이며 비트 동기화 댄스 스텝을 생성할 수 있는가?
  • RQ2장기간의 댄스 운동 시퀀스 생성 중 오류 누적을 줄이기 위해 자동 조건부 LSTM 디코더는 얼마나 효과적인가?
  • RQ3표준 평균 제곱 오차 대비, 비슷한 손실 함수는 음악 비트와 운동 비트 간 정렬을 얼마나 향상시키는가?
  • RQ4제한된 훈련 데이터로 다양한 음악 장르와 노이즈가 있는 오디오 입력에서 모델의 성능은 어떠한가?
  • RQ5고도의 운동 유사성과 비트 정확도를 유지하면서도 실시간 추론 성능을 달성할 수 있는가?

주요 결과

  • S2S-MC 모델은 산자라 데이터셋에서 F-측정치 53.96, 힙합 데이터셋에서 53.79를 기록하여 청결한 조건에서 베이스라인 댄서(각각 F-측정치 52.82와 62.31)를 능가했다.
  • 바운스 데이터셋에서 S2S-MC 모델은 교차 엔트로피 1.41을 기록하여 S2S(1.98)보다 유의미하게 낮게, 진짜 운동 시퀀스와의 유사도가 더 높음을 시사했다.
  • 모델는 노이즈에 강건했으며, 유사한 데이터로 훈련된 경우 청결한 오디오와 노이즈가 있는 오디오 입력 모두에서 비교적 안정된 성능을 유지했다.
  • 훈련된 장르에서는 뛰어난 성능을 보였지만, 미훈련된 음악 트랙에서 시험했을 때 F-측정치가 거의 반으로 떨어져, 예상치 못한 음악에 대한 일반화 능력이 제한됨을 보여주었다.
  • 모델는 약 12 ms의 포워드 패스 시간으로 실시간 추론 성능을 달성하여 실시간 응용에 적합했다.
  • 비슷한 손실 함수는 비트 정렬을 크게 향상시켰으며, S2S-MC는 모든 테스트 조건에서 S2S를 능가했고, 특히 노이즈 환경에서 두드러진 성능 향상을 보였다.
Figure 2: Auto-conditioned decoder.
Figure 2: Auto-conditioned decoder.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.