[논문 리뷰] Dance2Music: Automatic Dance-driven Music Generation
이 논문은 오프라인 검색 기반 방법 또는 온라인 딥러닝 모델을 사용하여 춤 영상에서 음악을 생성하는 Dance2Music 시스템을 제안한다. 강력한 베이스라인 대비 유의미한 인간 선호도를 확보하였으며, 오프라인 및 온라인 방법 각각 77% 및 70%의 선호도를 기록하여 자세-노트 상관관계 최적화를 통한 춤 동작과 음악 노트 간 효과적인 동기화를 입증한다.
Dance and music typically go hand in hand. The complexities in dance, music, and their synchronisation make them fascinating to study from a computational creativity perspective. While several works have looked at generating dance for a given music, automatically generating music for a given dance remains under-explored. This capability could have several creative expression and entertainment applications. We present some early explorations in this direction. We present a search-based offline approach that generates music after processing the entire dance video and an online approach that uses a deep neural network to generate music on-the-fly as the video proceeds. We compare these approaches to a strong heuristic baseline via human studies and present our findings. We have integrated our online approach in a live demo! A video of the demo can be found here: https://sites.google.com/view/dance2music/live-demo.
연구 동기 및 목표
- 음악으로부터 춤을 생성하는 것에 비해 다소 간과된 분야인 춤에 조건화된 자동 음악 생성을 탐색한다.
- 춤의 정서적 및 리듬적 흐름과 동기화된 음악을 생성하는 시스템을 개발한다.
- 인간 평가를 통해 오프라인 및 온라인 접근 방식의 음악 생성 성능을 비교한다.
- 실시간 음악 생성을 시연하는 라이브 데모를 구축한다.
- 인간 평가에서 비교를 위한 강력한 히وري스틱 기반 베이스라인을 수립한다.
제안 방법
- OpenPose를 사용해 18개의 관절 키포인트 2D 자세를 추출하고, 프레임당 36차원 벡터로 정규화하여 춤을 표현한다.
- 공명성과 인지 용이성을 확보하기 위해 도메인 주요 5도 스케일(C4, D4, E4, G4, A4)의 음표로 음악을 표현한다.
- 지역 시간 윈도우 내에서 자세 유사도와 음표 유사도 간 피어슨 상관관계를 최대화하는 검색 기반 오프라인 방법을 사용한다.
- 오프라인 방법의 상관관계 최적화를 모방하는 온라인 딥 네트워크를 구현하여 실시간으로 라이브 영상에서 음악 생성을 가능하게 한다.
- 빔 서치를 사용하며, 빔 크기 B를 설정하고 국소 및 전역 자세 유사도 이력을 활용해 음표 시퀀스 선택을 유도한다.
- 455개의 AIST 데이터셋 영상으로 온라인 모델을 훈련하고, 45개 영상에서 평가하여 오프라인 방법과 평균 0.33의 상관관계, 73.5%의 정확도를 달성했다.
실험 결과
연구 질문
- RQ1검색 기반 오프라인 방법은 강력한 히وري스틱 기반 베이스라인 대비 춤과 더 잘 동기화된 음악을 생성할 수 있는가?
- RQ2오프라인 방법을 모방하도록 훈련된 딥러닝 모델은 인간이 인식하는 동기화 수준에 도달하는 실시간 음악 생성을 달성할 수 있는가?
- RQ3국소적 자세 이력과 전역적 자세 이력의 사용이 음악 출력의 역동성과 인식 품질에 어떤 영향을 미치는가?
- RQ4온라인 신경망과 오프라인 검색 기반 방법 간의 노트 예측 정확도 및 춤 동작과의 상관관계 측면에서 성능 격차는 어느 정도인가?
- RQ5춤 동작에서 생성된 음악은 인간 평가에서 베이스라인 음악보다 통계적으로 유의미한 선호도를 보이는가?
주요 결과
- 오프라인 방법은 인간 평가에서 77%의 승리 비율을 기록하여 자세 유사도와 음표 유사도 간 상관관계 최적화가 효과적임을 입증했다.
- 온라인 딥러닝 방법은 인간 평가에서 70%의 승리 비율을 기록하여 통계적으로 유의미하며, 실시간 성능이 뛰어남을 입증했다.
- 온라인 모델은 오프라인 방법 대비 다음 음표 예측 정확도가 73.5%로, 20%의 우연한 선택 기대치를 크게 상회했다.
- 온라인 모델의 생성 음표 시퀀스와 춤 자세 시퀀스 간 평균 피어슨 상관계수는 0.33이며, 오프라인 방법은 0.38로, 최적화 목표와 강한 일치를 보였다.
- 오프라인 방법에서 국소 이력 사용은 전역 이력 대비 더 역동적인 음악을 생성했으며, 전역 이력은 평탄한 음표 시퀀스를 유도했다.
- 온라인 방법의 라이브 데모는 실시간으로 라이브 영상 입력에서 음악 생성을 성공적으로 시연하여 시스템의 실용적 구현 가능성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.