[논문 리뷰] Foley Music: Learning to Generate Music from Videos
이 논문은 신체 관절 키포인트와 MIDI 이벤트를 중간 표현으로 사용하여 침묵한 영상에서 표현적이고 동기화된 음악을 생성하는 시스템인 Foley Music를 소개한다. 인간 운동을 상징적 음악으로 매핑하는 그래프-Transformer 프레임워크를 사용하여, 청취자 연구에서 베이스라인을 능가하고 해석 가능한 MIDI 출력 덕분에 음악 편집이 유연하게 가능하다.
In this paper, we introduce Foley Music, a system that can synthesize plausible music for a silent video clip about people playing musical instruments. We first identify two key intermediate representations for a successful video to music generator: body keypoints from videos and MIDI events from audio recordings. We then formulate music generation from videos as a motion-to-MIDI translation problem. We present a Graph$-$Transformer framework that can accurately predict MIDI event sequences in accordance with the body movements. The MIDI event can then be converted to realistic music using an off-the-shelf music synthesizer tool. We demonstrate the effectiveness of our models on videos containing a variety of music performances. Experimental results show that our model outperforms several existing systems in generating music that is pleasant to listen to. More importantly, the MIDI representations are fully interpretable and transparent, thus enabling us to perform music editing flexibly. We encourage the readers to watch the demo video with audio turned on to experience the results.
연구 동기 및 목표
- 침묵한 연주 영상에서 자연스럽고 동기화된 음악을 생성할 수 있는 시스템을 개발하는 것.
- 시각적 운동을 표현적 음성으로 매핑하는 과제를 해결하기 위해 핵심 중간 표현으로 신체 관절 키포인트와 MIDI 이벤트를 식별하는 것.
- 원시 파형 대신 완전히 해석 가능한 MIDI 표현을 사용함으로써 음악 편집의 유연성을 보장하는 것.
- 그래프-Transformer 모델을 통한 운동에서 MIDI로의 변환 방식이 이전 방법보다 더 높은 품질의 자연스러운 음악을 생성한다는 것을 입증하는 것.
제안 방법
- 영상 프레임에서 자세 추정을 사용하여 2차원 신체 및 손 관절 키포인트를 추출하여 시간에 따른 인간 운동을 표현한다.
- 음악 생성을 운동에서 MIDI로의 번역 문제로 설정하며, MIDI는 노트 온/오프, 톤, 속도를 코딩하는 기호적이고 해석 가능한 음성 표현 방식이다.
- 시간적 순서의 관절 좌표를 처리하여 공간-시간 특징을 학습하기 위해 그래프 컨볼루션 네트워크(GCN) 인코더를 사용한다.
- 자기주의 어텐션을 갖춘 트랜스포머 디코더가 음악 생성 과정에서 장거리 의존성을 포착하며, MIDI 이벤트 시퀀스를 예측한다.
- 예측된 MIDI 시퀀스는 평가 및 재생을 위해 표준 합성기로 실존적인 오디오로 변환된다.
- 모델은 피아노, 바이올린, 아코디언 등을 포함한 아홉 가지 악기의 대규모 음악 연주 영상 데이터셋에서 훈련된다.
실험 결과
연구 질문
- RQ1비디오에서 음악 생성 시스템은 침묵한 영상의 시각적 운동 신호만으로 표현적 음악을 정확히 예측할 수 있는가?
- RQ2비디오나 오디오 특징보다 신체 관절 키포인트와 MIDI를 중간 표현으로 사용할 경우 교차 모odal 음악 생성에 더 효과적인가?
- RQ3MIDI의 기호적 성격이 원시 파형 기반 모델에서는 구현이 어려운, 해석 가능하고 민감한 음악 편집을 가능하게 하는가?
- RQ4운동 시퀀스에서 장기적인 음악적 의존성을 포착하는 데서 그래프-Transformer 아키텍처가 순환형 또는 컨볼루션 모델보다 우월한가?
주요 결과
- 제안된 그래프-Transformer 모델은 청취자 연구에서 강력한 베이스라인을 크게 능가했으며, 정확성, 동기화, 전체 선호도 평가에서 높은 점수를 기록했다.
- MIDI 예측에서 바이올린에 대해 NLL 손실 1.558, 플루트에 대해 1.995를 기록하여 RGB 이미지 및 옵티컬 플로우 베이스라인을 초월했다.
- 제거 분석을 통해 RGB나 옵티컬 플로우 특징보다 관절 키포인트 기반 시각적 표현이 더 높은 MIDI 예측 정확도를 제공하는 것으로 확인되었다.
- 트랜스포머 디코더의 사용은 GRU 대비 NLL 손실을 감소시켜 장거리 음악적 의존성을 모델링하는 데서의 우수성을 입증했다.
- 모든 베이스라인보다 낮은 NDB(20)를 기록하여 더 높은 다양성과 더 나은 일반화 능력을 보였다.
- MIDI 표현 방식은 음계와 스타일의 직접 편집을 가능하게 하여 제어 가능한 음악 생성 분야에서 사전에 없었던 민감성과 영향력을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.