[논문 리뷰] InverseMV: Composing Piano Scores with a Convolutional Video-Music Transformer
이 논문은 비디오 프레임에서 심벌릭 피아노 점수를 생성하기 위해 다중모달 주의 메커니즘을 사용하는 비디오-음악 트랜스포머 모델인 VMT를 제안한다. 7시간 이상의 비디오-MIDI로 정렬된 팝 음악 비디오를 포함하는 새로운 데이터셋을 도입하고, 인간 평가를 통해 VMT가 시퀀스-투-시퀀스 기반 모델 대비 음악의 유창성과 비디오 관련성에서 뛰어나며, 특히 프레임 수준의 동작과 리듬적 구조를 잘 포착함을 입증한다.
Many social media users prefer consuming content in the form of videos rather than text. However, in order for content creators to produce videos with a high click-through rate, much editing is needed to match the footage to the music. This posts additional challenges for more amateur video makers. Therefore, we propose a novel attention-based model VMT (Video-Music Transformer) that automatically generates piano scores from video frames. Using music generated from models also prevent potential copyright infringements that often come with using existing music. To the best of our knowledge, there is no work besides the proposed VMT that aims to compose music for video. Additionally, there lacks a dataset with aligned video and symbolic music. We release a new dataset composed of over 7 hours of piano scores with fine alignment between pop music videos and MIDI files. We conduct experiments with human evaluation on VMT, SeqSeq model (our baseline), and the original piano version soundtrack. VMT achieves consistent improvements over the baseline on music smoothness and video relevance. In particular, with the relevance scores and our case study, our model has shown the capability of multimodality on frame-level actors' movement for music generation. Our VMT model, along with the new dataset, presents a promising research direction toward composing the matching soundtrack for videos. We have released our code at https://github.com/linchintung/VMT
연구 동기 및 목표
- 비디오-음악 생성을 위한 데이터셋과 모델의 부족, 특히 심벌릭 피아노 음악에 한하여 해결하고자 한다.
- 비디오 콘텐츠의 프레임 수준에서 음악을 정렬할 수 있는 다중모달 모델을 개발하고자 한다.
- 비디오에 기존 음악을 사용함으로써 발생하는 저작권 문제를 해결하고자 한다.
- 심벌릭 음악의 장기적 구조와 리듬 일관성을 모델링하여 음악 생성 품질을 향상시키고자 한다.
- 인간 평가와 사례 연구를 통해 비디오-음악 정렬의 벤치마크를 설정하고자 한다.
제안 방법
- 비디오 프레임과 심벌릭 피아노 음악을 MIDI 형식으로 생성하기 위해 자기 주의 및 교차 주의 메커니즘을 사용하는 비디오-음악 트랜스포머(VMT) 모델을 제안한다.
- 입력 비디오 프레임의 시공간적 특징을 프레임 수준의 정밀도로 추출하기 위해 컨볼루션 비디오 인코더를 적응시켰다.
- 자기 회귀적 생성을 통해 순차적인 MIDI 토큰을 생성하고 장기적인 음악적 구조를 유지하기 위해 인과적 자기 회귀적 트랜스포머 디코더를 사용한다.
- 더 나은 음악적 시퀀스와 화성 진행 모델링을 위해 사전 훈련된 음악 트랜스포머 기반 아키텍처를 활용한다.
- 음절 수준의 MIDI 노트 예측(음고, 지속 시간, 강도 포함)에 대해 교차 엔트로피 손실을 사용하여 모델을 엔드 투 엔드로 훈련시켰다.
- 정밀한 MIDI 노트 on/off 이벤트와 비디오 프레임을 정렬하기 위해 새로운 데이터 파이프라인을 도입하여 미세한 동기화를 보장한다.
실험 결과
연구 질문
- RQ1다중모달 트랜스포머 모델은 비디오 프레임을 조건으로 하여 청각적으로 매끄럽고 음악적으로 일관된 피아노 점수를 생성할 수 있는가?
- RQ2모델은 댄서의 동작이나 장면 전환과 같은 비디오 프레임 수준의 시각적 역동성과 얼마나 잘 음악을 정렬할 수 있는가?
- RQ3제안된 모델은 음악 품질과 비디오 관련성 측면에서 강력한 Seq2Seq 기반 모델을 능가하는가?
- RQ4모델은 비디오 입력으로부터 반복적인 멜로디 모티프와 리듬 패턴을 얼마나 잘 학습하고 재현할 수 있는가?
- RQ5다양한 카메라 앵글, 조명 조건, 연기 스타일을 가진 팝 음악 비디오에 대해 일반화가 가능한가?
주요 결과
- 인간 평가에서 VMT는 시퀀스-투-시퀀스 기반 모델 대비 음악의 유창성에서 뚜렷하게 뛰어나며, 평가자들이 VMT의 출력을 더 유기적이고 음악적으로 자연스럽게 평가함을 확인했다.
- VMT는 반복적인 멜로디 모티프와 다양한 음고 변화를 생성하여, 인간이 작곡한 음악과 유사한 화성적·리듬적 구조를 잘 포착함을 보여주었다.
- 인간 평가 결과 VMT는 특히 춤 동작이나 제스처와 같은 프레임 수준의 행동과 음악을 잘 매칭함으로써 더 높은 비디오 관련성 점수를 확보했다.
- 모델는 일관된 노트 길이와 정확한 on/off 이벤트 정렬을 통해, 시퀀스-투-시퀀스 기반 모델에서 흔히 발생하는 반복적 노트 패tern을 피하는 데 성공했다.
- 사례 연구를 통해 VMT는 댄서의 움직임과 같은 시각적 신호를 감지하고, 비디오의 리듬과 감정을 반영하는 음악을 생성함을 확인했다.
- 7시간 이상의 비디오-MIDI로 정렬된 팝 음악 비디오를 포함하는 새로운 데이터셋의 공개는 향후 비디오-음악 생성 연구를 위한 귀중한 벤치마크를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.