Skip to main content
QUICK REVIEW

[論文レビュー] InverseMV: Composing Piano Scores with a Convolutional Video-Music Transformer

Chin‐Teng Lin, Yang Mu|arXiv (Cornell University)|Dec 31, 2021
Music and Audio Processing被引用数 4
ひとこと要約

本論文では、マルチモーダルアテンション機構を用いて動画フレームから記号的ピアノ楽譜を生成するビデオ・ミュージック・トランスフォーマー(VMT)モデルを提案する。7時間以上のビデオ-MIDI同期付きポップ音楽動画から構成される新しいデータセットを導入し、人間による評価を通じて、VMTがSeq2seqベースラインよりも音楽のなめらかさと動画との関連性において優れていることを実証した。特にフレームレベルの動きやリズム的構造を捉える点で顕著な優位性を示した。

ABSTRACT

Many social media users prefer consuming content in the form of videos rather than text. However, in order for content creators to produce videos with a high click-through rate, much editing is needed to match the footage to the music. This posts additional challenges for more amateur video makers. Therefore, we propose a novel attention-based model VMT (Video-Music Transformer) that automatically generates piano scores from video frames. Using music generated from models also prevent potential copyright infringements that often come with using existing music. To the best of our knowledge, there is no work besides the proposed VMT that aims to compose music for video. Additionally, there lacks a dataset with aligned video and symbolic music. We release a new dataset composed of over 7 hours of piano scores with fine alignment between pop music videos and MIDI files. We conduct experiments with human evaluation on VMT, SeqSeq model (our baseline), and the original piano version soundtrack. VMT achieves consistent improvements over the baseline on music smoothness and video relevance. In particular, with the relevance scores and our case study, our model has shown the capability of multimodality on frame-level actors' movement for music generation. Our VMT model, along with the new dataset, presents a promising research direction toward composing the matching soundtrack for videos. We have released our code at https://github.com/linchintung/VMT

研究の動機と目的

  • ビデオから楽譜を生成するためのデータセットとモデルの不足に取り組むこと、特に記号的ピアノ音楽に対して。
  • フレームレベルの粒度で動画コンテンツと整合する音楽を生成できるマルチモーダルモデルを開発すること。
  • 動画に既存の音楽を使用することに伴う著作権問題を回避すること。
  • 記号的音楽における長期的構造とリズム的整合性をモデル化することで、音楽生成の質を向上させること。
  • 人間による評価と事例研究を通じて、ビデオ・ミュージック整合性のベンチマークを確立すること。

提案手法

  • 自己注意とクロス注意メカニズムを用いて、入力の動画フレームを処理し、MIDI形式の記号的ピアノ音楽を生成するビデオ・ミュージック・トランスフォーマー(VMT)モデルを提案する。
  • 入力動画フレームから空間的・時間的特徴を抽出するために、畳み込み型の動画エンコーダーを適応させ、フレームレベルの分解能を維持する。
  • 自己回帰的生成により順次MIDIトークンを生成するため、因果的自己回帰的トランスフォーマー・デコーダーを用い、長期的な音楽的構造を保持する。
  • より良い音楽的シーケンスと和声進行のモデル化のため、事前学習済みのミュージック・トランスフォーマーのバックボーンを活用する。
  • 音符のピッチ、持続時間、ベロシティを含むトークンレベルのMIDI予測に対して、交差エントロピー損失を用いてエンドツーエンドでモデルを訓練する。
  • 正確なMIDIノートのオン/オフイベントとフレームを同期させるために、新しいデータパイプラインを導入し、細粒度の同期を確保する。

実験結果

リサーチクエスチョン

  • RQ1マルチモーダルトランスフォーマー・モデルは、動画フレームを条件として与えた場合に、知覚的になめらかで音楽的に整合性のあるピアノ楽譜を生成できるか?
  • RQ2モデルは、ダンサーや動きやシーンチェンジといったフレームレベルの視覚的ダイナミクスと、どれほどうまく音楽を整合させられるか?
  • RQ3提案されたモデルは、音楽の質と動画との関連性の両面で、強力なSeq2Seqベースラインを上回っているか?
  • RQ4モデルは、動画入力から繰り返し現れるメロディックモチーフやリズム的パターンをどれほど学習し、再現できるか?
  • RQ5モデルは、カメラのアングル、照明、パフォーマンススタイルの違いがある多様なポップ音楽動画に対しても汎用性を示せるか?

主な発見

  • 人間による評価では、VMTがSeq2seqベースラインよりも音楽のなめらかさで顕著に優れており、評価者から一貫してより自然で整合性のある音楽的感覚を与えられる。
  • VMTは繰り返し現れるメロディックモチーフと多様なピッチの変化を生成し、人間が作曲した音楽と同様の和声的・リズム的構造を捉える能力を示した。
  • 人間による評価では、特にダンスやジェスチャーといったフレームレベルの行動と音楽を一致させる点で、VMTがより高い動画関連性スコアを達成した。
  • モデルは一貫したノート長と適切なオン/オフイベントの同期を実現し、Seq2seqベースラインでよく見られる繰り返しのノートパターンを回避した。
  • 事例研究により、VMTがダンサーの動きといった視覚的キューを検出し、動画のリズムと感情を反映した音楽を生成できることを確認した。
  • 7時間を超えるビデオ-MIDI同期付きポップ音楽動画から構成される新しいデータセットの公開により、今後のビデオから楽譜生成研究の貴重なベンチマークが提供された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。