Skip to main content
QUICK REVIEW

[論文レビュー] MMM : Exploring Conditional Multi-Track Music Generation with the Transformer

Jeffrey Ens, Philippe Pasquier|arXiv (Cornell University)|Aug 13, 2020
Music Technology and Sound Studies参考文献 15被引用数 38
ひとこと要約

MMMは、新規の per-track トークン列表現を用いた条件付きのマルチトラック音楽生成の Transformer ベース システムを導入し、トラックレベルおよびバー-level のインペインティングと、各トラックごとの属性制御を可能にする。

ABSTRACT

We propose the Multi-Track Music Machine (MMM), a generative system based on the Transformer architecture that is capable of generating multi-track music. In contrast to previous work, which represents musical material as a single time-ordered sequence, where the musical events corresponding to different tracks are interleaved, we create a time-ordered sequence of musical events for each track and concatenate several tracks into a single sequence. This takes advantage of the Transformer's attention-mechanism, which can adeptly handle long-term dependencies. We explore how various representations can offer the user a high degree of control at generation time, providing an interactive demo that accommodates track-level and bar-level inpainting, and offers control over track instrumentation and note density.

研究の動機と目的

  • Generative music の実用性を向上させるため、細粒度のユーザー制御を備えたマルチトラック生成を可能にする。
  • Transformer アテンションを活用して長距離依存関係を活かしつつ、トラックレベルの conditioning を preserving する新規表現を開発する。
  • 各トラックに対してトラックレベルおよびバー-level のインペインティングと、楽器とノート密度の明示的な制御を可能にする。

提案手法

  • マルチトラック音楽をトラックごとのトークン列として表現し、トラックを連結して単一のシーケンスにする(MultiTrack representation)。
  • BarFill 表現を導入し、ターゲットバーを fill トークンで置換し、生成後に実際のバーを付加してバー-level のインペインティングを行う。
  • 4-bar および 8-bar 構成で、GPT-2 スタイルの Transformer モデル(BarFill 上の MMMBar; MultiTrack 上の MMMTrack)を Lahk MIDI Dataset (LMD) を用いて訓練する。
  • 1 バーあたり 128 NOTE_ON トークン、128 NOTE_OFF トークン、そして 48 TIME_SHIFT トークンを使用し、BAR_START/BAR_END と TRACK_START/TRACK_END のメタデータ トークンに加え、各トラックごとに INSTRUMENT および DENSITY_LEVEL トークンを用いる。
  • インタラクティブな生成モードを有効化し、トラックインペインティング、バーインペインティング、および各トラックの楽器と密度属性の制御、さらには反復的生成と再調整のためのメタアルゴリズムを提供する。

実験結果

リサーチクエスチョン

  • RQ1Transformer モデルは、トラックイベントを混在させずに、マルチトラックの記譜音楽を効果的に生成・条件付けできるか。
  • RQ2单一モデルでトラックレベルとバー-level のインペインティングを実現し、各トラックの楽器とノート密度を制御可能な状態を維持できるか。
  • RQ3マルチトラック音楽生成を細粒度に制御するための最良の表現とトークンスキーマは何か。
  • RQ4MMM アプローチは、Transformer のアテンションをどのように活用してトラック間の長距離依存を処理するか。

主な発見

  • 新しい MultiTrack/BarFill トークンベース表現により、トラックレベルおよびバーlevel のインペインティングとトラックごとの属性制御が可能となる。
  • 4-bar および 8-bar セグメントで訓練された MMMBar および MMMTrack モデルは、トラック間の条件依存性を持つ柔軟な生成を示す。
  • BarFill 表現により、指定バーを条件付ける際に、後で埋めるプレースホルダを挿入することでバーlevel のインペインティングを可能にする。
  • システムは、各トラックの INSTRUMENT トークンによる楽器レベルの制御と、DENSITY_LEVEL トークンによるノート密度制御をサポートする。
  • 著者らは、LMD において 10-track 4-bar の約 99.8%、10-track 8-bar の約 86.8%、および 10-track 16-bar の約 38.8% が <2048 tokens で表現可能であると指摘し、実用的なスケーラビリティを示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。