Skip to main content
QUICK REVIEW

[論文レビュー] Transformer-XL Based Music Generation with Multiple Sequences of Time-valued Notes

Xianchao Wu, Chengyuan Wang|arXiv (Cornell University)|Jul 11, 2020
Music and Audio Processing参考文献 13被引用数 10
ひとこと要約

本稿では、絶対時刻ではなく相対的時間に基づく4つの時間値を持つノートシーケンス(on-to-on 持続時間、on-to-off 持続時間、ピッチ、ベロシティ)を用いることで、より自然な音楽生成を実現するTransformer-XLベースの音楽生成フレームワークを提案する。これらのシーケンス上で4つの独立したTransformer-XLネットワークを共同学習させることで、安定した1時間以上の音楽生成が可能となり、リズムの整合性、ダイナミクス制御、調性構造の向上が達成された。自動評価および人間評価の両面で、Music Transformer や DeepJ、単一シーケンスのTransformer-XLを凌駕した。

ABSTRACT

Current state-of-the-art AI based classical music creation algorithms such as Music Transformer are trained by employing single sequence of notes with time-shifts. The major drawback of absolute time interval expression is the difficulty of similarity computing of notes that share the same note value yet different tempos, in one or among MIDI files. In addition, the usage of single sequence restricts the model to separately and effectively learn music information such as harmony and rhythm. In this paper, we propose a framework with two novel methods to respectively track these two shortages, one is the construction of time-valued note sequences that liberate note values from tempos and the other is the separated usage of four sequences, namely, former note on to current note on, note on to note off, pitch, and velocity, for jointly training of four Transformer-XL networks. Through training on a 23-hour piano MIDI dataset, our framework generates significantly better and hour-level longer music than three state-of-the-art baselines, namely Music Transformer, DeepJ, and single sequence-based Transformer-XL, evaluated automatically and manually.

研究の動機と目的

  • 絶対時刻による音楽生成の限界を是正する。これには、テンポ不変の類似度計算が困難になり、相対的ノート持続時間の適切なモデリングが妨げられる。
  • 単一シーケンスモデリングの制約を克服する。時間的要素、ピッチ、ベロシティを分離し、4つの独立したシーケンスとして扱い、統合学習を可能にする。
  • 安定的で長時間の音楽生成(最大36時間)を実現する。ノート密度の一貫性、適切なリズムパターン、表現的なダイナミクスを維持する。
  • 作曲家のスコア(相対的時間)に基づく音楽モデリングを実現することで、演奏録音(絶対的時間)に基づく従来手法よりも音楽的質を向上させる。

提案手法

  • 4つの時間値を用いたノート表現(on2on, on2off, pitch, velocity)を提案。on2on および on2off はテンポに依存しない相対的持続時間を符号化する。
  • 音楽シーケンスを4つの独立したシーケンス(on2on, on2off, pitch, velocity)に分解し、それぞれを個別のTransformer-XLネットワークで処理する。
  • 4つのシーケンス間でトークン埋め込みを共有し、共同学習を可能にするために、各シーケンスのクロスエントロピー損失を統合して訓練する。
  • Transformer-XLの相対的位置エンコーディングとセグメントレベルの再帰構造を活用し、長距離依存関係を長大な音楽シーケンスにわたってモデル化する。
  • 標準的なMIDI処理ツール(例:pretty_midi)を用いて特徴抽出を行い、23時間分のピアノMIDIデータセット上でフレームワークを訓練する。
  • 初期シーケンスを固定したプリミング機構を導入し、長時間音楽生成の安定性と一貫性を評価する。

実験結果

リサーチクエスチョン

  • RQ1絶対的時間の代わりに相対的時間値(on2on, on2off)を用いたノートシーケンスモデリングにより、音楽的に整合的でテンポ不変の音楽生成能力が向上するか?
  • RQ2時間的要素、ピッチ、ベロシティを4つの独立したシーケンスに分離することで、コード進行やダイナミクスのコントoursといった複雑な音楽的構造の学習・生成能力が向上するか?
  • RQ3マルチシーケンス・マルチ-Transformer-XLフレームワークは、ノート密度やリズムの一貫性に著しい劣化を来さずに、1時間を超える長時間にわたり安定した高品質な音楽を生成できるか?
  • RQ4本手法は、Music Transformer や DeepJ、単一シーケンスのTransformer-XLと比較して、客観的指標および人間評価の両面で優れているか?

主な発見

  • モデルは安定したノート密度を維持しながら、連続で36時間の音楽を生成し、前例のない長時間音楽生成能力を示した。
  • ノート密度は長時間にわたり一貫していたが、Music Transformer や単一シーケンスのTransformer-XLは、NOTE_ON/OFFの一致エラーにより著しい密度低下を示した。
  • 生成音楽のピッチ分布は、元のデータセットに最も近かった。ピッチクラスおよびレジスタのパターンの学習が良好に達成されたことを示している。
  • トニック・トゥ・ドミナント(例:CメジャーからDメジャー)といった一般的なコード進行が学習されており、調性構造の学習の証拠となった。
  • ベロシティパターンは滑らかで表現的であり、段階的な変化とセクション間の感情的対比が見られ、実際の音楽的フレージングに類似していた。
  • 人間評価では、特に長時間音楽生成において、ベースラインと比較してモデル出力がより安定的で音楽的に整合的であると確認された。不自然または不規則なノートパターンの出現が著しく減少した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。