Skip to main content
QUICK REVIEW

[論文レビュー] Encoding Musical Style with Transformer Autoencoders

Kristy Choi, Curtis Hawthorne|arXiv (Cornell University)|Dec 10, 2019
Music and Audio Processing参考文献 35被引用数 9
ひとこと要約

本稿では、Transformerエンコーダーから得られる時系列埋め込みを統合することで、音楽的パフォーマンススタイルのグローバルで自己教師あり表現を学習する、順序付きオートエンコーダーであるTransformerオートエンコーダーを提案する。このグローバルなスタイルコードをメロディ埋め込みと組み合わせることで、1つの入力パフォーマンスのスタイルに一致する制御可能な音楽生成が可能となり、MAESTROおよび大規模なYouTubeピアノデータセットにおいて、ベースラインと比較してより高い対数尤度スコアと聴衆の好みスコアを達成した。

ABSTRACT

We consider the problem of learning high-level controls over the global structure of generated sequences, particularly in the context of symbolic music generation with complex language models. In this work, we present the Transformer autoencoder, which aggregates encodings of the input data across time to obtain a global representation of style from a given performance. We show it is possible to combine this global representation with other temporally distributed embeddings, enabling improved control over the separate aspects of performance style and melody. Empirically, we demonstrate the effectiveness of our method on various music generation tasks on the MAESTRO dataset and a YouTube dataset with 10,000+ hours of piano performances, where we achieve improvements in terms of log-likelihood and mean listening scores as compared to baselines.

研究の動機と目的

  • 生成される音楽シーケンスに対するハイレベルなグローバル制御を学ぶという挑戦に取り組むこと。特に、記号的音楽生成において。
  • 明示的なアノテーションやラベルを必要とせずに、与えられたパフォーマンスのスタイルに一致する制御可能な音楽生成を可能にすること。
  • グローバルなスタイル表現と詳細なメロディ条件付けを組み合わせることで、生成制御を向上させる手法を開発すること。
  • 大規模なピアノパフォーマンスデータセットを用いた定量的指標と定性的聴取評価を通じて、手法の有効性を検証すること。

提案手法

  • モデルは、入力MIDIシーケンスを処理し、パフォーマンス内の各トークンから時系列埋め込みを抽出するためにTransformerエンコーダーを使用する。
  • これらの時系列埋め込みを、学習可能なグローバルプーリング機構を用いてシーケンス全体にわたって集約し、コンパクトなグローバルスタイル表現を形成する。
  • このグローバルスタイルコードは、新たなメロディ入力に条件付けられた別個のメロディ埋め込みと組み合わされる。
  • 組み合わせられた表現は、Transformerデコーダーに供給され、新しいメロディと一致するスタイルの音楽を生成する。
  • モデルは、記号的音楽シーケンスにおける自己回帰的言語モデル学習目的を用いて、エンドツーエンドで訓練される。
  • エンコーダーとデコーダーの両方で相対的位置注意を活用することで、長期間にわたる音楽的構造と周期性を保持する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルオートエンコーダーは、教師なしの方法で、意味的でグローバルな音楽的パフォーマンススタイル表現を学習できるか?
  • RQ2学習されたこのグローバルなスタイル表現は、新たなメロディと効果的に組み合わされ、一貫性のあるスタイルを持つ整合性のある音楽を生成できるか?
  • RQ3グローバルなスタイルと局所的なメロディ条件付けの統合は、ベースラインと比較して生成品質を向上させるか?
  • RQ4モデルは、1つの入力例のみを用いても、未観測のパフォーマンスに一般化し、新しいスタイルに適応できるか?

主な発見

  • Transformerオートエンコーダーは、MAESTROおよびYouTubeピアノパフォーマンスデータセットの両方で、ベースラインモデルよりも高い対数尤度スコアを達成した。
  • 聴衆の聴取評価では、モデルが生成したサンプルが、ベースラインモデルと比較して、入力スタイルとの間で顕著に高い知覚的類似度スコアを示した。
  • モデルは、与えられたパフォーマンスのスタイルに合わせて、新たなメロディを効果的にハーモナイズした。これは、スタイルとメロディの制御が明確に分離されていることを示している。
  • 補間実験では、異なるパフォーマンススタイル間で滑らかで知覚的に意味のある遷移が得られ、分離された表現の有効性が検証された。
  • モデルは、1つの入力パフォーマンスでの条件付けでも、ベースラインモデルを上回った。これは、少数ショットでの適応能力が非常に高いことを示している。
  • ノートベースの特徴分析と定性的評価の両方を通じて、モデルが入力パフォーマンスに高い知覚的類似度を持つ音楽を生成できることが検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。