Skip to main content
QUICK REVIEW

[論文レビュー] MuseCoco: Generating Symbolic Music from Text

Peiling Lu, Xin Xu|arXiv (Cornell University)|May 31, 2023
Music and Audio Processing被引用数 4
ひとこと要約

MuseCocoは、音楽的属性をテキストと音楽の間のブリッジとして用いることで、テキスト記述から高品質な記号的音楽を生成する2段階フレームワークを提案する。記号的音楽データにおける自己教師あり学習とGPT-4が生成したテキスト-属性ペアを組み合わせることで、芸術性、制御性、制御精度の面で最先端の性能を達成した。1.2Bパラメータモデルは、全体スコアで1.32、目的の制御精度で20%向上し、ベースラインを上回った。

ABSTRACT

Generating music from text descriptions is a user-friendly mode since the text is a relatively easy interface for user engagement. While some approaches utilize texts to control music audio generation, editing musical elements in generated audio is challenging for users. In contrast, symbolic music offers ease of editing, making it more accessible for users to manipulate specific musical elements. In this paper, we propose MuseCoco, which generates symbolic music from text descriptions with musical attributes as the bridge to break down the task into text-to-attribute understanding and attribute-to-music generation stages. MuseCoCo stands for Music Composition Copilot that empowers musicians to generate music directly from given text descriptions, offering a significant improvement in efficiency compared to creating music entirely from scratch. The system has two main advantages: Firstly, it is data efficient. In the attribute-to-music generation stage, the attributes can be directly extracted from music sequences, making the model training self-supervised. In the text-to-attribute understanding stage, the text is synthesized and refined by ChatGPT based on the defined attribute templates. Secondly, the system can achieve precise control with specific attributes in text descriptions and offers multiple control options through attribute-conditioned or text-conditioned approaches. MuseCoco outperforms baseline systems in terms of musicality, controllability, and overall score by at least 1.27, 1.08, and 1.32 respectively. Besides, there is a notable enhancement of about 20% in objective control accuracy. In addition, we have developed a robust large-scale model with 1.2 billion parameters, showcasing exceptional controllability and musicality.

研究の動機と目的

  • 自然言語によるテキスト記述から、効率的で制御可能かつユーザーフレンドリーな記号的音楽生成を可能にすること。
  • 既存のテキストから音楽へのシステムに見られる、制御性の低さ、編集性の欠如、大規模なペairedテキスト-音楽データセットへの依存といった制限を克服すること。
  • 記号的音楽データにおける自己教師あり学習と合成されたテキスト-属性ペアを活用することで、モデルの一般化性能と性能を向上させること。
  • テキストから属性への変換または直接的な属性入力という2つの制御モードを提供することで、音楽的経験の有無を問わず多様なユーザーを支援すること。
  • 高品質な音楽と複数の音楽的属性における正確な制御を維持しつつ、スケーラブルでデータ効率の良いシステムを構築すること。

提案手法

  • システムは2段階パイプラインを採用する:まず、テキストから属性への理解段階で、GPT-4が事前定義された属性テンプレートから一貫性のあるテキスト記述を生成する。
  • 次に、属性から音楽への生成段階で、大規模なトランスフォーマー基盤モデルが抽出された音楽的属性に条件づけられた記号的音楽を生成する。
  • キーや時間 signatures、テンポ、楽器、スタイルなどの音楽的属性は、既存の記号的音楽シーケンスから直接抽出され、自己教師あり事前学習を可能にする。
  • 人為的アノテーションが施されたテキスト-音楽ペアに依存するのを減らすために、GPT-4を用いて属性テンプレートを自然言語プロンプトに組み合わせ、合成されたペairedデータを生成する。
  • モデルはテキスト条件付きおよび属性条件付きの両方の生成をサポートしており、柔軟なユーザーアクセスを可能にする。
  • 12億パラメータのxlargeモデルは、largeモデルと同一の設定で学習され、高精細かつ制御可能な音楽生成を実現する。

実験結果

リサーチクエスチョン

  • RQ1テキスト理解と音楽生成を分離する2段階フレームワークは、テキストから記号的音楽への生成における制御性と芸術性の向上に寄与するか?
  • RQ2記号的音楽データにおける自己教師あり学習は、高価なペairedテキスト-音楽データセットへの依存をどの程度低減できるか?
  • RQ3GPT-4は、学習用に高品質で一貫性のあるテキスト記述を構造化された音楽的属性から合成するのにどの程度有効か?
  • RQ4モデルサイズの拡大は、テキストから音楽への生成における制御精度と芸術性を顕著に向上させるか?
  • RQ5本システムは、非専門家ユーザー(テキスト入力)と専門家ユーザー(直接的属性入力)の両方をサポートでき、包括性と使いやすさを向上させられるか?

主な発見

  • MuseCocoは、ベースラインシステムを芸術性で最低1.27、制御性で1.08、全体スコアで1.32上回った。
  • システムは、ベースラインと比較して、目的の制御精度で20%の向上を達成し、属性への適合精度が高く保たれていることを示した。
  • 12億パラメータのxlargeモデルは、平均87.15%の目的属性制御精度を達成し、largeモデルの83.63%と比較して顕著な向上を示した。
  • プロの音楽家は、MuseCocoのおかげで作曲時間を最大2週間短縮でき、特に編曲やジャンルの融合において強い創造的インスピレーションを得られたと報告した。
  • 音楽家たちは、生成された音楽が人間の作曲に非常に近く、一貫性のあるモチーフ、調性構造、表現的なフレージングを備えており、バッハ風やジャンルのハイブリッドのような複雑なスタイルでも顕著に感じられたと指摘した。
  • 本システムは、効果的な編集とカスタマイズを可能にし、音楽教師は教育的例の生成に非常に有用だと評価した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。