Skip to main content
QUICK REVIEW

[論文レビュー] Generating music with sentiment using Transformer-GANs

Pedro Leão Neves, José Fornari|arXiv (Cornell University)|Dec 21, 2022
Music and Audio Processing被引用数 6
ひとこと要約

本稿では、Valence(価値)とArousal(覚醒)の次元に基づく感情ラベルを用いて条件付き記号的音楽生成をガイドするTransformer-GANモデルを提案する。MLE事前学習と対抗的学習を組み合わせることで、高品質で感情的に一貫性のある音楽を生成し、より単純な表現と少ないパラメータですでに最先端のモデルと同等の性能を達成した。

ABSTRACT

The field of Automatic Music Generation has seen significant progress thanks to the advent of Deep Learning. However, most of these results have been produced by unconditional models, which lack the ability to interact with their users, not allowing them to guide the generative process in meaningful and practical ways. Moreover, synthesizing music that remains coherent across longer timescales while still capturing the local aspects that make it sound ``realistic'' or ``human-like'' is still challenging. This is due to the large computational requirements needed to work with long sequences of data, and also to limitations imposed by the training schemes that are often employed. In this paper, we propose a generative model of symbolic music conditioned by data retrieved from human sentiment. The model is a Transformer-GAN trained with labels that correspond to different configurations of the valence and arousal dimensions that quantitatively represent human affective states. We try to tackle both of the problems above by employing an efficient linear version of Attention and using a Discriminator both as a tool to improve the overall quality of the generated music and its ability to follow the conditioning signals.

研究の動機と目的

  • 感情状態をValenceとArousalで表現した条件付き記号的音楽生成モデルの開発。
  • 長期間の音楽生成におけるTeacher Forcingと露出バイアスの限界を、対抗的学習によって克服すること。
  • 生成音楽の現実性と感情的一致性を向上させつつ、モデルの複雑さを低減すること。
  • 自動指標と人間評価(感情的正確性と音楽的質)を用いて、モデルの性能を評価すること。
  • 対抗的学習が、より単純な記号的表現と少ないパラメータであっても生成品質を向上させることを示すこと。

提案手法

  • 長期間のシーケンス処理のため、計算コストを低減するため、Transformerエンコーダに線形自己注意機構を採用。
  • 生成器がMLEと対抗的目的の両方で学習されることで、サンプル品質と一般化性能が向上するGANフレームワークを採用。
  • 識別器は、本物の音楽と生成されたサンプルを区別するように学習され、生成器が条件信号に適切に従う能力を向上させるフィードバックを提供する。
  • モデルは、ラッセルの円形モデルに由来するValenceとArousalの次元を用いて感情ラベルで条件づけられる。
  • 訓練の安定化とサンプル多様性の向上を図るため、非飽和的相対的標準GAN損失(RSGAN)を採用。
  • 初期方策の品質を向上させるために、対抗的微調整の前に最大尤度推定(MLE)を用いた事前学習を実施。

実験結果

リサーチクエスチョン

  • RQ1GANベースのモデルは、ValenceとArousalラベルで条件づけられた感情的に一貫性のある記号的音楽を生成できるか?
  • RQ2対抗的学習は、MLEオンative学習と比較して、Transformerが生成する音楽の品質と現実性を向上させるか?
  • RQ3感情的正確性と音楽的質の観点から、本モデルの性能は最先端のモデルと比べてどうか?
  • RQ4少ないパラメータとより単純なモデルで、対抗的学習を用いることで、競争力のある結果を得られるか?
  • RQ5人間の聴衆は、生成された音楽をどれほど感情的に正確で人間らしいと感じ取るか?

主な発見

  • 人間評価において、Transformer-GANは5段階評価で全体的な品質評価が3.44を記録し、ベースラインモデル(3.49)とTransformer(3.89)を上回った。
  • 人間らしい質のスコアは3.56を獲得し、より単純な記号的表現を用いていながらも、強い知覚的現実性を示した。
  • 感情認識タスクでは、ValenceとArousalのレーティングが一貫しており、意図した感情と比較して50%未満のサンプルが誤分類された。
  • 構造的整合性と独自性の両面で優れた性能を示し、それぞれ3.38と3.06のスコアを記録し、一貫性があり創造的な出力を得た。
  • より少ないパラメータとより単純な音楽表現を用いても、最先端のベースラインと同等の結果を達成した。
  • 対抗的学習スキームにより、サンプル品質と感情的一致性が著しく向上し、露出バイアスが軽減され、一般化性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。