Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Generate Music With Sentiment

Lucas N. Ferreira, Jim Whitehead|arXiv (Cornell University)|Mar 9, 2021
Music and Audio Processing参考文献 16被引用数 15
ひとこと要約

本稿では、感情に基づいて音楽生成を制御するため、変更されたLSTM(mLSTM)とロジスティック回帰を組み合わせた分離可能な深層生成モデルを提案する。mLSTM内の感情固有のニューロンを特定・最適化することで、意図した感情的トーンの音楽を生成する。陽性の音楽では84%、陰性の音楽では67%の精度を達成し、人間の評価者によって意図された感情が確認されたが、陰性の音楽は曖昧さを示した。

ABSTRACT

Deep Learning models have shown very promising results in automatically composing polyphonic music pieces. However, it is very hard to control such models in order to guide the compositions towards a desired goal. We are interested in controlling a model to automatically generate music with a given sentiment. This paper presents a generative Deep Learning model that can be directed to compose music with a given sentiment. Besides music generation, the same model can be used for sentiment analysis of symbolic music. We evaluate the accuracy of the model in classifying sentiment of symbolic music using a new dataset of video game soundtracks. Results show that our model is able to obtain good prediction accuracy. A user study shows that human subjects agreed that the generated music has the intended sentiment, however negative pieces can be ambiguous.

研究の動機と目的

  • 指定された感情(陽性または陰性)を有する記号的音楽を生成できる生成的深層学習モデルを開発すること。
  • mLSTM内に存在する感情固有のニューロンを特定・活用し、制御可能な音楽生成を可能にすること。
  • 新たに作成されたビデオゲームサウンドトラックのデータセットを用いて、モデルの性能を感情分類器および音楽生成器の両方として評価すること。
  • 記号的音楽というほとんど未開拓の分野において、感情を音楽生成から分離可能かどうかを検討すること。
  • ビデオゲーム、映画、治療的文脈における感情的音楽作成の応用を可能にすること。

提案手法

  • 728件のラベルなしMIDI楽曲(ビデオゲームサウンドトラック)を用いて、生成的mLSTMを訓練し、音楽的表現を学習する。
  • mLSTMの隠れ状態を用いて感情分類を行うロジスティック回帰モデルを訓練し、感情信号を担うニューロンを同定する。
  • 161個の特定mLSTMニューロンの重みを最適化するための遺伝的アルゴリズムを用い、望ましい感情(陽性または陰性)の音楽を生成する。
  • 遺伝的アルゴリズムのフィットネス関数は、30曲の生成された楽曲において、予測された感情と目的の感情(0または1)との間の平均二乗誤差を測定する。
  • アマゾンMTurkのヒトアノテーターが、感情の正負(陽性/陰性)にマッピングされた「価値・覚醒」モデルを用いて生成された楽曲をラベル付けする。
  • モデルは、ホールドアウトデータセットを用いた感情分類器としての性能と、生成された楽曲に対するユーザースタディを通じた生成器としての性能の両方で評価される。

実験結果

リサーチクエスチョン

  • RQ1生成的深層学習モデルは、特定の感情(陽性または陰性)を有する記号的音楽を効果的に制御して生成できるか?
  • RQ2mLSTM内に存在する感情固有のニューロンを同定し、音楽生成を誘導するために操作可能か?
  • RQ3分離可能な生成的モデルは、記号的音楽の感情分類において、完全に教師ありLSTMと比較してどの程度優れているか?
  • RQ4特に陰性の楽曲に関して、聴衆は生成された楽曲に意図された感情をどの程度正しく認識しているか?
  • RQ5本モデルは、多クラスの感情または連続的な価値・覚醒値を有する音楽の生成に拡張可能か?

主な発見

  • 人間のアノテーターによる確認により、本モデルは意図された陽性感情を有する音楽を84%の精度で生成した。
  • 意図された陰性感情を有する音楽を67%の精度で生成したが、聴衆の間では陰性の楽曲が曖昧に感じられた。
  • ロジスティック回帰を組み合わせた生成的mLSTMは、完全に教師ありLSTMと比較して、感情分類精度で約30%高い性能を示した。
  • 人間のアノテーターは、生成された陽性楽曲が意図された感情を伝えていると合意したが、陰性楽曲については複数の指標で混合された価値が観察され、部分的な成功であった。
  • 遺伝的アルゴリズムは、ニューロンの重みを効果的に最適化し、感情制御を可能にしたが、陰性生成のフィットネスが低かったことから、トレーニングデータの不均衡が原因である可能性がある。
  • 本研究は、感情ラベルが付与された記号的音楽の最初のラベル付きデータセットを提示し、今後の感情的音楽生成分野の研究を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。