Skip to main content
QUICK REVIEW

[論文レビュー] Music FaderNets: Controllable Music Generation Based On High-Level Features via Low-Level Feature Modelling

Hao Tan, Dorien Herremans|arXiv (Cornell University)|Jul 29, 2020
Music and Audio Processing参考文献 41被引用数 11
ひとこと要約

Music FaderNets は、分離された潜在表現を通じて、リズムやノート密度などの低レベル属性をモデル化することで、解釈可能な高レベル音楽的特徴(例:アーザル)を学習する半教師ありフレームワークを提案する。ガウス・ミックスチャネル変分オートエンコーダー(GM-VAEs)を用いることで、1%のラベル付きデータのみで制御可能な音楽生成が可能となり、主観的聴取テストによりアーザルレベルの変化について81.45%の合意が得られた。

ABSTRACT

High-level musical qualities (such as emotion) are often abstract, subjective, and hard to quantify. Given these difficulties, it is not easy to learn good feature representations with supervised learning techniques, either because of the insufficiency of labels, or the subjectiveness (and hence large variance) in human-annotated labels. In this paper, we present a framework that can learn high-level feature representations with a limited amount of data, by first modelling their corresponding quantifiable low-level attributes. We refer to our proposed framework as Music FaderNets, which is inspired by the fact that low-level attributes can be continuously manipulated by separate "sliding faders" through feature disentanglement and latent regularization techniques. High-level features are then inferred from the low-level representations through semi-supervised clustering using Gaussian Mixture Variational Autoencoders (GM-VAEs). Using arousal as an example of a high-level feature, we show that the "faders" of our model are disentangled and change linearly w.r.t. the modelled low-level attributes of the generated output music. Furthermore, we demonstrate that the model successfully learns the intrinsic relationship between arousal and its corresponding low-level attributes (rhythm and note density), with only 1% of the training set being labelled. Finally, using the learnt high-level feature representations, we explore the application of our framework in style transfer tasks across different arousal states. The effectiveness of this approach is verified through a subjective listening test.

研究の動機と目的

  • 高レベル音楽的特徴(感情やアーザルなど)のための限られた、かつ主観的な人間のアノテーションの課題に対処すること。
  • 潜在正則化と特徴の分離を用いて、低レベル音楽的属性(例:リズム、ノート密度)の分離可能で制御可能な表現を学習すること。
  • 半教師ありクラスタリングを用い、限られたラベル付きデータで低レベル表現からの高レベル音楽的質を推定すること。
  • 学習された潜在表現を用いて、高レベル特徴(例:アーザル)間でのスタイル転送を可能とすること。
  • 主観的聴取テストと制御性・知覚的品質の定量的分析を通じて、モデルの有効性を検証すること。

提案手法

  • 各低レベル属性ごとに別々の潜在空間を持つ条件付きVAEアーキテクチャを採用し、'ファーダー'ノブによる独立した制御を可能にする。
  • 個々の低レベル特徴(例:リズム、ノート密度)を別個の解釈可能な次元に分離するため、潜在正則化技術を適用する。
  • 低レベル特徴と高レベル属性(例:アーザル)との階層的関係をモデル化するために、ガウス・ミックスチャネル変分オートエンコーダー(GM-VAE)を採用する。
  • 限られたラベル付きデータを用いた半教師ありの方法で、低レベル表現からの潜在コードをクラスタリングすることで、高レベル特徴表現を学習する。
  • スタイル転送のため、異なるアーザルレベルに対応するガウス成分の平均間のシフトベクトルを計算し、それを潜在コードに適用して音楽スタイルを転送する。
  • グローバルデコーダーが変更された潜在コードから音楽を再構築し、構造的整合性を保ちつつ高レベル特徴を変更する。

実験結果

リサーチクエスチョン

  • RQ11%のラベル付きデータのみで、低レベル属性から高レベル音楽的特徴(例:アーザル)を学習できるか?
  • RQ2低レベル特徴(リズム、ノート密度)に対する学習済みの'ファーダー'コントロールは、分離されており、生成音楽への変化に対して線形的かつ連続的か?
  • RQ3モデルは、アーザルとその低レベルの関連要因(リズム、ノート密度)の本質的関係を正しく捉えているか?
  • RQ4音楽的品質を維持したまま、異なるアーザル状態間での効果的なスタイル転送が可能か?
  • RQ5人間の聴取者が生成音楽における意図されたアーザル変化をどれほど正しく認識できるか?

主な発見

  • モデルは、アーザルのラベル付きデータを訓練データの1%のみで使用して高レベル特徴表現を成功裏に学習し、高いデータ効率性を示した。
  • 低レベル属性(リズム、ノート密度)に対する'ファーダー'コントロールは、分離されており、生成音楽出力に対して線形的かつ連続的な影響を示した。
  • 生成サンプルにおける知覚的一致性により、アーザルとその低レベルの関連要因(リズム、ノート密度)の本質的関係がモデルが正しく捉えていることが裏付けられた。
  • 主観的聴取テストにおいて、81.45%の参加者がスタイル転送後のアーザル変化の方向を正しく認識した。
  • リズム、メロディ、ハーモニー、自然さの平均評価スコアはそれぞれ3.53、3.39、3.41、3.33であり、転送音楽の知覚的品質が中程度から良好であることが示された。
  • 高→低アーザルへの転送では92.5%の合意が得られたのに対し、低→高への転送では70.41%にとどまり、下向きのシフトの方が知覚的に明確であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。