Skip to main content
QUICK REVIEW

[論文レビュー] A variational autoencoder for music generation controlled by tonal tension

Rui Guo, Ivor Simpson|arXiv (Cornell University)|Oct 13, 2020
Music Technology and Sound Studies参考文献 15被引用数 11
ひとこと要約

本稿では、スパイラルアレイ理論に基づく2つの調性的緊張尺度(クラウド直径と引張応力)を統合することで、制御可能な音楽生成を実現する変分オートエンコーダー(VAE)を提案する。潜在空間にスケーリングされた緊張方向およびレベルのベクトルを条件付けすることで、リズムを保持しつつ、ピッチコンテンツを変更して所望の緊張プロファイルに一致させる音楽のバリエーションを生成可能となり、生成された楽曲における音楽的緊張を正確に制御できる。

ABSTRACT

Many of the music generation systems based on neural networks are fully autonomous and do not offer control over the generation process. In this research, we present a controllable music generation system in terms of tonal tension. We incorporate two tonal tension measures based on the Spiral Array Tension theory into a variational autoencoder model. This allows us to control the direction of the tonal tension throughout the generated piece, as well as the overall level of tonal tension. Given a seed musical fragment, stemming from either the user input or from directly sampling from the latent space, the model can generate variations of this original seed fragment with altered tonal tension. This altered music still resembles the seed music rhythmically, but the pitch of the notes are changed to match the desired tonal tension as conditioned by the user.

研究の動機と目的

  • ユーザーが生成された音楽における調性的緊張の形状を自在に制御できる、制御可能な音楽生成システムの開発。
  • クラウド直径と引張応力という2つの調性的緊張尺度を、微細な制御を可能にする深層生成モデルに統合すること。
  • ユーザー定義の緊張プロファイルに一致させるために、リズム構造を保持しつつピッチコンテンツを変更すること。
  • 潜在空間のベクトル(緊張方向およびレベルを表す)を条件付けとして用いることで、一貫性があり長時間にわたる音楽的バリエーションの生成を可能にすること。
  • 緊張制御が生成された音楽の整合性および知覚的質に与える影響の調査。

提案手法

  • モデルは、緊張関連のベクトルによって条件付けられる潜在空間を有する条件付き変分オートエンコーダー(VAE)アーキテクチャを採用する。
  • スパイラルアレイ理論に基づき、音楽断片から計算される2つの調性的緊張尺度(クラウド直径(不協和音に基づく)および引張応力(キー間距離に基づく))が用いられる。
  • MIDIファイルから4小節のモノフォニックメロディ・ベーシック断片が抽出され、CメジャーまたはAマイナーにトランスポーズされて一貫したキー基準が得られる。
  • 緊張特徴ベクトル(例:引張応力方向、クラウド直径レベル)がスケーリングされ、潜在空間に加算され、出力の緊張を調整する。
  • モデルは3,457首のポップMIDIファイルから抽出された44,900個の4小節断片を用いて学習され、ピッチおよび緊張特徴はMidi-Minerを介して抽出される。
  • 生成された音楽は、シード断片のリズム構造を維持しているが、ピッチコンテンツは所望の緊張プロファイルに一致するように変更される。

実験結果

リサーチクエスチョン

  • RQ1ユーザーが定義した調性的緊張プロファイルに適合するように、VAEモデルを効果的に条件付けして音楽を生成できるか?
  • RQ2ピッチコンテンツを緊張ターゲットに合わせて変更する際、モデルはどの程度リズム構造を保持できるか?
  • RQ3異なる緊張特徴ベクトル(例:引張応力対クラウド直径)は、結果としての緊張形状およびピッチ分布にどのように影響を与えるか?
  • RQ4潜在表現に順次緊張ベクトルを適用することで、モデルは一貫性があり長時間の音楽的バリエーションを生成できるか?
  • RQ5緊張に配慮した特徴を組み込むことで、生成音楽の知覚的質およびピッチ分布が向上するか?

主な発見

  • 潜在空間にスケーリングされた引張応力方向ベクトルを追加すると、上行する緊張トレンドを持つ音楽の割合が増加し、生成サンプルで70%の上行比が達成された。
  • クラウド直径方向ベクトルは、引張応力方向ベクトルよりも引張応力の上行比に強い影響を示しており、両者の効果に階層的関係があることが示された。
  • ピッチ分布に顕著なシフトが生じた:CおよびG音の頻度が低下し、A、E、D音の相対的頻度が引張応力上行条件付けの下で上昇した。
  • カスタム形状の緊張ベクトルを用いることで、\diagup\diagdownや\diagdown\diagupのような複雑な緊張形状を持つ音楽をモデルが成功裏に生成した。
  • 引張応力特徴を組み込むことでベーシック音の損失が減少し、生成音楽におけるピッチの正確性が向上した。
  • シード断片の潜在空間に順次緊張ベクトルを適用することで、一貫性があり複数断片にわたる音楽生成が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。