Skip to main content
QUICK REVIEW

[論文レビュー] Explicitly Conditioned Melody Generation: A Case Study with Interdependent RNNs

Benjamin Genchel, Ashis Pati|arXiv (Cornell University)|Jul 10, 2019
Music and Audio Processing参考文献 19被引用数 10
ひとこと要約

本論文は、音高と発音時刻の系列をモデル化する2つの相互に依存するRNNを用いて、モノフォニックメロディ生成における明示的音楽的条件付けの影響を調査する。コード進行、次なるコード、小節位置、および音高と発音時刻の間の相互条件付けを条件付けとして用いることで、調性条件付けが、特にビーボップにおいて、音高の正確性、リズムの多様性、音楽的整合性を顕著に向上させることを示している。また、複数の条件付けの組み合わせが、最も美的に洗練された結果をもたらすことが明らかになった。

ABSTRACT

Deep generative models for symbolic music are typically designed to model temporal dependencies in music so as to predict the next musical event given previous events. In many cases, such models are expected to learn abstract concepts such as harmony, meter, and rhythm from raw musical data without any additional information. In this study, we investigate the effects of explicitly conditioning deep generative models with musically relevant information. Specifically, we study the effects of four different conditioning inputs on the performance of a recurrent monophonic melody generation model. Several combinations of these conditioning inputs are used to train different model variants which are then evaluated using three objective evaluation paradigms across two genres of music. The results indicate musically relevant conditioning significantly improves learning and performance, and reveal how this information affects learning of musical features related to pitch and rhythm. An informal subjective evaluation suggests a corresponding improvement in the aesthetic quality of generations.

研究の動機と目的

  • 明示的音楽的条件付けが、モノフォニックメロディ生成における深層生成モデルの学習と性能に与える影響を調査すること。
  • 4つの条件付け入力(コード、次なるコード、小節位置、相互条件付け)の個別的および相乗的効果を、音高と発音時刻のモデリングに分離して比較すること。
  • 生データパターンに依存せず、調性、メートル、リズムといった音楽的特徴の学習が、条件付けによって向上するかどうかを評価すること。
  • 条件付け入力の相乗効果と、それらが客観的指標および主観的美的品質に与える影響を評価すること。
  • 特にスコットランド・アイルランド民謡とビーボップ・ジャズの間で、条件付けの有効性に差が生じるかどうかを検討すること。

提案手法

  • 1つのネットワークが音高系列を、もう1つのネットワークが発音時刻系列をモデル化する二重RNNアーキテクチャを構築し、入力埋め込みを共有する。
  • 現在のコード、次なるコード、小節位置、および相互条件付け(音高ネットワークが発音時刻に、発音時刻ネットワークが音高に条件付けられる)の組み合わせを、各ネットワークに条件付けとして与える。
  • 音高、発音時刻、コード、小節位置に対してワンホットエンコーディングを用い、意味的表現を学習するためのトレーニング可能埋め込み層を導入する。
  • 系列から系列へのタスクとして、過去の文脈と条件付けを入力として、次の音符イベントを予測するため、交差エントロピー損失を用いてモデルを学習する。
  • スコットランド・アイルランド民謡とビーボップ・ジャズの2つのデータセット(両方ともコードラベル付きメロディ)を用い、13の構成(条件付けなしを含む)を評価する。
  • 客観的評価指標(音高の正確性、発音時刻の正確性、調性の一貫性)に加え、生成されたメロディの主観的評価を非公式に実施する。

実験結果

リサーチクエスチョン

  • RQ1現在および次なるコード進行の明示的条件付けが、モノフォニックメロディ生成における音高と発音時刻の予測正確性にどのように影響するか?
  • RQ2小節位置と相互条件付けの個別的および併用効果は、リズム的フレージングとメロディの多様性にどのように作用するか?
  • RQ3条件付け入力は、特に複雑なジャンル(例:ビーボップ)において、キーの維持と調性の一貫性の維持能力にどのように寄与するか?
  • RQ4条件付け入力の相乗効果は、個別効果を上回るほど、美的品質を向上させる程度はどの程度か?
  • RQ5フォークとビーボップ・ジャズの間で、条件付けの有効性に差が生じるか、その違いは何か?

主な発見

  • コード条件付けは、特にビーボップにおいて、調性の一貫性と音高の正確性を顕著に向上させた。コード条件付けのないモデルは、頻繁にキーから逸脱していた。
  • コード条件付けのモデルは、より音楽的に洗練された音程(例:3度、4度)を生成し、未条件付けのフォーク生成では一般的であった連続する全音の過剰使用を減少させた。
  • 相互条件付けのみでは、繰り返しのメロディカルなパターン(例:繰り返しのB4)が生じることがあったが、コード条件付けと組み合わせることで、これらの問題は緩和された。
  • 小節位置条件付けは、ビーボップ生成においてリズムの多様性とフレージングを向上させたが、フォーク音楽にはほとんど効果がなく、ジャンルに依存する有用性が示された。
  • コード、相互条件付け、小節位置の組み合わせ(CIB)が、最も美的に洗練されたメロディを生成し、強い相乗効果が確認された。
  • 次なるコード条件付けは、一部のモデルで、コード進行の変化を過剰に予測する傾向があり、特にビーボップにおいてキーの一貫性を損なう原因となった。これは、現在のコード条件付けに比べ、信頼性が低い可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。