Skip to main content
QUICK REVIEW

[論文レビュー] Neural Melody Composition from Lyrics

Hangbo Bao, Shaohan Huang|arXiv (Cornell University)|Sep 12, 2018
Music and Audio Processing参考文献 23被引用数 4
ひとこと要約

本稿では、歌詞に条件づけられたメロディ生成のためのエンド・ツー・エンドなニューラルシーケンス・ツー・シーケンスモデルを提案する。このモデルは、音符とそれらの正確な音節-音符アライメント(1対多のマッピングを含む)を同時に生成する。モデルは、歌詞とコンテキスト・メロディのための二重エンコーダーと、階層的なRNNデコーダーを用い、メロディカルに一貫性があり、耳に心地よいメロディを生成する。このモデルは、18,451曲の中国ポップソングからなる大規模なデータセット上で、自動評価および人間評価の両面でベースラインを上回る性能を発揮する。

ABSTRACT

In this paper, we study a novel task that learns to compose music from natural language. Given the lyrics as input, we propose a melody composition model that generates lyrics-conditional melody as well as the exact alignment between the generated melody and the given lyrics simultaneously. More specifically, we develop the melody composition model based on the sequence-to-sequence framework. It consists of two neural encoders to encode the current lyrics and the context melody respectively, and a hierarchical decoder to jointly produce musical notes and the corresponding alignment. Experimental results on lyrics-melody pairs of 18,451 pop songs demonstrate the effectiveness of our proposed methods. In addition, we apply a singing voice synthesizer software to synthesize the "singing" of the lyrics and melodies for human evaluation. Results indicate that our generated melodies are more melodious and tuneful compared with the baseline method.

研究の動機と目的

  • 複雑な音節-音符アライメントを処理できるエンド・ツー・エンドなニューラルモデルが、歌詞に条件づけられたメロディ生成において不足している現状を是正すること。
  • 現行の手法が1対1のアライメントのみを仮定しているという制限を克服し、実際の音楽に広く見られる1対多のマッピングを無視しないこと。
  • 18,451曲の中国ポップソングと644,472組の音節-メロディの三つ組を含む、大規模かつ高精度な歌詞-メロディデータセットを構築すること。
  • メロディとアライメントを同時に生成するモデルを開発し、音楽的な自然さとメロディアスさを向上させること。
  • 歌い声合成を用いた自動評価と人間評価を通じて、モデルの優位性を検証すること。

提案手法

  • モデルは、現在の歌詞の音節をエンコードするための1つの双方向RNNエンコーダーと、アテンション機構を用いてコンテキスト・メロディをエンコードするもう1つの双方向RNNエンコーダーを備えた、シーケンス・ツー・シーケンスフレームワークを採用する。
  • 階層的RNNデコーダーは3層構成であり、それぞれの音符の音高と持続時間を予測する2層と、各音符がどの音節に対応するかを示すアライメントラベルを予測する1層からなる。
  • アライメント予測層により、1つの音節が複数の連続する音符に対応する1対多のマッピングを学習できるようになる。
  • モデルは、正確にアノテートされた音節-音符アライメントを備えた、18,451曲の中国ポップソングからなる大規模データセット上でエンド・ツー・エンドに訓練される。
  • 生成されたメロディと歌詞を音声に変換するために、歌い声合成器が使用され、人間評価に用いられる。
  • 訓練目的は、音符の生成とアライメントの正確性の両方を最適化するものであり、音高、持続時間、アライメントラベルの共同最適化が行われる。

実験結果

リサーチクエスチョン

  • RQ1エンド・ツー・エンドなニューラルネットワークモデルは、音節と音符の正確なアライメントを学習しながら、歌詞からメロディを効果的に生成できるか?
  • RQ21対多の音節-音符アライメントをモデル化することで、1対1のマッピングに制限されたモデルと比較して、メロディの質が向上するか?
  • RQ3二重エンコーダーと階層的デコードを備えた統合的シーケンス・ツー・シーケンスフレームワークは、従来のシーケンスラベル付けや分類ベースラインと比較して、メロディ生成において優れた性能を発揮するか?
  • RQ4自動評価指標と人間評価は、生成されたメロディの音楽的質を評価する上で、どのように比較されるか?
  • RQ5正確なアライメント情報を取り入れることで、歌い声のノート持続時間と休符の自然さはどの程度向上するか?

主な発見

  • 提案モデルは、すべての自動評価指標においてベースライン手法を顕著に上回り、メロディ生成とアライメント正確性の両面で優れた性能を示した。
  • 人間評価の結果、提案手法で生成されたメロディの平均総合スコアは4.57であった。これは、ベースラインのSeq2seqモデル(3.28)とSongwriterベースライン(3.83)を大きく上回った。
  • 人間のアノテーターは、提案モデルのメロディを、特にノート持続時間と休符の自然さが向上していると評価した。
  • モデルは1対多のアライメントを効果的に捉え、データセットの97.9%の楽曲に少なくとも1つの音節が複数の音符に対応していることが裏付けられた。
  • デコーダーにおける明示的なアライメント予測の導入により、より自然なリズムとタイミングが得られ、リズム指標で高いスコア(4.17 vs. Seq2seqの2.66)を記録した。
  • 正確な音節レベルのアライメント情報を利用することは、従来のシーケンス・ツー・シーケンスモデルにおけるソフトアテンション機構よりも、メロディ生成においてより効果的であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。