Skip to main content
QUICK REVIEW

[論文レビュー] Generation of lyrics lines conditioned on music audio clips

Olga Vechtomova, Gaurav Sahu|arXiv (Cornell University)|Sep 30, 2020
Music and Audio Processing参考文献 14被引用数 4
ひとこと要約

本稿では、インストゥルメンタル音楽のオーディオクリップを条件として、感情的に整合性のある歌詞を生成する二モード変分オートエンコーダー(VAE)モデルを提示する。スペクトログラムから連続的な潜在表現を学習し、それをテキストVAEの条件として用いることで、入力オーディオの感情的トーンと整合する歌詞を生成する。自動評価と人間評価の両方で検証された結果、音声と歌詞の整合性を検出する精度が78.3%に達した。

ABSTRACT

We present a system for generating novel lyrics lines conditioned on music audio. A bimodal neural network model learns to generate lines conditioned on any given short audio clip. The model consists of a spectrogram variational autoencoder (VAE) and a text VAE. Both automatic and human evaluations demonstrate effectiveness of our model in generating lines that have an emotional impact matching a given audio clip. The system is intended to serve as a creativity tool for songwriters.

研究の動機と目的

  • インストゥルメンタル音声クリップに基づいて、小説的で感情的に共鳴する歌詞を生成するクリエイティブツールの開発。
  • 感情的インパクトにおいて重要な役割を果たす音声オーディオを条件としない既存のテキスト生成モデルのギャップを埋める。
  • スペクトログラム-VAEから得られる連続的な潜在変数が、スタイルに整合した生成を実現するテキスト-VAEを効果的に条件づけるかを検討する。
  • 多様なインストゥルメンタル音声クリップの感情的トーンと一致する歌詞を生成する能力をモデルが有しているかを評価する。

提案手法

  • スペクトログラム-VAEは、10秒の音声クリップのMELスペクトログラムを潜在空間にエンコードすることで、連続的な潜在表現を学習する。
  • テキスト-VAEのデコーダーは、スペクトログラム-VAEの潜在ベクトルによって条件づけられ、音声の感情的・スタイル的特徴と整合する歌詞の生成が可能になる。
  • VAEのエンコーダーとデコーダーの両方でLSTMを使用し、再構成損失とKLダイバージェンス正則化を適用する。
  • 語彙的類似性の測定には、語レベルのKLダイバージェンスとランクバイアスオーバーラップ(RBO)を用い、感情カテゴリ内での一貫性を評価する。
  • 人間評価では、参加者が与えられたインストゥルメンタルクリップに一致する2つの歌詞リスト(同じまたは反対の感情カテゴリ)を特定する。
  • システムは、アルバム『Ghosts I-IV』のインストゥルメンタルクリップデータセットを用いて学習し、『落ち着いた』と『激しい』の2つの感情カテゴリに分類されている。

実験結果

リサーチクエスチョン

  • RQ1ニューラルモデルは、与えられたインストゥルメンタル音声クリップと感情的に整合性のある歌詞を生成できるか?
  • RQ2スペクトログラムから学習した連続的な潜在表現が、スタイル的および感情的に整合する歌詞の生成を実現するテキスト生成モデルを効果的に条件づけられるか?
  • RQ3生成された歌詞は、感情カテゴリ内(例:『落ち着いた』対『激しい』)で、カテゴリ間と比較して語彙的類似性が高いか?
  • RQ4人間評価者は、生成された歌詞と条件付けられた音声クリップとの間の感情的整合性をどの程度正確に検出できるか?

主な発見

  • 人間評価により、入力音声と整合する歌詞を生成できていることが実証され、正しい音声-歌詞ペairの特定精度が78.3%に達した。
  • 『落ち着いた』音声クリップから生成された歌詞同士は、平均RBOスコアが0.45と高く、『激しい』クリップからの歌詞と比較して語彙的類似性が高かった。
  • 『激しい』クリップから生成された歌詞同士の平均RBOスコアは0.32と低く、訓練データに存在するより多様な音楽的特徴の影響により、語彙的多様性が高まっていると考えられる。
  • KLダイバージェンス解析により、『落ち着いた』と『激しい』カテゴリ間で生成歌詞の語彙分布に有意な差が確認され、統計的に有意なデシベル差(p < 0.05)が得られた。
  • スペクトログラム-VAEの連続的な潜在空間は、歌詞のスタイルと感情に影響を与える音楽的特徴を効果的に符号化しており、テキスト-VAEの意味的な条件づけを可能にした。
  • 本モデルは、音声から得られる連続的な埋め込み表現を用いてテキスト生成を条件づけることが可能であることを示し、従来の離散的テキストベースのスタイル埋め込みに依存する先行研究を拡張した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。