Skip to main content
QUICK REVIEW

[论文解读] Generation of lyrics lines conditioned on music audio clips

Olga Vechtomova, Gaurav Sahu|arXiv (Cornell University)|Sep 30, 2020
Music and Audio Processing参考文献 14被引用 4
一句话总结

本文提出了一种双模态变分自编码器模型,能够根据乐器音乐音频片段生成情感一致的歌词。通过从频谱图中学习连续潜在表征,并利用这些表征来条件化文本变分自编码器,该系统生成的歌词与输入音频的情感基调保持一致,经自动指标和人工评估验证,音频-歌词一致性检测准确率达到78.3%。

ABSTRACT

We present a system for generating novel lyrics lines conditioned on music audio. A bimodal neural network model learns to generate lines conditioned on any given short audio clip. The model consists of a spectrogram variational autoencoder (VAE) and a text VAE. Both automatic and human evaluations demonstrate effectiveness of our model in generating lines that have an emotional impact matching a given audio clip. The system is intended to serve as a creativity tool for songwriters.

研究动机与目标

  • 开发一种创意工具,基于乐器音频片段为词曲作者生成新颖且情感共鸣的歌词片段。
  • 解决现有文本生成模型未基于音乐音频进行条件化的问题,而音乐音频在情感影响中起着关键作用。
  • 探究从频谱图-VAE学习到的连续潜在变量是否能有效条件化文本-VAE,以实现风格一致的生成。
  • 评估模型生成与多样化乐器音乐片段情感基调相符歌词的能力。

提出的方法

  • 频谱图-VAE通过将MEL频谱图编码到潜在空间,学习10秒乐器音频片段的连续潜在表征。
  • 文本-VAE解码器基于频谱图-VAE的潜在向量进行条件化,从而生成与音频情感和风格特征一致的歌词。
  • 模型在VAE的编码器和解码器网络中均使用LSTM,并结合重构损失与KL散度正则化。
  • 使用词级别KL散度和秩偏重叠(RBO)来衡量生成歌词之间的词汇相似性,评估情感类别内部的一致性。
  • 人工评估包括参与者判断哪一组歌词(来自相同或相反情感类别的歌词)与给定的乐器片段匹配。
  • 系统在来自《Ghosts I-IV》专辑的乐器片段数据集上进行训练,数据集被划分为“平静”和“强烈”两类情感。

实验结果

研究问题

  • RQ1神经模型能否生成与给定乐器音乐音频片段情感一致的歌词?
  • RQ2从频谱图中学习到的连续潜在表征是否能有效条件化文本生成模型,以生成风格与情感一致的歌词?
  • RQ3生成的歌词在情感类别内部(如“平静”与“强烈”)是否表现出更高的词汇相似性,而非跨类别?
  • RQ4人类评估者在多大程度上能够识别出生成歌词与条件音频片段之间的情感一致性?

主要发现

  • 模型成功生成与输入音频情感一致的歌词,人工评估显示在识别正确音频-歌词配对方面达到78.3%的准确率。
  • 由“平静”音乐片段生成的歌词彼此之间表现出更高的RBO得分(平均RBO = 0.45),高于与“强烈”片段生成歌词的相似度,表明在平静类别内部具有更高的词汇一致性。
  • 由“强烈”片段生成的歌词彼此之间的RBO值较低(平均RBO = 0.32),表明词汇多样性更高,可能由于训练数据中音乐特征更为多变。
  • KL散度分析证实,“平静”与“强烈”类别生成歌词的词分布存在显著差异,且在分贝值上具有统计学意义的差异(p < 0.05)。
  • 频谱图-VAE的连续潜在空间有效编码了影响歌词风格与情感的音乐特征,从而实现了对文本-VAE的有效条件化。
  • 该模型表明,基于音频的连续嵌入可用于条件化文本生成,拓展了以往依赖离散文本风格嵌入的研究工作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。