Skip to main content
QUICK REVIEW

[论文解读] Exploiting Synchronized Lyrics And Vocal Features For Music Emotion Detection

Loreto Parisi, Simone Francia|arXiv (Cornell University)|Jan 15, 2019
Music and Audio Processing被引用 6
一句话总结

本文介绍了同步歌词情感数据集,并提出一种新颖的音乐情感识别方法,通过利用时间对齐的歌词与人声特征。采用Wave-U-Net进行人声分离,并在文本与音频上比较深度学习模型,研究发现仅使用人声轨道可使基于音频的情感分类准确率提升4个百分点;而使用fastText嵌入的双线性LSTM在基于歌词的分类中表现优于卷积神经网络(CNN)。

ABSTRACT

One of the key points in music recommendation is authoring engaging playlists according to sentiment and emotions. While previous works were mostly based on audio for music discovery and playlists generation, we take advantage of our synchronized lyrics dataset to combine text representations and music features in a novel way; we therefore introduce the Synchronized Lyrics Emotion Dataset. Unlike other approaches that randomly exploited the audio samples and the whole text, our data is split according to the temporal information provided by the synchronization between lyrics and audio. This work shows a comparison between text-based and audio-based deep learning classification models using different techniques from Natural Language Processing and Music Information Retrieval domains. From the experiments on audio we conclude that using vocals only, instead of the whole audio data improves the overall performances of the audio classifier. In the lyrics experiments we exploit the state-of-the-art word representations applied to the main Deep Learning architectures available in literature. In our benchmarks the results show how the Bilinear LSTM classifier with Attention based on fastText word embedding performs better than the CNN applied on audio.

研究动机与目标

  • 开发一个新数据集,将歌词与对应音频片段同步,以提升音乐情感识别效果。
  • 探究结合歌词与人声特征是否能提升情感分类性能,超越单独使用音频或文本的效果。
  • 评估仅使用人声轨道与使用完整音频混音在情感分类性能上的影响。
  • 比较不同词嵌入技术与深度学习架构在基于歌词的情感分类中的表现。
  • 探索上下文嵌入(如BERT和ELMo)在音乐情感识别背景下的有效性。

提出的方法

  • 通过将歌词片段与其对应的音频时间戳对齐,并分配情感标签,构建了同步歌词情感数据集。
  • 应用Wave-U-Net将人声从混音音频中分离,从而实现仅人声输入的分类。
  • 在来自混音音频和分离人声轨道的梅尔频谱图上训练CNN,用于基于音频的情感分类。
  • 结合多种词嵌入技术(fastText、ELMo、BERT)与深度学习模型(LSTM、BiLSTM、CNN),用于基于歌词的情感分类。
  • 在训练过程中使用样本权重,以缓解情感标签分布中的类别不平衡问题。
  • 使用精确率、召回率和F1分数评估模型性能,并通过混淆矩阵分析各类别的表现。

实验结果

研究问题

  • RQ1与使用完整音频混音相比,仅使用人声轨道是否能提升音乐情感分类性能?
  • RQ2在基于歌词的情感分类中,哪种词嵌入技术(fastText、ELMo、BERT)表现最佳?
  • RQ3在从歌词中分类情感时,不同深度学习架构(LSTM、CNN、双线性LSTM)的表现如何比较?
  • RQ4上下文嵌入(如BERT)能否有效应用于音乐歌词以实现情感识别,还是在此任务中表现不佳?
  • RQ5歌词与音频之间的同步如何提升情感识别模型的时间对齐效果与整体性能?

主要发现

  • 将仅人声轨道作为CNN的输入,使整体F1分数从混音音频的32%提升至人声仅有的36%,表明性能有显著提升。
  • 使用fastText词嵌入的双线性LSTM分类器在所有基于歌词的模型中取得最高F1分数,优于CNN。
  • 在所有情感类别中,悲伤类别的精确率、召回率和F1分数最高,F1分数在混音音频实验中达到41.12%,在人声仅实验中达到42.12%。
  • 与fastText和ELMo相比,基于BERT的模型表现较差,表明上下文嵌入可能尚未适用于此特定的音乐情感分类任务。
  • 混淆矩阵显示,愤怒和恐惧是最常被误分类的情感,尤其在混音音频设置中,其精确率和召回率较低。
  • 该数据集存在显著的类别不平衡问题,悲伤出现在43.9%的样本中,而厌恶仅占2.1%,因此后者被排除在训练之外。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。