Skip to main content
QUICK REVIEW

[论文解读] Emotion Embedding Spaces for Matching Music to Stories

Minz Won, Justin Salamon|arXiv (Cornell University)|Nov 26, 2021
Music and Audio Processing参考文献 50被引用 4
一句话总结

本文提出了一种跨模态文本到音乐检索框架,通过情绪嵌入空间弥合异质情绪词汇之间的差异,结合人工定义(效价-唤醒度)与数据驱动方法(Word2Vec、度量学习)。结果表明,数据驱动的度量学习——尤其是三分支模型——在性能上可与效价-唤醒度基线相媲美,同时保持情绪邻域结构,并实现对多样化情绪词汇的泛化能力。

ABSTRACT

Content creators often use music to enhance their stories, as it can be a powerful tool to convey emotion. In this paper, our goal is to help creators find music to match the emotion of their story. We focus on text-based stories that can be auralized (e.g., books), use multiple sentences as input queries, and automatically retrieve matching music. We formalize this task as a cross-modal text-to-music retrieval problem. Both the music and text domains have existing datasets with emotion labels, but mismatched emotion vocabularies prevent us from using mood or emotion annotations directly for matching. To address this challenge, we propose and investigate several emotion embedding spaces, both manually defined (e.g., valence/arousal) and data-driven (e.g., Word2Vec and metric learning) to bridge this gap. Our experiments show that by leveraging these embedding spaces, we are able to successfully bridge the gap between modalities to facilitate cross modal retrieval. We show that our method can leverage the well established valence-arousal space, but that it can also achieve our goal via data-driven embedding spaces. By leveraging data-driven embeddings, our approach has the potential of being generalized to other retrieval tasks that require broader or completely different vocabularies.

研究动机与目标

  • 为解决在跨模态中情绪词汇不匹配的情况下,基于共享情绪内容将音乐与文本匹配的挑战。
  • 将基于情绪的文本到音乐检索形式化为具有长文本输入的跨模态检索问题。
  • 评估并比较多种情绪嵌入空间策略——包括手工设计与数据驱动方法——以实现有效的跨模态对齐。
  • 开发一种方法,使其超越预定义的情绪空间,实现对多样化或新颖情绪词汇的应用。

提出的方法

  • 提出六种深度学习策略:分类、多头分类、效价-唤醒度回归、Word2Vec回归、两分支度量学习与三分支度量学习。
  • 使用预训练的文本编码器(如BERT类模型)与音频编码器(如梅尔频谱图上的CNN)将文本与音乐嵌入到共享的情绪空间中。
  • 采用UMAP对高维嵌入空间进行二维可视化,以分析结构特性(如邻域保持性)。
  • 应用三分支度量学习,联合嵌入文本、音乐与情绪标签,学习一个保持模态内情绪接近性的共享空间。
  • 在多个数据集(包括Alm的文本/情绪与AudioSet的音乐/情绪)上,使用P@5(前五名精确率)与mRR(平均倒数排名)作为评估指标。
  • 在音频情绪标注中应用迁移学习与焦点损失,以提升在情绪分布不平衡情况下的鲁棒性与性能。

实验结果

研究问题

  • RQ1能否有效学习到一个共享的情绪嵌入空间,以在情绪词汇不匹配的情况下实现跨模态文本到音乐的检索?
  • RQ2与人工定义的空间(如效价-唤醒度)相比,数据驱动的嵌入空间(如Word2Vec、度量学习)在检索性能与泛化能力方面表现如何?
  • RQ3三分支度量学习模型在保持各模态内部情绪邻域结构方面,相较于其他方法表现如何?
  • RQ4所提出的方法能否泛化至训练中未使用但更广泛或完全不同的情绪词汇的检索任务?

主要发现

  • 效价-唤醒度空间作为跨模态检索的强基线,能成功基于情绪维度对齐文本与音乐。
  • 三分支度量学习模型在检索性能上可与效价-唤醒度基线相媲美,同时学习到数据驱动且可泛化的嵌入空间。
  • 三分支模型保持了模态内的情绪邻域结构——语义相似的情绪在嵌入空间中聚集在一起,而单向或两分支模型则不具备此特性。
  • Word2Vec回归生成具有区分性的嵌入,但缺乏连续性;两分支度量学习因缺乏模态特定监督而无法保持结构关系。
  • 所提方法可超越预定义的情绪空间,实现对新或多样化情绪词汇的应用,而无需手动映射。
  • 定性分析表明,语义相似的情绪(如“吓人”与“恐惧”)在学习到的嵌入空间中空间上彼此接近,尤其在三分支度量学习模型中表现明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。