Skip to main content
QUICK REVIEW

[论文解读] Learning a Joint Embedding Space of Monophonic and Mixed Music Signals for Singing Voice

Kyungyun Lee, Juhan Nam|arXiv (Cornell University)|Jun 26, 2019
Speech and Audio Processing参考文献 29被引用 8
一句话总结

本文提出一种联合嵌入模型,通过音乐混剪生成的合成数据集,采用度量学习方法,学习单音轨与混音音乐轨道之间的共享表征,以实现歌唱人声识别。该方法无需语音分离即可实现有效的跨域歌手检索,在域内和跨域任务中均表现优异,CROSS模型优于特定域的基线模型。

ABSTRACT

Previous approaches in singer identification have used one of monophonic vocal tracks or mixed tracks containing multiple instruments, leaving a semantic gap between these two domains of audio. In this paper, we present a system to learn a joint embedding space of monophonic and mixed tracks for singing voice. We use a metric learning method, which ensures that tracks from both domains of the same singer are mapped closer to each other than those of different singers. We train the system on a large synthetic dataset generated by music mashup to reflect real-world music recordings. Our approach opens up new possibilities for cross-domain tasks, e.g., given a monophonic track of a singer as a query, retrieving mixed tracks sung by the same singer from the database. Also, it requires no additional vocal enhancement steps such as source separation. We show the effectiveness of our system for singer identification and query-by-singer in both the same-domain and cross-domain tasks.

研究动机与目标

  • 解决歌唱语音分析中单音轨与混音音乐信号之间的语义鸿沟。
  • 实现在单音轨和混音音频域之间歌手相关信息的迁移。
  • 构建一个统一的嵌入空间,使同一歌手的音轨无论属于何种域都能被映射得彼此接近。
  • 通过直接在混音信号上进行训练,消除对源分离或语音增强的依赖。

提出的方法

  • 通过音乐混剪流程,将DAMP数据集中的单音轨人声轨道与musdb18中的背景音乐相结合,生成合成训练数据。
  • 采用孪生神经网络架构,学习度量嵌入,以最小化同歌手音轨间的距离,最大化不同歌手之间的距离。
  • 使用对比损失进行模型训练,以确保同一歌手的嵌入比不同歌手的嵌入更接近。
  • 使用梅尔频谱图作为输入特征,并应用t-SNE可视化学习到的嵌入空间。
  • 训练两种模型:MIXED(每个域分别学习嵌入)和CROSS(跨域共享嵌入空间)。
  • 通过平均音轨级嵌入构建歌手模型,未来可考虑使用高斯混合模型(GMM)或主成分分析(PCA)进行改进。

实验结果

研究问题

  • RQ1能否学习到一个统一的嵌入空间,使单音轨和混音音乐信号中的歌手身份信息得以捕捉?
  • RQ2在合成混剪数据集上进行度量学习,是否能实现有效的跨域歌手识别?
  • RQ3联合模型在域内和跨域任务中的性能与特定域模型相比如何?
  • RQ4该模型能否在不依赖语音源分离的情况下泛化到真实世界的混音录音?
  • RQ5背景音乐对歌手嵌入质量有何影响?模型在不同信噪比下的鲁棒性如何?

主要发现

  • CROSS模型在域内和跨域歌手识别任务中均表现优异,优于特定域的基线模型。
  • 联合嵌入空间成功地将同一歌手的单音轨和混音轨道映射得彼此接近,从而实现跨域检索。
  • t-SNE可视化结果证实,CROSS模型学习到了一个共享表征,使得同一歌手的音轨在不同域中形成聚类。
  • 该模型在真实世界混音录音上泛化良好,并在不同信噪比下保持鲁棒性。
  • 合成混剪数据集能够有效支持训练,无需人工标注或源分离。
  • 该方法消除了对语音增强或源分离的需求,简化了在真实应用场景中的部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。