Skip to main content
QUICK REVIEW

[论文解读] Content based singing voice source separation via strong conditioning using aligned phonemes

Gabriel Meseguer-Brocal, Geoffroy Peeters|arXiv (Cornell University)|Aug 5, 2020
Speech and Audio Processing参考文献 41被引用 6
一句话总结

本文提出了一种新型的多模态多音轨数据集,其中歌词与音素在时间上对齐,并提出了一种基于U-Net的歌唱语音源分离模型,通过使用音素嵌入进行强条件控制,显著提升了分离性能。通过在帧级语音信息上条件化特征逐帧线性调制(FiLM)层,该模型取得了当前最优的结果,其中最简单的强条件控制设置在性能上优于弱条件控制和更复杂的配置。

ABSTRACT

Informed source separation has recently gained renewed interest with the introduction of neural networks and the availability of large multitrack datasets containing both the mixture and the separated sources. These approaches use prior information about the target source to improve separation. Historically, Music Information Retrieval researchers have focused primarily on score-informed source separation, but more recent approaches explore lyrics-informed source separation. However, because of the lack of multitrack datasets with time-aligned lyrics, models use weak conditioning with non-aligned lyrics. In this paper, we present a multimodal multitrack dataset with lyrics aligned in time at the word level with phonetic information as well as explore strong conditioning using the aligned phonemes. Our model follows a U-Net architecture and takes as input both the magnitude spectrogram of a musical mixture and a matrix with aligned phonetic information. The phoneme matrix is embedded to obtain the parameters that control Feature-wise Linear Modulation (FiLM) layers. These layers condition the U-Net feature maps to adapt the separation process to the presence of different phonemes via affine transformations. We show that phoneme conditioning can be successfully applied to improve singing voice source separation.

研究动机与目标

  • 解决当前缺乏用于歌唱语音源分离的、在时间上对齐歌词与音素的多音轨数据集的问题。
  • 探索使用帧级对齐的音素进行强条件控制,以在性能上超越使用非对齐文本的弱条件控制。
  • 评估在数据驱动的深度学习框架中,基于音素的条件控制在源分离任务中的有效性。
  • 探究在该任务中,简单且参数高效的条件控制机制是否优于复杂的条件控制机制。

提出的方法

  • 模型采用U-Net架构,并通过特征逐帧线性调制(FiLM)层,将特征图基于语音信息进行条件化。
  • 音素激活被嵌入为控制FiLM层仿射变换的gamma和beta参数。
  • 输入包括混合信号的幅度谱图以及在词级别对齐的音素矩阵。
  • 音素矩阵通过使用预训练的自动语音识别(ASR)系统进行强制对齐获得,确保帧级对应关系。
  • 模型通过最小化预测输出与目标语音源之间的差异来训练,使用标准损失函数。
  • 评估了不同的条件控制配置,包括强条件控制与弱条件控制,以及基张量的不同参数化方式。

实验结果

研究问题

  • RQ1与使用非对齐歌词的弱条件控制相比,使用时间对齐音素的强条件控制是否能显著提升歌唱语音源分离性能?
  • RQ2是否简单的、低参数量的条件控制机制(如全局变换)优于更复杂的、高参数量的条件控制机制?
  • RQ3在静音或复杂人声帧中,基于音素级别的条件控制如何影响模型从背景乐器中分离人声的能力?
  • RQ4标注错误以及词语内部音素共现现象在多大程度上会阻碍强条件控制模型的性能?

主要发现

  • 与基线U-Net和弱条件控制基线相比,所提出的基于帧级音素嵌入的强条件控制显著提升了SDR、SIR和PES指标。
  • 最简单的强条件控制设置S_s在所有配置中表现最佳,甚至优于参数量超过190万的复杂配置。
  • 仅包含480个可学习参数的模型(S_s)在性能上优于包含197万参数的模型(S_a),表明更简单的条件控制具有更好的泛化能力。
  • 模型在减少算法伪影(SAR)方面表现不够一致,表明伪影更多依赖于训练数据质量,而非条件控制机制本身。
  • 在最佳模型(S_s)中,SDR、SIR和SAR的分布向更高值偏移,表明在数据集上具有更鲁棒和准确的分离性能。
  • 弱条件控制模型的性能在不同参数量下表现相似,表明通道级控制效果不如全局音素基条件控制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。