[论文解读] Multiple F0 Estimation in Vocal Ensembles using Convolutional Neural Networks
本文提出一种基于卷积神经网络(CNN)的方法,用于在无伴奏合唱团中进行多基频(F0)估计,采用包含幅度和相位信息的谐波常数Q变换(HCQT)特征。该模型在多F0估计任务中优于当前最先进方法,尤其在高音高分辨率(20音分)条件下表现出色,对混响和同度演唱具有强鲁棒性。
This paper addresses the extraction of multiple F0 values from polyphonic and a cappella vocal performances using convolutional neural networks (CNNs). We address the major challenges of ensemble singing, i.e., all melodic sources are vocals and singers sing in harmony. We build upon an existing architecture to produce a pitch salience function of the input signal, where the harmonic constant-Q transform (HCQT) and its associated phase differentials are used as an input representation. The pitch salience function is subsequently thresholded to obtain a multiple F0 estimation output. For training, we build a dataset that comprises several multi-track datasets of vocal quartets with F0 annotations. This work proposes and evaluates a set of CNNs for this task in diverse scenarios and data configurations, including recordings with additional reverb. Our models outperform a state-of-the-art method intended for the same music genre when evaluated with an increased F0 resolution, as well as a general-purpose method for multi-F0 estimation. We conclude with a discussion on future research directions.
研究动机与目标
- 解决在多声部及无伴奏合唱团中进行多F0估计的挑战,其中所有声源均为音色和谐波成分相似的人声。
- 克服现有方法依赖孤立人声录音或乐谱同步的局限性,这些方法在真实录音中不切实际。
- 开发一种深度学习模型,使其在包括混响和同度演唱在内的多样化录音条件下具备良好泛化能力。
- 通过在输入表示中引入相位差分,提升估计精度。
- 构建一个大规模、高质量的四人合唱团录音数据集,并附带F0标注,以支持模型训练与评估。
提出的方法
- 使用谐波常数Q变换(HCQT)及其相位差分作为输入特征,以捕捉谐波结构与时间动态特性。
- 设计一种CNN架构,处理HCQT表示并输出音高显著性函数,突出显示可能的F0候选值。
- 对显著性图应用阈值化与峰值检测,从输出中提取离散的F0值。
- 在从多轨录音中提取的自定义四人合唱团数据集上训练模型,通过音高移位和混响增强数据。
- 实验不同融合策略,以结合幅度与相位信息,提升F0估计精度。
- 通过验证集优化模型,确定峰值检测的最佳阈值,确保在多样化条件下的鲁棒性。
实验结果
研究问题
- RQ1深度学习模型能否仅使用混合音频,在无孤立人声录音的情况下,有效估计无伴奏合唱团中的多个F0值?
- RQ2在输入表示中引入相位信息如何影响F0估计精度,尤其是在高分辨率条件下?
- RQ3在混响信号上进行训练在多大程度上能提升模型对真实世界高混响录音条件的泛化能力?
- RQ4在不同音高容差下,该模型与当前最先进方法在F0估计性能上的对比如何?
- RQ5该模型能否泛化到未见过的录音条件,如同度演唱和高混响环境,这些在合唱音乐中十分常见?
主要发现
- 在100音分和20音分音高容差下,该模型在相同音乐类型(巴bershop四重唱)中均优于当前最先进方法,且在20音分条件下性能下降幅度显著更小(仅-2% F-Score,而基线方法分别为-17%和-26%)。
- 在输入表示中引入相位差分可提升F0估计精度,表现为在高分辨率(20音分)下性能优于仅使用幅度的基线方法。
- 在干信号与混响信号混合数据上训练的模型,在高混响测试样本上平均F-Score较仅在干信号上训练的模型提升10%。
- 在包含高混响和每声部多名歌手的小型、具有挑战性的合唱数据集上评估时,该模型平均F-Score达0.704,优于基线方法的0.653。
- 该模型对同度演唱表现出强鲁棒性,即使多个人声演唱同一音高,仍能保持高性能。
- 对F0轨迹进行后处理可提升时间连续性,表明未来工作应包含此类优化步骤以获得更高质量输出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。