[论文解读] Acoustic Modeling for Automatic Lyrics-to-Audio Alignment
本文提出一种双管齐下的方法,以提升多声部音乐中歌词与音频的自动对齐效果:(1)将语音和音乐感知特征与传统的MFCC结合,以增强对背景音乐的鲁棒性;(2)利用少量领域内多声部数据微调大规模单人演唱声学模型,以缓解领域差异问题。该方法在Mauch-poly数据集上实现了1.93秒的平均对齐误差,优于除一个数据密集型端到端模型外的所有先前系统。
Automatic lyrics to polyphonic audio alignment is a challenging task not only because the vocals are corrupted by background music, but also there is a lack of annotated polyphonic corpus for effective acoustic modeling. In this work, we propose (1) using additional speech and music-informed features and (2) adapting the acoustic models trained on a large amount of solo singing vocals towards polyphonic music using a small amount of in-domain data. Incorporating additional information such as voicing and auditory features together with conventional acoustic features aims to bring robustness against the increased spectro-temporal variations in singing vocals. By adapting the acoustic model using a small amount of polyphonic audio data, we reduce the domain mismatch between training and testing data. We perform several alignment experiments and present an in-depth alignment error analysis on acoustic features, and model adaptation techniques. The results demonstrate that the proposed strategy provides a significant error reduction of word boundary alignment over comparable existing systems, especially on more challenging polyphonic data with long-duration musical interludes.
研究动机与目标
- 为解决多声部音乐中自动歌词与音频对齐的挑战,其中背景音乐会干扰人声,且单人演唱模型因领域差异而失效。
- 探究融合语音与音乐感知特征是否能提升对频谱-时序变化及背景干扰的鲁棒性。
- 评估利用少量多声部数据微调预训练单人演唱声学模型的有效性,以弥合领域差距。
- 通过结合知识驱动特征与数据驱动微调,提供一种低资源的歌词与音频对齐解决方案,避免对大规模多声部数据集的依赖。
提出的方法
- 该方法将传统MFCC与额外的语音和音乐感知特征(如音节特征、听觉特征及与音高相关的特征)结合,以更好地捕捉在多声部干扰下的人声音色特征。
- 采用最大后验概率(MAP)或最大似然线性回归(MLLR)进行模型微调,将预训练的DNN-HMM声学模型在少量领域内多声部数据上进行适应。
- 该微调过程减少了单人演唱训练数据与多声部测试数据之间的领域差异,提升了模型在真实音乐场景下的泛化能力。
- 系统在两个基准数据集(Hansen-poly和Mauch-poly)上进行评估,分别在有无语音提取的条件下进行,以隔离预处理和领域偏移的影响。
- 声学模型通过强制对齐(使用词典和语言模型)进行训练与评估,并分析词边界错误以衡量对齐精度。
- 将该方法与现有系统(包括端到端模型)进行对比,以证明在低资源设置下的性能提升。
实验结果
研究问题
- RQ1与仅使用标准MFCC相比,融合语音和音乐感知特征是否能显著提升多声部音乐中的对齐鲁棒性?
- RQ2利用少量多声部数据微调单人演唱声学模型,是否能显著降低多声部测试集上的对齐误差?
- RQ3在包含长音乐间奏的多声部数据集(如Mauch-poly)上,内容感知特征与模型微调的性能表现如何?
- RQ4直接在多声部数据上应用领域自适应,是否比在分离的人声上进行更有效?
- RQ5在减少词边界对齐错误方面,特征工程与模型微调的相对贡献分别是什么?
主要发现
- 所提方法在Mauch-poly数据集上实现了1.93秒的平均对齐误差,是MIREX挑战中所有报告系统中最佳的结果,仅低于一个数据密集型端到端模型。
- 与仅使用MFCC相比,引入语音和音乐感知特征显著降低了平均对齐误差,证明了其在背景音乐干扰下的鲁棒性。
- 利用少量多声部数据进行模型微调,显著优于未微调的单人演唱模型,尤其在包含长间奏的挑战性数据集上表现突出。
- 表现最佳的系统(C6)在长音乐间奏附近显著减少了边界错误,表明其对静音或非人声段落的处理能力更强。
- 最佳系统在所有边界上的中位对齐误差低于180毫秒,表明其在对齐任务的大部分区域均具备高精度。
- 特征工程带来的性能增益超过仅依赖模型微调的效果,且两者结合可获得最佳结果,尤其在Mauch-poly数据集上表现显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。