[论文解读] Audio-to-Score Alignment using Transposition-invariant Features
本文提出了一种通过无监督门控自编码器学习的转置不变音频特征,以改善古典音乐中的音频-乐谱对齐。这些基于局部音程的特征在未转置数据上达到最先进性能,在转置设置下优于色度特征,展现出完全的转置不变性,并对乐曲内多重转置具有鲁棒性。
Audio-to-score alignment is an important pre-processing step for in-depth analysis of classical music. In this paper, we apply novel transposition-invariant audio features to this task. These low-dimensional features represent local pitch intervals and are learned in an unsupervised fashion by a gated autoencoder. Our results show that the proposed features are indeed fully transposition-invariant and enable accurate alignments between transposed scores and performances. Furthermore, they can even outperform widely used features for audio-to-score alignment on `untransposed data', and thus are a viable and more flexible alternative to well-established features for music alignment and matching.
研究动机与目标
- 为解决当前方法在转置乐谱中音频-乐谱对齐时因音高敏感性而面临的挑战。
- 开发一种新型的、完全转置不变的特征表示,以在音高转置下保持对齐准确性。
- 在钢琴和管弦乐音乐设置下,评估所提特征与现有色度特征的性能。
- 研究转置不变特征的局限性,特别是其在复杂音乐段落中对速度变化的敏感性。
- 探索特征在不同乐器类型和音乐体裁间的泛化能力。
提出的方法
- 该方法采用门控自编码器(GAE)从原始音频中学习转置不变特征,通过建模局部上下文(n帧)与目标帧之间的音程差异。
- GAE架构在第一层使用逐元素乘积,显式建模输入帧与目标帧之间的协方差和关系结构,使音程在潜在空间中编码。
- 特征作为GAE学习到的潜在表示(映射码)提取,由于音程的相对编码,对全局音高偏移保持不变。
- 使用动态时间规整(DTW)在学习到的特征上执行音频-音频对齐,将乐谱音频(由MIDI合成)与演奏音频对齐。
- 模型在音频数据上以无监督方式训练,无需转置标签或人工标注。
- 评估了两种变体:8G Piano(在钢琴录音上训练)和8G Orch(在管弦乐录音上训练),并与两种数据集上的色度特征进行比较。
实验结果
研究问题
- RQ1通过门控自编码器学习的转置不变特征能否在转置乐谱中实现准确的音频-乐谱对齐?
- RQ2在未转置和转置数据上,这些特征与色度特征相比在对齐准确性上表现如何?
- RQ3这些特征在单首乐曲内处理多重转置的能力有多强?
- RQ4在具有可变速度和音色多样性的复杂管弦乐音乐中,这些特征表现如何?
- RQ5这些特征能否在不同乐器类型间泛化,例如从钢琴到管弦乐录音?
主要发现
- 所提出的转置不变特征在未转置的钢琴数据上实现了90%的对齐准确率(误差≤250ms),优于该设置下的色度特征。
- 在转置乐谱中,这些特征保持高准确率(误差≤250ms时为84%),对多重转置具有鲁棒性,而色度特征需为每次转置重新处理。
- 特征对音高转置完全不变,评估中所有转置等级下性能一致,证明了这一点。
- 在管弦乐音乐中,由于特征对速度变化敏感,色度特征优于8G Piano和8G Orch特征,尤其在马勒第4号交响曲中表现更优。
- 尽管8G Piano模型在管弦乐音乐上训练,但其在管弦乐数据上的泛化能力优于8G Orch模型,表明特征在不同音色间具有强大泛化能力。
- 即使将特征模型过拟合至测试数据,性能提升也微乎其微,表明特征鲁棒且未对特定录音过拟合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。