[论文解读] Audio-to-score alignment of piano music using RNN-based automatic music transcription
本文提出了一种用于钢琴音乐的音频到乐谱对齐框架,利用基于RNN的自动音乐转录(AMT)生成学习到的MIDI级特征——具体为88个音符的存在性与音高集(chroma)起音预测——从而实现精确的动态时间规整(DTW)对齐。该方法在MAPS数据集上实现了小于10 ms的平均起音误差,显著优于先前方法,通过结合帧级音符检测与时间上精确的起音特征,实现了更高的对齐精度。
We propose a framework for audio-to-score alignment on piano performance that employs automatic music transcription (AMT) using neural networks. Even though the AMT result may contain some errors, the note prediction output can be regarded as a learned feature representation that is directly comparable to MIDI note or chroma representation. To this end, we employ two recurrent neural networks that work as the AMT-based feature extractors to the alignment algorithm. One predicts the presence of 88 notes or 12 chroma in frame-level and the other detects note onsets in 12 chroma. We combine the two types of learned features for the audio-to-score alignment. For comparability, we apply dynamic time warping as an alignment algorithm without any additional post-processing. We evaluate the proposed framework on the MAPS dataset and compare it to previous work. The result shows that the alignment framework with the learned features significantly improves the accuracy, achieving less than 10 ms in mean onset error.
研究动机与目标
- 通过利用基于神经网络的自动音乐转录(AMT)作为特征提取方法,提升钢琴音乐音频到乐谱对齐的准确性。
- 解决手工设计音频特征的局限性,这些特征设计耗时且在时间精度上表现不佳。
- 探究AMT生成的特征——特别是MIDI或音高集空间中的音符存在性与起音检测——是否能在对齐任务中优于传统音频特征。
- 评估音高集起音特征在提升对齐精度方面的贡献,尤其是在高时间分辨率下的表现。
提出的方法
- 训练两个基于双向LSTM的AMT系统:一个用于每帧预测88个音符或12个音高集的存在性,另一个用于在音高集空间中检测音符起音。
- 输入特征为多分辨率谱图,经对数压缩与半音滤波的幅度谱处理,并通过一阶差分增强以提升转录性能。
- 系统采用Böck和Schedl的最先进AMT模型的改进版本,专为二值MIDI输出与起音检测而调整。
- 将两个AMT系统生成的学习特征进行拼接,并作为输入用于动态时间规整(DTW)以实现与乐谱MIDI的对齐。
- 对齐过程不使用后处理,确保与先前工作的直接比较。
- 音高集起音特征受DLNCO启发,具有衰减特性且局部自适应,增强了起音帧的显著性。
实验结果
研究问题
- RQ1基于RNN的AMT系统能否为钢琴音乐的音频到乐谱对齐生成有效且可学习的特征表示?
- RQ2将帧级音符存在性与音高集起音检测结合,是否能提升对齐精度,相比仅使用音符存在性?
- RQ3引入学习到的起音特征如何影响对齐的时间精度,特别是在子50ms阈值下的表现?
- RQ4与STFT或音高集等手工设计特征相比,所提出的基于AMT的特征在泛化能力上表现如何?
主要发现
- 所提出的框架在平均起音误差上低于10 ms,显著优于先前方法。
- 在0 ms误差阈值(10 ms分辨率)下,52.55%的起音被精确对齐,提升至10 ms阈值时达到91.60%。
- 88音符模型结合音高集起音特征后,中位起音误差从18.69 ms降低至5.57 ms,凸显了起音特征的关键作用。
- 尽管在音频到MIDI比较中略有劣势,该框架在高分辨率区域(<50 ms)仍显著优于Ewert的手工设计特征方法。
- 12音高集版本的框架精度略低于88音符版本,表明音符级分辨率在对齐任务中更具优势。
- 真实录音成功完成对齐,音色再现结果证实了同步质量,表明该方法具备实际应用潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。