[论文解读] Towards Score Following In Sheet Music Images.
该论文提出了一种端到端的深度学习模型,可直接将音频片段匹配到乐谱图像中的对应像素位置,绕过符号记谱表示。通过在配对的乐谱图像和频谱图上进行训练的多模态卷积神经网络,该系统在桶宽度范围内实现了71.72%的定位准确率,证明了在单声部钢琴音乐中直接实现音频到乐谱图像对齐的可行性。
This paper addresses the matching of short music audio snippets to the corresponding pixel location in images of sheet music. A system is presented that simultaneously learns to read notes, listens to music and matches the currently played music to its corresponding notes in the sheet. It consists of an end-to-end multi-modal convolutional neural network that takes as input images of sheet music and spectrograms of the respective audio snippets. It learns to predict, for a given unseen audio snippet (covering approximately one bar of music), the corresponding position in the respective score line. Our results suggest that with the use of (deep) neural networks -- which have proven to be powerful image processing models -- working with sheet music becomes feasible and a promising future research direction.
研究动机与目标
- 通过直接从乐谱图像和音频频谱图学习,消除在音频到记谱对齐中对符号记谱表示(如MusicXML、MIDI)的需求。
- 开发一种能够同时读谱、听音乐并预测乐谱图像中对应像素位置的系统。
- 通过在原始图像和音频输入上训练多模态神经网络,实现无需人工特征工程的端到端学习。
- 在低资源、单声部、单谱号设置下,建立直接音频到乐谱图像匹配的可行性概念验证。
提出的方法
- 该模型使用一个多模态卷积神经网络,输入为乐谱图像(40×390像素)和1.2秒音频片段的频谱图(40×136帧)。
- 网络执行桶分类,将谱号的x轴划分为离散的桶(buckets),并对每个音频片段预测这些桶上的概率分布。
- 通过从真实像素坐标导出的软目标向量进行训练,使相邻桶之间的插值更加平滑。
- 计算显著性图以可视化注意力机制,结果显示网络聚焦于音符头和符干特征,从而实现精准定位。
- 系统在目标音符击键前使用固定的1.2秒时间上下文,以提供足够的音频上下文用于对齐。
- 在推理阶段,模型可直接预测给定音频片段和乐谱图像的估计像素位置 $\hat{x}_j$,无需解析符号记谱。
实验结果
研究问题
- RQ1深度神经网络是否能够在不依赖符号记谱表示的情况下,直接从乐谱图像中学习将音频片段对齐到像素位置?
- RQ2在图像和频谱图输入上训练的多模态网络,能否准确预测单谱号上的正确音符位置?
- RQ3与直接回归相比,使用软目标和桶分类是否能提高定位准确率?
- RQ4该模型能否泛化到训练过程中未见过的真实演奏场景,例如钢琴曲的现场录音?
主要发现
- 在巴赫《G大调小步舞曲》的真实录音中,模型实现了0.0402的归一化像素距离,表明定位准确率很高。
- 71.72%的预测音符位置位于真实位置一个桶宽度范围内,表明在未见音频上表现稳健。
- 显著性图证实,网络关注于音符头和符干样式等相关视觉特征,表明其有效学习了关键特征。
- 使用软目标使桶之间的插值更加平滑,相比硬回归显著提升了定位精度。
- 系统在经历1.2秒预热期后,成功实现了在连续音频流上的在线乐谱跟踪,验证了其在实时应用中的潜力。
- 该方法在单声部、单谱号钢琴音乐中具有可行性,并有望作为未来处理复杂多谱号乐谱系统的基石。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。