[论文解读] An Empirical Evaluation of End-to-End Polyphonic Optical Music Recognition
本文提出了两种新颖的端到端神经解码架构——FlagDecoder 和 RNNDecoder——用于多声部光学音乐识别(OMR),采用共享的 CNN-BiLSTM 编码器。RNNDecoder 在从 MuseScore 衍生的大规模多声部数据集上实现了新的最先进符号错误率,优于先前方法在标准测试集和困难测试集上的表现。
Previous work has shown that neural architectures are able to perform optical music recognition (OMR) on monophonic and homophonic music with high accuracy. However, piano and orchestral scores frequently exhibit polyphonic passages, which add a second dimension to the task. Monophonic and homophonic music can be described as homorhythmic, or having a single musical rhythm. Polyphonic music, on the other hand, can be seen as having multiple rhythmic sequences, or voices, concurrently. We first introduce a workflow for creating large-scale polyphonic datasets suitable for end-to-end recognition from sheet music publicly available on the MuseScore forum. We then propose two novel formulations for end-to-end polyphonic OMR -- one treating the problem as a type of multi-task binary classification, and the other treating it as multi-sequence detection. Building upon the encoder-decoder architecture and an image encoder proposed in past work on end-to-end OMR, we propose two novel decoder models -- FlagDecoder and RNNDecoder -- that correspond to the two formulations. Finally, we compare the empirical performance of these end-to-end approaches to polyphonic OMR and observe a new state-of-the-art performance with our multi-sequence detection decoder, RNNDecoder.
研究动机与目标
- 解决缺乏大规模、公开可用的多声部 OMR 数据集以支持端到端训练的问题。
- 开发新颖的神经解码架构,有效建模多声部音乐记谱中的多个声部。
- 在新数据集上实证评估这些架构,并为端到端多声部 OMR 建立新的最先进性能。
- 提升在具有挑战性的多声部乐段(包括密集和弦与多声部)中的泛化能力和鲁棒性。
提出的方法
- 设计了一套数据收集工作流,从 MuseScore 论坛上公开的文件中提取并标注多声部乐谱,从而构建了 MuseScore 多声部数据集(MSPD)及其困难子集(MSPD-Hard)。
- 采用共享编码器——由卷积神经网络(CNN)后接双向长短期记忆网络(BiLSTM)组成——从 staff-line 图像中提取特征,确保所有模型具有统一的表示。
- FlagDecoder 将多声部 OMR 视为多任务二分类问题,通过基于旗标(flag-based)的符号表示,同时预测音高、谱号符号和节奏。
- RNNDecoder 采用垂直方向的 RNN 解码器,按列处理图像切片,使模型能够在单个水平位置预测多个符号,从而有效建模多声部特性。
- 两种解码器均使用交叉熵损失进行训练,RNNDecoder 对每个图像切片采用固定长度输出序列,以处理可变的多声部情况。
- 使用符号错误率(SER)对模型进行评估,分别计算音高和节奏的指标,涵盖完整测试集和困难测试集。
实验结果
研究问题
- RQ1能否从 MuseScore 等公开可用的乐谱资源中,有效构建大规模、可端到端训练的多声部 OMR 数据集?
- RQ2如 FlagDecoder 和 RNNDecoder 等新颖解码策略,在处理多声部音乐方面,与现有端到端 OMR 模型相比表现如何?
- RQ3RNNDecoder 的垂直序列建模方法是否相比基线模型和多任务方法,在密集多声部乐段中带来性能提升?
- RQ4所提出的模型在未在训练中见过的具有挑战性的高多声部示例中,泛化能力如何?
主要发现
- RNNDecoder 在完整测试集上实现了新的最先进符号错误率,优于基线模型和 FlagDecoder 模型。
- 在困难测试集(MSPD-Hard)上,RNNDecoder 展现出显著更强的鲁棒性,其错误率增加幅度远小于基线模型,后者错误率几乎翻倍。
- 所有模型中,音高 SER 均高于节奏 SER,表明音高识别更具挑战性,尤其因谱号和谱表位置的歧义性。
- 在定性分析中,RNNDecoder 正确处理了包含四声部的密集和弦,仅在复杂和弦进行中漏掉一个音符和一个升半音符号。
- FlagDecoder 在完整测试集上优于基线模型,但在困难测试集上改进有限,尤其在高多声部情况下的音高识别表现不佳。
- RNNDecoder 在高多声部示例(如四声部同时出现)中表现更优,而基线模型在这些情况下无法正确分离或识别音符。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。