Skip to main content
QUICK REVIEW

[论文解读] Deep Watershed Detector for Music Object Recognition

Lukas Tuggener, Ismail Elezi|arXiv (Cornell University)|May 26, 2018
Music and Audio Processing参考文献 25被引用 14
一句话总结

本文提出了一种名为 Deep Watershed Detector (DWD) 的新型端到端目标检测方法,用于音乐记号识别。该方法利用深度学习生成用于分水岭变换的合成能量图,从而在高分辨率页面中实现对微小音乐符号的高精度检测。DWD 在数字和手写音乐数据集上均实现了最先进性能,且仅需极少预处理,无需类别不平衡校正。

ABSTRACT

Optical Music Recognition (OMR) is an important and challenging area within music information retrieval, the accurate detection of music symbols in digital images is a core functionality of any OMR pipeline. In this paper, we introduce a novel object detection method, based on synthetic energy maps and the watershed transform, called Deep Watershed Detector (DWD). Our method is specifically tailored to deal with high resolution images that contain a large number of very small objects and is therefore able to process full pages of written music. We present state-of-the-art detection results of common music symbols and show DWD's ability to work with synthetic scores equally well as on handwritten music.

研究动机与目标

  • 解决在高分辨率乐谱中检测大量微小、密集排列的音乐符号的挑战。
  • 克服传统基于规则的 OMR 流水线的局限性,后者依赖手工设计的预处理流程,在复杂或手写乐谱上表现不佳。
  • 开发一种端到端的深度学习方法,实现对上下文中的音乐符号检测,减少误差传播,并提升在不同类型音乐上的泛化能力。
  • 在不重新训练或修改架构的前提下,评估模型在数字乐谱和手写乐谱上的鲁棒性。
  • 研究严重类别不平衡对检测性能的影响,并探索稀有符号识别的解决方案。

提出的方法

  • 该方法使用卷积神经网络预测每个像素的类别图和对应的能量图,用于分水岭变换。
  • 能量图通过可微分的分水岭层端到端学习,使反向传播能够穿过分割过程。
  • 将分水岭变换应用于能量图以生成目标建议区域,每个连通分量对应一个检测到的符号。
  • 网络通过组合损失函数进行训练,该损失函数包含类别图的分类损失和能量图的边界损失正则化。
  • 输入图像通过行间归一化进行标准化,但其余处理均以整页形式进行,不进行裁剪或分块。
  • 该架构在 DeepScores(数字)和 MUSCIMA++(手写)数据集之间共享,实现了领域泛化。

实验结果

研究问题

  • RQ1基于深度学习的方法是否能通过在整页图像上端到端运行,消除 OMR 中对复杂手工设计预处理流水线的依赖?
  • RQ2基于分水岭的检测器若在合成能量图上进行训练,是否能在印刷体和手写体音乐记号上均实现最先进性能?
  • RQ3音乐符号数据集中严重的类别不平衡如何影响检测性能,特别是对稀有符号的影响?
  • RQ4即使仅训练预测目标中心,模型是否仍能学习到有意义的音乐记号上下文表征?
  • RQ5DWD 方法是否能泛化到音乐识别之外的其他高分辨率小目标检测任务?

主要发现

  • DWD 在 DeepScores(数字渲染)和 MUSCIMA++(手写)数据集上均实现了最先进检测性能,且无需任何数据增强或类别平衡处理。
  • 模型对谱线的检测精度极高(AP@1/4),表明其对音乐记号中结构元素的学习能力很强。
  • 尽管未进行类别平衡,模型对常见符号(如符头)仍保持高平均精度,但对稀有符号的性能显著下降。
  • 训练过程中模型表现出对稀有符号的遗忘倾向,表现为在训练后期遇到稀有符号时损失持续上升,表明这些符号被视为异常值。
  • 尽管仅监督中心点,网络仍学习到一种原始的分割掩码,如类别图预测中表现出的连贯的音符束分割。
  • 与以往基于 R-CNN 的方法相比,该方法在端到端效率方面表现更优,并避免了多阶段流水线中的误差传播。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。