Skip to main content
QUICK REVIEW

[论文解读] DoReMi: First glance at a universal OMR dataset

Elona Shatri, György Fazekas|arXiv (Cornell University)|Jul 16, 2021
Radiomics and Machine Learning in Medical Imaging参考文献 19被引用 4
一句话总结

DoReMi 引入了一个大规模、通用的 OMR 数据集,包含超过 6,400 幅印刷乐谱图像,附带丰富、多层次的元数据,包括边界框、MIDI、MEI、MusicXML 和 PNG 文件。该数据集在仅使用一半数据的情况下,实现了 64% 的平均精度(mAP),支持与 MUSCIMA++ 和 DeepScores 的协同,推动端到端 OMR 研究并提升评估的一致性。

ABSTRACT

The main challenges of Optical Music Recognition (OMR) come from the nature of written music, its complexity and the difficulty of finding an appropriate data representation. This paper provides a first look at DoReMi, an OMR dataset that addresses these challenges, and a baseline object detection model to assess its utility. Researchers often approach OMR following a set of small stages, given that existing data often do not satisfy broader research. We examine the possibility of changing this tendency by presenting more metadata. Our approach complements existing research; hence DoReMi allows harmonisation with two existing datasets, DeepScores and MUSCIMA++. DoReMi was generated using a music notation software and includes over 6400 printed sheet music images with accompanying metadata useful in OMR research. Our dataset provides OMR metadata, MIDI, MEI, MusicXML and PNG files, each aiding a different stage of OMR. We obtain 64% mean average precision (mAP) in object detection using half of the data. Further work includes re-iterating through the creation process to satisfy custom OMR models. While we do not assume to have solved the main challenges in OMR, this dataset opens a new course of discussions that would ultimately aid that goal.

研究动机与目标

  • 解决 OMR 研究中因数据集和评估协议不一致而导致的碎片化问题。
  • 提供一个全面、多格式的数据集,支持 OMR 的所有阶段,从目标检测到语义编码。
  • 通过与现有数据集(如 MUSCIMA++ 和 DeepScores)的协同,实现更优的基准测试和模型比较。
  • 在视觉数据之外,生成高保真、机器可读的元数据(MIDI、MEI、MusicXML),以支持 OMR 中的端到端深度学习。
  • 通过提供丰富、结构化的注释,支持多样化音乐元素,推动通用 OMR 模型的发展。

提出的方法

  • 使用音乐记谱软件生成数据集,以确保视觉元素与语义元数据之间的精确对齐。
  • 每张乐谱图像均包含 37 种不同音乐符号类别的边界框,例如符头、谱号、 slur(连音线)和 tuplets(音组)。
  • 数据集提供多种输出格式:PNG 图像、OMR 元数据、MIDI、MEI 和 MusicXML,以实现与 OMR 流程的完全兼容。
  • 使用一半数据训练的基线目标检测模型实现了 64% 的平均精度(mAP),验证了数据集在检测任务中的实用性。
  • 该数据集支持排版级和语义级注释,支持重建和更高阶音乐理解方面的研究。
  • 作者设计该数据集时,确保其与 MUSCIMA++ 和 DeepScores 兼容,促进跨数据集评估和模型迁移。

实验结果

研究问题

  • RQ1统一的、多格式 OMR 数据集在多大程度上能提升 OMR 研究中的一致性和可比性?
  • RQ2大规模、合成生成的、带有丰富元数据的数据集在多大程度上能支持端到端 OMR 模型训练?
  • RQ3基线目标检测模型在像 DoReMi 这样新而全面的 OMR 数据集上的表现如何?
  • RQ4DoReMi 是否能有效与现有数据集(如 MUSCIMA++ 和 DeepScores)协同,以实现跨数据集评估?
  • RQ5包含语义元数据(如音高、时值、力度等)对 OMR 模型性能和泛化能力有何影响?

主要发现

  • DoReMi 数据集包含超过 6,400 幅印刷乐谱图像,对 37 种音乐符号类别进行了详细注释。
  • 该数据集包含多种输出格式——PNG、OMR 元数据、MIDI、MEI 和 MusicXML——支持 OMR 的所有阶段。
  • 使用仅一半数据的基线目标检测模型实现了 64% 的平均精度(mAP),证明其在检测任务中的实用性。
  • 该数据集支持与 MUSCIMA++ 和 DeepScores 的协同,支持跨数据集评估和模型兼容性。
  • 语义元数据(如音高、时值、力度和演奏记号)被准确地与视觉元素关联,支持更高阶的 OMR 任务。
  • 使用音乐记谱软件确保了视觉数据与语义数据之间的高保真对齐,减少了真实世界数据集中常见的标注错误。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。