Skip to main content
QUICK REVIEW

[论文解读] In Search of a Dataset for Handwritten Optical Music Recognition: Introducing MUSCIMA++

Jan Hajič, Pavel Pecina|arXiv (Cornell University)|Mar 14, 2017
Music and Audio Processing参考文献 26被引用 5
一句话总结

本论文介绍了 MUSCIMA++,这是一个大规模、开源的数据集,包含 140 页手写音乐记号,共 91,255 个手动标注的记号和 82,261 个记号关系,支持用于记号识别、定位及记谱图构建的 OMR 系统的训练与评估。该数据集支持 OMR 子任务的独立建模与联合建模,并配有开源工具和全面的标注框架。

ABSTRACT

Optical Music Recognition (OMR) has long been without an adequate dataset and ground truth for evaluating OMR systems, which has been a major problem for establishing a state of the art in the field. Furthermore, machine learning methods require training data. We analyze how the OMR processing pipeline can be expressed in terms of gradually more complex ground truth, and based on this analysis, we design the MUSCIMA++ dataset of handwritten music notation that addresses musical symbol recognition and notation reconstruction. The MUSCIMA++ dataset version 0.9 consists of 140 pages of handwritten music, with 91255 manually annotated notation symbols and 82261 explicitly marked relationships between symbol pairs. The dataset allows training and evaluating models for symbol classification, symbol localization, and notation graph assembly, both in isolation and jointly. Open-source tools are provided for manipulating the dataset, visualizing the data and further annotation, and the dataset itself is made available under an open license.

研究动机与目标

  • 为解决长期以来手写光学音乐识别(OMR)领域缺乏全面、公开可用数据集的问题。
  • 建立一个基准数据集,支持在不同复杂度层级上对 OMR 系统进行评估与训练。
  • 支持对 OMR 系统在记号分类、定位及记谱图构建方面的基准测试,无论单独进行还是联合进行。
  • 通过提供高质量、细粒度的标注,支持机器学习模型在 OMR 领域的开发。
  • 通过提供标准化、可扩展的数据集,促进未来标注流程的自动化。

提出的方法

  • 该数据集基于 CVC-MUSCIMA 数据集构建,以手写音乐页面作为输入图像。
  • 对 91,255 个记谱记号进行了人工标注,包括其边界框和类别标签。
  • 明确标注了记号对之间的关系,如谱线附着、休止符与符头、三连音与符头等,共计 82,261 个关系。
  • 设计了自定义数据模型,以表示音乐记谱的分层与关系结构,支持多层级基准真值。
  • 开发了开源工具,用于数据操作、可视化以及未来标注的扩展。
  • 该数据集以开放许可发布,支持在未来的 OMR 研究流程中重用与集成。

实验结果

研究问题

  • RQ1如何构建一个全面、细粒度的基准数据集,以支持手写 OMR 中机器学习模型的训练与评估?
  • RQ2在 OMR 中实现记号分类、定位及记谱图构建的精确建模,所需的标注粒度级别是什么?
  • RQ3一个包含显式记号关系的数据集是否能够支持从手写记谱中重建音高与时值信息?
  • RQ4如何组织数据集结构,以同时支持 OMR 子任务的独立与联合评估?
  • RQ5当前标注格式存在哪些局限性?如何通过迁移到 MEI 等标准格式加以解决?

主要发现

  • MUSCIMA++ v.0.9 提供了目前公开可用的最全面的手写 OMR 基准真值,包含 140 页、91,255 个标注记号和 82,261 个显式记号关系。
  • 该数据集支持对记号分类、定位及记谱图构建的模型进行训练与评估,无论单独进行还是联合进行。
  • 通过符头与临时记号、三连音与符头之间的关系,可部分推断出音高与时值信息。
  • 该数据集支持开发旨在实现可重现性(音高与时值序列)和可重印性(可排版的音乐表示)的 OMR 系统。
  • 该数据集及其配套工具的可用性,为未来 OMR 竞赛和标准化评估铺平了道路。
  • 作者指出了未来改进方向,包括迁移到 MEI 格式、扩展至早期音乐来源,以及通过学习模型实现标注自动化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。