Skip to main content
QUICK REVIEW

[论文解读] Optical Music Recognition: State of the Art and Major Challenges

Elona Shatri, György Fazekas|arXiv (Cornell University)|Jun 14, 2020
Music and Audio Processing参考文献 72被引用 6
一句话总结

本文综述了光学音乐识别(OMR)领域的最新进展,强调了从传统计算机视觉方法向深度学习方法的转变。文章指出了处理复杂乐谱、手写记谱以及缺乏标准化等关键挑战,并提出了统一的数据集、改进的评估指标以及端到端学习,以推动该领域的发展。

ABSTRACT

Optical Music Recognition (OMR) is concerned with transcribing sheet music into a machine-readable format. The transcribed copy should allow musicians to compose, play and edit music by taking a picture of a music sheet. Complete transcription of sheet music would also enable more efficient archival. OMR facilitates examining sheet music statistically or searching for patterns of notations, thus helping use cases in digital musicology too. Recently, there has been a shift in OMR from using conventional computer vision techniques towards a deep learning approach. In this paper, we review relevant works in OMR, including fundamental methods and significant outcomes, and highlight different stages of the OMR pipeline. These stages often lack standard input and output representation and standardised evaluation. Therefore, comparing different approaches and evaluating the impact of different processing methods can become rather complex. This paper provides recommendations for future work, addressing some of the highlighted issues and represents a position in furthering this important field of research.

研究动机与目标

  • 提供对光学音乐识别(OMR)近期进展的全面综述,重点聚焦于从经典计算机视觉方法向深度学习方法的转变。
  • 识别OMR中持续存在的挑战,包括图像质量低下、手写乐谱、复杂的多声部乐谱以及记谱法中的结构模糊性。
  • 强调输入/输出表示形式和评估协议缺乏标准化,这阻碍了不同方法之间的公平比较。
  • 提出创建一个通用、均衡且多样化的数据集,以支持OMR中间阶段和端到端识别。
  • 倡导将音乐知识和结构规则整合到深度学习模型中,并标准化评估指标,以提升可复现性并推动OMR的发展。

提出的方法

  • 系统性地回顾了OMR领域的开创性与近期研究工作,按处理流程阶段进行分类:图像预处理、音乐符号识别、音乐信息重构以及记谱模型构建。
  • 利用结构化框架分析OMR处理流程的各个阶段,识别出在表示、评估和模块化方面各方法存在的差距。
  • 通过记谱软件(如Dorico、Rosegarden)生成高保真度的乐谱,提出一项新的通用数据集倡议,其与现有基准(如MUSCIMA++和DeepScores)保持一致。
  • 建议在OMR的所有阶段(包括目标检测、图像分割和序列建模)采用深度学习,以实现端到端识别。
  • 强调需要将音乐先验知识(如 staff line 几何结构、音符时值规则、调号/时间 signature 约束)整合到神经网络架构中。
  • 倡导标准化评估指标和输出格式(如MusicXML、MIDI),以实现跨系统的公平基准测试和可复现性。

实验结果

研究问题

  • RQ1与传统计算机视觉技术相比,深度学习方法在OMR系统性能和架构方面带来了哪些显著变革?
  • RQ2OMR中尚未解决的主要挑战是什么,特别是针对手写乐谱、复杂多声部乐谱以及低质量图像的问题?
  • RQ3为何OMR中存在输入/输出表示形式和评估协议缺乏标准化的现象?这如何阻碍领域进展?
  • RQ4统一的、大规模且均衡的数据集在多大程度上能提升OMR模型的鲁棒性和泛化能力?
  • RQ5能否在2D空间序列的乐谱上有效训练端到端的深度学习模型?需要哪些架构上的创新?

主要发现

  • 深度学习在单声部和印刷乐谱上的表现已显著提升,但在手写乐谱和复杂钢琴谱方面仍面临挑战。
  • 该领域缺乏标准化的评估协议和一致的输出格式,导致跨方法比较困难,限制了可复现性。
  • 现有数据集如CVC-MUSCIMA、MUSCIMA++、DeepScores和PrIMuS虽具价值,但其多样性不足,且类别分布存在显著不平衡。
  • 类别不平衡是OMR中的主要问题,罕见符号类型在训练数据中代表性不足,影响模型泛化能力。
  • 所提出的通用数据集倡议旨在生成具有受控变化的合成高保真乐谱,涵盖风格、图像质量和记谱复杂度等变量。
  • 由于在单一深度学习框架中建模2D空间与序列音乐关系的复杂性,端到端OMR仍是开放性挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。