Skip to main content
QUICK REVIEW

[论文解读] A Holistic Approach to Polyphonic Music Transcription with Neural Networks

Miguel A. Román, Antonio Pertusa|arXiv (Cornell University)|Oct 26, 2019
Music and Audio Processing参考文献 17被引用 15
一句话总结

本文提出了一种端到端的神经网络框架,使用带有CTC损失的CRNN进行直接的音频到符号乐谱转录,跳过了中间的钢琴卷帘表示。在合成的弦乐四重奏和巴赫经文歌上进行训练,模型在四重奏上的词错误率(WER)为21.02%,字符错误率(CER)为13.53%,证明了无需帧级对齐或错误传播即可实现直接的记谱级转录的可行性。

ABSTRACT

We present a framework based on neural networks to extract music scores directly from polyphonic audio in an end-to-end fashion. Most previous Automatic Music Transcription (AMT) methods seek a piano-roll representation of the pitches, that can be further transformed into a score by incorporating tempo estimation, beat tracking, key estimation or rhythm quantization. Unlike these methods, our approach generates music notation directly from the input audio in a single stage. For this, we use a Convolutional Recurrent Neural Network (CRNN) with Connectionist Temporal Classification (CTC) loss function which does not require annotated alignments of audio frames with the score rhythmic information. We trained our model using as input Haydn, Mozart, and Beethoven string quartets and Bach chorales synthesized with different tempos and expressive performances. The output is a textual representation of four-voice music scores based on **kern format. Although the proposed approach is evaluated in a simplified scenario, results show that this model can learn to transcribe scores directly from audio signals, opening a promising avenue towards complete AMT.

研究动机与目标

  • 开发一种整体性的、端到端的自动音乐转录(AMT)方法,直接从多音轨音频生成符号化音乐乐谱。
  • 通过避免传统AMT流水线中常见的多阶段处理(如音高检测、音符追踪、量化)来消除错误传播。
  • 证明神经网络能够学习直接从音频生成有效的**kern格式乐谱,而无需依赖帧级对齐。
  • 为未来基于真实音频和更复杂音乐结构的记谱级AMT研究奠定基础。

提出的方法

  • 使用卷积循环神经网络(CRNN)处理原始音频的频谱图,并生成符号化音乐标记的序列。
  • 模型采用连接时序分类(CTC)损失进行训练,无需在真实标签中提供精确的帧到符号对齐。
  • 输入音频由海顿、莫扎特和贝多芬的弦乐四重奏以及巴赫经文歌的合成演奏组成,包含不同的速度和富有表现力的动态。
  • 输出为**kern格式的文本表示,这是一种符号音乐记谱的通用标准,可转换为MusicXML或乐谱。
  • 训练采用小批量随机梯度下降(SGD),配合Nesterov动量和余弦退火学习率调度,共训练100个周期。
  • 基于最低验证WER选择最佳模型,评估使用词错误率(WER)和字符错误率(CER)。

实验结果

研究问题

  • RQ1单阶段神经网络能否在跳过中间钢琴卷帘表示的前提下,直接从多音轨音频生成有效的符号化音乐乐谱?
  • RQ2CRNN结合CTC损失在多大程度上能够学习转录具有正确音高、时值和声部分离的复杂多音音乐?
  • RQ3在端到端框架中,音符时值、小节线和声部交叉错误如何影响转录质量?
  • RQ4尽管训练数据有限且存在句法约束,该模型能否在不同音乐风格(如四重奏与经文歌)之间实现泛化?

主要发现

  • 在四重奏测试集上,模型实现了21.02%的词错误率(WER)和13.53%的字符错误率(CER),表明其在复杂多音音乐上的强大性能。
  • 在经文歌数据集上,模型实现了30.96%的WER和18.10%的CER,错误率更高,反映出由于和声与节奏复杂性增加所致。
  • 常见错误包括错误的音符时值、错位的小节线以及声部交叉,尤其在音高接近或声部交叉时更为明显。
  • 模型在处理稀有符号(如连音和三连音)方面表现不佳,可能由于训练数据中频率较低以及**kern格式表示的局限性。
  • 观察到**kern输出中存在格式错误,表明语法约束或更丰富的训练数据可能提升可靠性。
  • 尽管存在局限性,结果证明了使用单一神经网络实现端到端音频到乐谱转录的可行性,避免了各阶段之间的错误级联。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。