[论文解读] Unaligned Supervision For Automatic Music Transcription in The Wild
本文提出 Note EM,一种用于多乐器自动音乐转录(AMT)的新框架,可通过未对齐的乐谱和合成数据实现完全自动化的训练。通过采用期望最大化(Expectation-Maximization)方法,迭代优化转录预测与乐谱对齐,该方法在 MAESTRO 上实现 89.7% 的音符级 F1 分数,在 MAPS 上实现 87.3% 的音符级 F1 分数,且未使用这些数据集进行训练,展示了在不同乐器和音乐类型上的强大泛化能力。
Multi-instrument Automatic Music Transcription (AMT), or the decoding of a musical recording into semantic musical content, is one of the holy grails of Music Information Retrieval. Current AMT approaches are restricted to piano and (some) guitar recordings, due to difficult data collection. In order to overcome data collection barriers, previous AMT approaches attempt to employ musical scores in the form of a digitized version of the same song or piece. The scores are typically aligned using audio features and strenuous human intervention to generate training labels. We introduce NoteEM, a method for simultaneously training a transcriber and aligning the scores to their corresponding performances, in a fully-automated process. Using this unaligned supervision scheme, complemented by pseudo-labels and pitch-shift augmentation, our method enables training on in-the-wild recordings with unprecedented accuracy and instrumental variety. Using only synthetic data and unaligned supervision, we report SOTA note-level accuracy of the MAPS dataset, and large favorable margins on cross-dataset evaluations. We also demonstrate robustness and ease of use; we report comparable results when training on a small, easily obtainable, self-collected dataset, and we propose alternative labeling to the MusicNet dataset, which we show to be more accurate. Our project page is available at https://benadar293.github.io
研究动机与目标
- 通过在弱监督条件下利用真实环境录音进行训练,克服多乐器 AMT 中的数据稀缺瓶颈。
- 解决现有数据集(如 MusicNet)因人工对齐错误导致的标注质量低下问题。
- 开发一种完全自动化、端到端的框架,联合训练转录模型并自动对齐乐谱与音频,无需人工干预。
- 实现在多样乐器和音乐类型(包括现有数据集未涵盖的类型)上的高质量转录。
- 证明合成数据结合未对齐监督可超越完全监督方法在跨数据集评估中的表现。
提出的方法
- 该方法采用期望最大化(EM)框架,联合训练神经网络转录器,并将未对齐的乐谱与音频录音对齐。
- 在 E 步中,当前转录器从无标签音频中预测音符起始时间和音高,这些预测用于通过基于似然的对齐方法将乐谱映射到音频。
- 在 M 步中,使用 E 步生成的、对齐优化后的标签重新训练转录器。
- 该框架首先在合成数据上初始化,以启动训练,随后通过真实环境录音进行迭代优化。
- 采用伪标签和音高偏移增强技术,以提升训练过程中的鲁棒性与泛化能力。
- 通过引入乐器 ID 预测,实现对乐器敏感的转录,支持准确的带乐器标注的音符评估。
实验结果
研究问题
- RQ1未对齐的乐谱能否有效用于训练高精度 AMT 模型,而无需人工标注的对齐?
- RQ2基于 EM 的转录器与对齐联合训练方法,在标签质量与转录准确率方面,相较于传统基于特征的对齐方法有何优势?
- RQ3结合合成数据与未对齐监督的训练方法,在多样化乐器与音乐类型的真实环境录音中,其泛化能力如何?
- RQ4该方法是否能在不使用目标数据集进行训练的情况下,实现在跨数据集评估中的最先进性能?
- RQ5与本文提出的替代标注方案相比,MusicNet 数据集的标注质量如何?能否实现显著提升?
主要发现
- Note EM 在未使用 MAESTRO 训练数据的前提下,于 MAESTRO 测试集上实现了 89.7% 的音符级 F1 分数,显著优于以往方法在相同设置下仅报告的 28% F1 分数。
- 在 MAPS 数据集上,该方法实现了 87.3% 的音符级 F1 分数,表明其对未见演奏和乐器具有强大的泛化能力。
- 当使用该方法生成的标签替代原始 MusicNet 标注时,测试集上的转录准确率提升了超过 20 个百分点。
- 该框架可在包含小提琴、单簧管、大键琴和法国号等 11–22 种乐器上实现高质量转录,尤其在巴松管和法国号等挑战性乐器上表现显著提升。
- 使用少量自收集的演奏数据进行训练,即可达到与使用大规模、精心筛选数据集训练的方法相当的性能,证明了其易用性与可扩展性。
- 所提出的 MusicNet EM 标注方案比原始 MusicNet 标注更准确,尤其在法国号、巴松管和单簧管等乐器上,F1 分数提升超过 15 分。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。