Skip to main content
QUICK REVIEW

[论文解读] Learning to Listen, Read, and Follow: Score Following as a Reinforcement Learning Game

Matthias Dorfer, Florian Henkel|arXiv (Cornell University)|Jul 17, 2018
Reinforcement Learning in Robotics参考文献 17被引用 12
一句话总结

该论文将乐谱图像中的谱面跟踪问题形式化为多模态马尔可夫决策过程,并应用深度强化学习(如A2C)训练智能体,使其能够同时听音频、读取乐谱图像,并实时跟踪演奏位置。该方法实现了最先进性能,70%的多声部乐曲可全程追踪,平均误差仅为20像素(≈5毫米),相比之前方法准确率提升三倍以上。

ABSTRACT

Score following is the process of tracking a musical performance (audio) with respect to a known symbolic representation (a score). We start this paper by formulating score following as a multimodal Markov Decision Process, the mathematical foundation for sequential decision making. Given this formal definition, we address the score following task with state-of-the-art deep reinforcement learning (RL) algorithms such as synchronous advantage actor critic (A2C). In particular, we design multimodal RL agents that simultaneously learn to listen to music, read the scores from images of sheet music, and follow the audio along in the sheet, in an end-to-end fashion. All this behavior is learned entirely from scratch, based on a weak and potentially delayed reward signal that indicates to the agent how close it is to the correct position in the score. Besides discussing the theoretical advantages of this learning paradigm, we show in experiments that it is in fact superior compared to previously proposed methods for score following in raw sheet music images.

研究动机与目标

  • 解决现有谱面跟踪方法将时间步独立处理所导致的重复段落中跟踪跳跃的问题。
  • 通过马尔可夫决策过程(MDP)将谱面跟踪形式化为序列决策问题,使智能体能够学习在乐谱中动态导航。
  • 训练端到端的多模态智能体,联合处理音频和视觉乐谱输入,以预测实时谱面位置。
  • 评估深度强化学习(如A2C、REINFORCE)在从弱延迟奖励信号中学习鲁棒、可泛化的谱面跟踪策略方面的有效性。
  • 探索连续控制与真实演奏数据微调在提升对齐准确率方面的潜力。

提出的方法

  • 该任务被形式化为多模态MDP,其中智能体观察音频特征和乐谱图像的图像块,并选择动作来调整其阅读速度(例如,加快、减慢、保持不变)。
  • 智能体的策略通过最先进的深度强化学习算法(如A2C和带基线的REINFORCE)进行学习,训练数据为合成数据,其中音频起音与谱面位置具有真实对齐关系。
  • 状态表示结合了应用于乐谱图像的卷积神经网络(CNN)提取的特征,以及应用于音频频谱图的CNN或循环神经网络(RNN)提取的特征,实现联合多模态处理。
  • 奖励信号稀疏且延迟,通过在起音之间插值真实谱面位置计算,对对齐更接近的预测给予更高奖励。
  • 环境设计用于模拟实时演奏,智能体仅通过反映合理阅读行为(从左到右、从上到下)的动作才能推进乐谱。
  • 该方法支持从原始音频和图像输入端到端训练,无需依赖预处理的符号化乐谱(如MusicXML或MIDI)

实验结果

研究问题

  • RQ1谱面跟踪能否通过马尔可夫决策过程有效建模为序列决策问题?
  • RQ2使用多模态输入(音频和乐谱图像)的深度强化学习是否能带来比独立帧间预测更稳定、更准确的跟踪?
  • RQ3不同强化学习算法(如A2C与REINFORCE)在学习鲁棒谱面跟踪策略方面的性能表现如何比较?
  • RQ4当在弱延迟奖励信号的合成数据上进行训练时,智能体能否泛化到未见过的乐曲和音频条件?
  • RQ5与离散动作空间相比,连续控制智能体在多大程度上能提升对齐准确率?

主要发现

  • 在Mutopia数据集上,A2C智能体实现了20像素的平均追踪误差,相当于标准A4乐谱页面上约5毫米,相比基线方法62像素的误差,性能提升三倍。
  • 在Mutopia数据集上,A2C智能体成功在不丢失目标的情况下,从头到尾完整追踪了超过70%的100首测试乐曲,展现出强大的鲁棒性与泛化能力。
  • A2C智能体在六小时内即学习到有效策略,而带基线的REINFORCE方法在Nottingham数据集上实现相当性能则耗时超过五天。
  • 基于强化学习的方法显著减少了重复段落中的追踪不稳定性与跳跃行为,而这类问题在以往的帧独立方法中普遍存在。
  • 该方法在多声部音乐中表现良好,即使在复杂的管弦乐风格钢琴乐谱上也表现出色,表明MDP形式化在捕捉音乐结构方面的有效性。
  • 结果表明,未来强化学习算法的进展将直接惠及谱面跟踪任务,因为相同的MDP框架可实现向新环境的迁移以及在真实演奏数据上的微调。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。