Skip to main content
QUICK REVIEW

[论文解读] Score-informed Networks for Music Performance Assessment

Jiawen Huang, Yun-Ning Hung|arXiv (Cornell University)|Aug 1, 2020
Music and Audio Processing参考文献 27被引用 5
一句话总结

本文提出了三种深度学习模型,将乐谱信息与音频表演特征相结合,用于客观的音乐表演评估(MPA)。以对齐的音高轮廓和乐谱作为输入,这些模型——卷积网络、联合嵌入模型以及基于距离矩阵的CNN——表明,基于乐谱的方法显著优于无乐谱依赖的基线模型,其中联合嵌入模型在学生试奏数据集上实现了最高的平均性能。

ABSTRACT

The assessment of music performances in most cases takes into account the underlying musical score being performed. While there have been several automatic approaches for objective music performance assessment (MPA) based on extracted features from both the performance audio and the score, deep neural network-based methods incorporating score information into MPA models have not yet been investigated. In this paper, we introduce three different models capable of score-informed performance assessment. These are (i) a convolutional neural network that utilizes a simple time-series input comprising of aligned pitch contours and score, (ii) a joint embedding model which learns a joint latent space for pitch contours and scores, and (iii) a distance matrix-based convolutional neural network which utilizes patterns in the distance matrix between pitch contours and musical score to predict assessment ratings. Our results provide insights into the suitability of different architectures and input representations and demonstrate the benefits of score-informed models as compared to score-independent models.

研究动机与目标

  • 为解决当前缺乏将乐谱信息整合到音乐表演评估(MPA)中的深度学习模型的问题。
  • 探究基于乐谱的神经网络是否相比无乐谱依赖的模型能提升MPA性能。
  • 评估不同网络架构与输入表示方式在MPA中结合音频与乐谱信息的效能。
  • 分析片段大小与距离矩阵分辨率对模型性能的影响。
  • 为音乐教育与表演分析中的客观、可扩展的MPA工具提供基础。

提出的方法

  • 卷积神经网络(SIConvNet)处理对齐音高轮廓与乐谱的时间序列表示的拼接输入。
  • 联合嵌入模型学习音高轮廓与乐谱的共享潜在表示,通过嵌入向量之间的余弦相似度预测评分。
  • 基于距离矩阵的CNN(DistMatNet)以音高轮廓与乐谱的差分表示作为输入,捕捉帧级偏差。
  • 通过动态时间规整(DTW)实现音频与乐谱对齐,以在特征提取前同步音高轮廓与乐谱。
  • 模型在大规模中学生与高中生试奏数据集上进行训练,评分由教师分配。
  • 通过消融研究评估超参数,如片段大小(10秒为最优)与矩阵分辨率(600×600为最优)。

实验结果

研究问题

  • RQ1能否证明,整合乐谱信息的深度神经网络在音乐表演评估中显著优于无乐谱依赖的模型?
  • RQ2在串联输入、联合嵌入与距离矩阵三种架构中,哪一种在MPA中表现最佳?
  • RQ3输入片段大小如何影响基于乐谱的MPA模型性能?
  • RQ4DistMatNet模型中,距离矩阵输入的最优分辨率是多少?
  • RQ5不同输入表示如何影响模型预测音乐性与节奏准确性等不同性能指标的能力?

主要发现

  • 所有基于乐谱的模型在音乐表演评估中均显著优于无乐谱依赖的基线模型。
  • 联合嵌入模型在初中生与管乐团两个数据集上的平均性能均达到最高。
  • 10秒的片段大小优于5秒片段,表明更长的音频段落更能反映整体表演质量。
  • 对于基于距离矩阵的模型,600×600的输入矩阵分辨率表现最佳,实现了细节与模型容量之间的平衡。
  • 节奏准确性表现随矩阵分辨率提高而下降,表明过高复杂度会阻碍学习。
  • 距离矩阵表示能有效捕捉性能偏差,但远离对角线区域包含冗余信息,增加了学习难度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。