Skip to main content
QUICK REVIEW

[论文解读] Towards End-to-End Audio-Sheet-Music Retrieval

Matthias Dorfer, Andreas Arzt|arXiv (Cornell University)|Dec 15, 2016
Music and Audio Processing参考文献 7被引用 5
一句话总结

该论文提出了一种端到端的深度学习方法,用于基于深度典型相关分析(DCCA)的跨模态音频到乐谱检索,实现了音频片段(频谱图)与乐谱图像之间的直接匹配,而无需符号化音乐表示。该方法在未见测试数据上实现了中位排名2和R@10为94.2%的性能,展示了在零样本跨模态检索中的强大表现。

ABSTRACT

This paper demonstrates the feasibility of learning to retrieve short snippets of sheet music (images) when given a short query excerpt of music (audio) -- and vice versa --, without any symbolic representation of music or scores. This would be highly useful in many content-based musical retrieval scenarios. Our approach is based on Deep Canonical Correlation Analysis (DCCA) and learns correlated latent spaces allowing for cross-modality retrieval in both directions. Initial experiments with relatively simple monophonic music show promising results.

研究动机与目标

  • 实现音频与乐谱图像之间的直接跨模态检索,无需符号化音乐表示。
  • 开发一种端到端的深度神经网络框架,学习音频与图像模态之间的相关潜在表征。
  • 通过将音频表演与相应的乐谱片段关联,应对大规模音乐数字化的挑战。
  • 评估使用原始模态输入实现零样本音频到乐谱及乐谱到音频检索的可行性。
  • 证明DCCA能够有效对齐音频与图像嵌入,以实现音乐内容检索。

提出的方法

  • 该模型使用两个独立的卷积神经网络(CNN)将原始音频频谱图和乐谱图像处理为共享的潜在表征。
  • 采用深度典型相关分析(DCCA)以最大化音频与图像模态所学特征表征之间的相关性。
  • 优化目标为最大化两个视图之间互协方差矩阵的奇异值之和,以促进潜在空间的对齐。
  • 训练完成后,通过投影到CCA空间计算余弦相似度,实现音频与图像片段之间的检索。
  • 网络架构基于VGG风格模块,采用类似ReLU的ELU激活函数、批量归一化,并通过全局平均池化将维度降低至32D。
  • 通过1×1卷积层配合全局平均池化,将特征图大小缩减至所需的32维相关空间。

实验结果

研究问题

  • RQ1端到端深度学习能否在无需符号化音乐表示的情况下实现准确的音频到乐谱检索?
  • RQ2DCCA在原始音频频谱图与乐谱图像之间学习相关潜在表征的能力如何?
  • RQ3在未见测试数据上,音频到乐谱与乐谱到音频两个方向的检索性能如何?
  • RQ4乐谱图像中的微小变化在多大程度上影响检索准确率?
  • RQ5所学表征是否足够鲁棒,能够泛化到零样本设置下的未见音乐片段?

主要发现

  • 在测试集上,音频到乐谱检索的中位排名(MR)为16,000个候选中的第2位,表明顶级结果具有极高精度。
  • 音频到乐谱检索的R@10为94.2%,意味着超过94%的音频查询中,正确的乐谱片段位于前10名结果中。
  • 乐谱到音频检索的R@10为93.7%,表明在两个检索方向上均表现优异。
  • 模型在未见数据上泛化良好,验证集与测试集表现一致(例如,R@10:93.1% vs. 94.2%)。
  • 对检索结果的视觉检查显示,9个顶部结果中有4个为真实样本的近似重复或微小变体,表明对轻微视觉偏移具有鲁棒性。
  • 即使无需符号化音乐转录,模型仍能实现高性能,证明了直接模态匹配的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。