Skip to main content
QUICK REVIEW

[论文解读] Audio Classical Composer Identification by Deep Neural Network

Zhen Hu, Kun Fu|arXiv (Cornell University)|Jan 15, 2013
Music and Audio Processing参考文献 16被引用 6
一句话总结

本文提出一种混合深度学习模型,结合深度置信网络(DBN)与堆叠去噪自编码器(SDA),用于音频古典作曲家识别(ACC),在自建的数据集上达到76.26%的准确率,该数据集规模与MIREX相当。该模型通过分层表征学习增强了不同作曲家之间的特征分离。

ABSTRACT

Audio Classical Composer Identification (ACC) is an important problem in Music Information Retrieval (MIR) which aims at identifying the composer for audio classical music clips. The famous annual competition, Music Information Retrieval Evaluation eXchange (MIREX), also takes it as one of the four training&testing tasks. We built a hybrid model based on Deep Belief Network (DBN) and Stacked Denoising Autoencoder (SDA) to identify the composer from audio signal. As a matter of copyright, sponsors of MIREX cannot publish their data set. We built a comparable data set to test our model. We got an accuracy of 76.26% in our data set which is better than some pure models and shallow models. We think our method is promising even though we test it in a different data set, since our data set is comparable to that in MIREX by size. We also found that samples from different classes become farther away from each other when transformed by more layers in our model.

研究动机与目标

  • 为解决从音频片段中识别古典音乐作曲家的挑战,这是音乐信息检索(MIR)中的关键任务。
  • 开发一种深度学习模型,能够从原始音频信号中学习鲁棒且分层的表征,用于作曲家分类。
  • 在自建数据集上评估模型,因为MIREX数据受版权限制无法使用。
  • 证明更深的网络结构能够提升学习特征空间中不同类别之间的分离度。

提出的方法

  • 通过将深度置信网络(DBN)与堆叠去噪自编码器(SDA)堆叠,构建混合架构以实现分层特征学习。
  • DBN使用贪婪逐层训练方法,在原始音频特征上预训练模型,以学习初始表征。
  • SDA通过重建被污染的输入特征对模型进行微调,提升模型的鲁棒性与泛化能力。
  • 最终模型利用学习到的分层特征,通过Softmax层进行作曲家分类。
  • 模型在自建数据集上进行端到端训练,以模拟MIREX数据的规模与复杂度。
  • 特征空间分析表明,增加网络深度可提升不同作曲家之间的类间距离。

实验结果

研究问题

  • RQ1结合DBN与SDA的混合深度学习模型能否有效从音频信号中识别古典音乐作曲家?
  • RQ2所提出的模型在非MIREX数据集上的性能与纯模型或浅层模型相比如何?
  • RQ3模型中更深的架构是否能带来不同作曲家特征的更好分离?
  • RQ4该模型在MIREX官方未发布数据集上的泛化能力如何?
  • RQ5随着网络深度的增加,学习到的表征空间在类间距离方面如何演变?

主要发现

  • 所提出的混合DBN-SDA模型在自建数据集上达到76.26%的准确率,优于多个纯模型与浅层模型。
  • 即使在非MIREX数据集上测试,模型也表现出良好性能,表明其具备潜在的迁移能力。
  • 模型更深的层导致类间距离增大,表明对不同作曲家的特征区分能力得到提升。
  • 该模型架构能有效学习分层表征,从而增强作曲家分类性能。
  • 在自建数据集上的表现支持该模型的可行性,即使缺乏官方MIREX数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。