Skip to main content
QUICK REVIEW

[论文解读] Comparing the Accuracy of Deep Neural Networks (DNN) and Convolutional Neural Network (CNN) in Music Genre Recognition (MGR): Experiments on Kurdish Music

Aza Zuhair, Hossein Hassani|arXiv (Cornell University)|Nov 22, 2021
Music and Audio Processing被引用 4
一句话总结

本研究评估了深度神经网络(DNN)与卷积神经网络(CNN)在 Kurmanji 音乐(Kurdish music)体裁识别中的表现,使用了一个包含 880 个 30 秒音频样本的自定义数据集,涵盖八个体裁。CNN 达到了 92% 的准确率,优于 DNN 的 90%,表明 CNN 在捕捉低资源音乐领域中的频谱模式方面具有显著优势。

ABSTRACT

Musicologists use various labels to classify similar music styles under a shared title. But, non-specialists may categorize music differently. That could be through finding patterns in harmony, instruments, and form of the music. People usually identify a music genre solely by listening, but now computers and Artificial Intelligence (AI) can automate this process. The work on applying AI in the classification of types of music has been growing recently, but there is no evidence of such research on the Kurdish music genres. In this research, we developed a dataset that contains 880 samples from eight different Kurdish music genres. We evaluated two machine learning approaches, a Deep Neural Network (DNN) and a Convolutional Neural Network (CNN), to recognize the genres. The results showed that the CNN model outperformed the DNN by achieving 92% versus 90% accuracy.

研究动机与目标

  • 为解决在文化上具有重要意义但研究尚不充分的 Kurmanji 音乐领域中自动化体裁识别研究的缺失。
  • 构建一个全新的、经人工筛选的 880 个 Kurmanji 音乐样本数据集,涵盖八个不同体裁,用于模型训练与评估。
  • 比较 DNN 与 CNN 模型在使用 MFCC 特征进行 Kurmanji 音乐体裁分类时的性能表现。
  • 探究音频分段长度与模型架构对分类准确率的影响。
  • 提供一个公开可获取的高质量数据集与训练好的模型,以支持未来在 Kurmanji 音乐信息检索与推荐系统方面的研究。

提出的方法

  • 从多样化来源(YouTube、SoundCloud、CD 等)收集 880 个音频样本,并统一转换为 WAV 格式以确保一致性。
  • 使用 Librosa(v0.8.1)提取梅尔频率倒谱系数(MFCCs)作为唯一的特征表示。
  • 将每个 30 秒的音频文件分割为 30 个 1 秒的样本,以扩大训练数据规模,同时在数据集大小与分段长度之间取得平衡。
  • 采用分层 K 折交叉验证(StratifiedKFold)划分数据集,确保训练集、验证集与测试集中的体裁分布均衡。
  • 训练并评估 DNN 与 CNN 模型,调整多种超参数,包括训练轮次数量与 Dropout 正则化策略。
  • 在最后的全连接层中应用 0.3 的 Dropout 率,以缓解早期实验中观察到的过拟合现象。

实验结果

研究问题

  • RQ1在使用 MFCC 特征时,DNN 与 CNN 模型在识别 Kurmanji 音乐体裁方面的准确率表现如何比较?
  • RQ2分段长度(如 1 秒 vs. 2.4 秒)对 Kurmanji 音乐体裁识别模型性能有何影响?
  • RQ3数据打乱与交叉验证策略如何影响低资源音乐分类中的模型泛化能力与过拟合现象?
  • RQ4使用自定义的 Kurmanji 音乐数据集能否通过深度学习模型实现高分类准确率?
  • RQ5架构正则化(如 Dropout)是否能有效降低在分段音频数据上训练的模型的过拟合?

主要发现

  • CNN 模型在测试集上达到 92% 的准确率,显著优于 DNN 模型的 90%。
  • CNN 模型的损失值为 23%,低于 DNN 模型的 32%,表明其泛化能力更强且分类错误更少。
  • 第五组实验(使用 1 秒音频分段与 30 个训练轮次)在两种模型中均取得最佳性能,且 CNN 保持了更高的准确率。
  • 在最后的实验中,加入 0.3 的 Dropout 层有效消除了过拟合现象,训练准确率降至低于验证准确率。
  • 采用分层 K 折交叉验证(StratifiedKFold)相比随机划分,显著提升了模型稳定性并减少了数据不平衡问题。
  • 本研究证实,更长的音频分段(如 2.4 秒)可能进一步提升性能,但为保持数据集规模并防止过拟合,本研究仍采用 1 秒分段。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。