Skip to main content
QUICK REVIEW

[論文レビュー] Comparing the Accuracy of Deep Neural Networks (DNN) and Convolutional Neural Network (CNN) in Music Genre Recognition (MGR): Experiments on Kurdish Music

Aza Zuhair, Hossein Hassani|arXiv (Cornell University)|Nov 22, 2021
Music and Audio Processing被引用数 4
ひとこと要約

本研究は、8つのジャンルにまたがる880件の30秒音声サンプルから構成される独自データセットを用いて、クルド音楽における音楽ジャンル認識のための深層ニューラルネットワーク(DNN)と畳み込みニューラルネットワーク(CNN)を評価している。CNNは92%の正確度を達成し、DNNの90%を上回り、低リソース音楽ドメインにおけるスペクトルパターンの捉え方においてCNNの優位性を示している。

ABSTRACT

Musicologists use various labels to classify similar music styles under a shared title. But, non-specialists may categorize music differently. That could be through finding patterns in harmony, instruments, and form of the music. People usually identify a music genre solely by listening, but now computers and Artificial Intelligence (AI) can automate this process. The work on applying AI in the classification of types of music has been growing recently, but there is no evidence of such research on the Kurdish music genres. In this research, we developed a dataset that contains 880 samples from eight different Kurdish music genres. We evaluated two machine learning approaches, a Deep Neural Network (DNN) and a Convolutional Neural Network (CNN), to recognize the genres. The results showed that the CNN model outperformed the DNN by achieving 92% versus 90% accuracy.

研究の動機と目的

  • 文化的に重要なが、未だ十分に調査が進んでいないクルド音楽における自動音楽ジャンル認識研究の不足を解消すること。
  • 学習および評価のための、8つの明確に区別されたジャンルにまたがる880件のクルド音楽サンプルからなる新規でキュレートされたデータセットの構築。
  • MFCC特徴量を用いたDNNおよびCNNモデルの、クルド音楽ジャンル分類における性能を比較すること。
  • データセグメンテーション長さとモデルアーキテクチャの分類正確度への影響を調査すること。
  • 今後のクルド音楽情報検索およびレコメンデーションシステム分野の研究を支援するため、公開可能で高品質なデータセットおよびトレーニング済みモデルを提供すること。

提案手法

  • YouTube、SoundCloud、CDなど多様なソースから880件の音声サンプルを収集し、一貫性を保つためにWAV形式に変換した。
  • Librosa(v0.8.1)を用いてメル周波数ケプストラム係数(MFCC)を抽出し、特徴表現として唯一のものとした。
  • 各30秒の音声ファイルを30個の1秒セグメントに分割することで、学習データのサイズを拡大し、データサイズとセグメント長のバランスを取った。
  • 訓練・検証・テストセットに均等にジャンルが分布するよう、StratifiedKFold交差検証を用いてデータセットを分割した。
  • エポック数やドロップアウト正則化などのハイパーパrameterを変化させながら、DNNおよびCNNモデルをトレーニングおよび評価した。
  • 初期の実験で観察された過学習を軽減するため、最終層に0.3のドロップアウト率を適用した。

実験結果

リサーチクエスチョン

  • RQ1MFCC特徴量を用いた場合、DNNとCNNモデルはクルド音楽ジャンル分類において、どの程度の正確度を示すか?
  • RQ2セグメント長(例:1秒対2.4秒)は、クルド音楽における音楽ジャンル認識のモデル性能にどのような影響を与えるか?
  • RQ3データシャッフルおよび交差検証戦略は、低リソース音楽分類におけるモデルの汎化性能と過学習にどのように影響するか?
  • RQ4クルド音楽のカスタムデータセットを用いて、ディープラーニングモデルが高い分類正確度を達成できるか?
  • RQ5ドロップアウトなどのアーキテクチャ正則化は、セグメント化された音声データでトレーニングされたモデルにおける過学習を効果的に低減できるか?

主な発見

  • CNNモデルは92%のテスト正確度を達成し、同じデータセットでDNNモデルの90%を大きく上回った。
  • CNNモデルは23%の損失を示したのに対し、DNNモデルは32%であり、より良い汎化性能と少ない分類誤りを示している。
  • 5番目の実験では、1秒セグメントと30エポックを用いたが、両モデルとも最高の性能を示し、CNNは優れた正確度を維持した。
  • 0.3のドロップアウト層を追加することで、過学習が効果的に解消された。最終実験では、訓練正確度が検証正確度を下回った。
  • StratifiedKFold交差検証の使用により、ランダムな分割に比べ、モデルの安定性が向上し、データの不均衡問題が軽減された。
  • 本研究では、より長い音声セグメント(例:2.4秒)が性能向上に寄与する可能性があることが示唆されたが、データセットサイズの維持と過学習の防止を考慮して、1秒セグメントが採用された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。