Skip to main content
QUICK REVIEW

[論文レビュー] Audio Classical Composer Identification by Deep Neural Network

Zhen Hu, Kun Fu|arXiv (Cornell University)|Jan 15, 2013
Music and Audio Processing参考文献 16被引用数 6
ひとこと要約

本論文は、音声クラシカル・コンポーザー識別(ACC)のため、深層信念ネットワーク(DBN)とスタックドノイズ除去オートエンコーダー(SDA)を組み合わせたハイブリッド深層学習モデルを提案する。独自に構築したデータセット(MIREXと同等の規模)で76.26%の精度を達成した。このモデルは階層的表現学習により、作曲家間の特徴分離を向上させる。

ABSTRACT

Audio Classical Composer Identification (ACC) is an important problem in Music Information Retrieval (MIR) which aims at identifying the composer for audio classical music clips. The famous annual competition, Music Information Retrieval Evaluation eXchange (MIREX), also takes it as one of the four training&testing tasks. We built a hybrid model based on Deep Belief Network (DBN) and Stacked Denoising Autoencoder (SDA) to identify the composer from audio signal. As a matter of copyright, sponsors of MIREX cannot publish their data set. We built a comparable data set to test our model. We got an accuracy of 76.26% in our data set which is better than some pure models and shallow models. We think our method is promising even though we test it in a different data set, since our data set is comparable to that in MIREX by size. We also found that samples from different classes become farther away from each other when transformed by more layers in our model.

研究の動機と目的

  • 音声クリップからクラシカル音楽の作曲家を特定するという課題に取り組むこと。これは音楽情報検索(MIR)における重要なタスクである。
  • 生の音声信号から強固で階層的な表現を学習できる深層学習モデルを開発すること。
  • MIREXデータは著作権制限があるため、独自のデータセットでモデルを評価すること。
  • より深いアーキテクチャが学習された特徴空間におけるクラス間分離を向上させることを示すこと。

提案手法

  • 階層的特徴学習のために、深層信念ネットワーク(DBN)とスタックドノイズ除去オートエンコーダー(SDA)をスタックしてハイブリッドアーキテクチャを構築する。
  • DBNは、生の音声特徴を用いてグリーディ層別トレーニングで事前学習を行い、初期表現を学習する。
  • SDAは、損傷を加えた入力特徴を再構築することで、モデルのロバスト性と一般化性能を向上させる。
  • 最終的なモデルは、ソフトマックス層を介して学習された階層的特徴を用いて作曲家分類を行う。
  • MIREXのデータサイズと複雑さを模倣するために、自己構築データセット上でエンドツーエンドでモデルをトレーニングする。
  • 特徴空間の分析から、ネットワークの深さを増すことで作曲家間のクラス間距離が増加することが示された。

実験結果

リサーチクエスチョン

  • RQ1DBNとSDAを組み合わせたハイブリッド深層学習モデルは、音声信号からクラシカル音楽の作曲家を効果的に特定できるか?
  • RQ2本モデルの性能は、MIREXデータセットでない非MIREXデータセットにおいて、純粋または浅いモデルと比較してどうなるか?
  • RQ3モデルにおけるより深いアーキテクチャは、異なる作曲家からの特徴の分離を向上させるか?
  • RQ4MIREXが公式にリリースしていないデータセットに対して、モデルはどの程度一般化できるか?
  • RQ5階層的特徴空間におけるクラス間距離の観点から、ネットワークの深さが増すに従い、学習された表現空間はどのように変化するか?

主な発見

  • 提案されたハイブリッドDBN-SDAモデルは、独自に構築したデータセットで76.26%の精度を達成し、多数の純粋および浅いモデルを上回った。
  • モデルは非MIREXデータセットでも有望な性能を示しており、移行可能性の可能性を示している。
  • モデルのより深い層では、作曲家間のクラス間距離が増加しており、作曲家間の特徴識別性能が向上していることが示唆された。
  • モデルのアーキテクチャは階層的表現を効果的に学習し、作曲家分類を向上させた。
  • 公式のMIREXデータが入手できない状況下でも、独自のデータセットでの性能が、モデルの実用性を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。