Skip to main content
QUICK REVIEW

[論文レビュー] A Hybrid of Deep Audio Feature and i-vector for Artist Recognition

Jiyoung Park, Donghyun Kim|arXiv (Cornell University)|Jul 24, 2018
Music and Audio Processing参考文献 7被引用数 4
ひとこと要約

本稿では、音声特徴として深層畳み込みニューラルネットワーク(DCNN)から抽出した特徴とi-vector表現を組み合わせたラテン融合ハイブリッドモデルを、音楽アーティスト識別に提案する。DCNNの識別力とi-vectorの生成的ロバスト性を活用することで、特にヴォーカル識別において優れた性能を発揮し、個々のモデルを上回る補完的特徴学習により最先端の性能を達成する。

ABSTRACT

Artist recognition is a task of modeling the artist's musical style. This problem is challenging because there is no clear standard. We propose a hybrid method of the generative model i-vector and the discriminative model deep convolutional neural network. We show that this approach achieves state-of-the-art performance by complementing each other. In addition, we briefly explain the advantages and disadvantages of each approach.

研究の動機と目的

  • 音楽情報検索におけるアーティスト識別を、ディープラーニングと従来のスプーカーモデリング技術を組み合わせることで向上させること。
  • 音楽的アーティストのスタイルをモデル化するうえで、識別的ディープオーディオ特徴と生成的i-vector表現の補完的強みを解明すること。
  • DCNNとi-vector特徴を統合する際のエアリー融合とレイト融合戦略の有効性を、アーティストおよびヴォーカリスト識別タスクにおいて評価すること。
  • トレーニングアーティスト数の変化や音声コンテンツの性質(例:ボーカル中心)がモデル性能に与える影響を分析すること。
  • 今後の応用、例えば類似アーティストの推薦などに、このハイブリッドモデルの可能性を検討すること。

提案手法

  • 3秒間のメルスペクトログ램(128バンド)を入力として、5層の畳み込み層を持つDCNNをトレーニングし、最終的な256次元の隠れ層を特徴表現として抽出する。
  • 20次元のメル周波数ケプストラム係数(MFCC)と256成分のガウス混合モデル(GMM)を用いてi-vectorを生成し、スコアリングには確率的線形判別分析(PLDA)を適用する。
  • エアリー融合では、256次元のDCNN特徴と256次元のi-vectorを連結し、スコアリング前に1つの512次元ベクトルとして統合する。
  • レイト融合では、DCNNモデルとi-vectorモデルの両方のPLDAスコアを平均化し、最終意思決定にそれぞれ独立して寄与させる。
  • ミリオン・ソング・データセットを用いてモデルをトレーニングおよび評価し、1アーティストあたり20曲にフィルタリングし、評価には500人の未学習アーティストを用いる。
  • 15の登録トラックの平均プーリングにより単一のアーティストモデルを構築し、検証には等誤差率(EER)を、識別には分類精度を用いる。

実験結果

リサーチクエスチョン

  • RQ1トレーニングアーティスト数の増加に伴い、i-vectorとDCNNの性能特性はどのように変化するか?
  • RQ2i-vectorとDCNNは、音楽的アーティストのアイデンティティをモデル化するうえで、どのような点で補完的か?
  • RQ3DCNNとi-vectorのエアリー融合とレイト融合のどちらが、アーティストおよびヴォーカリスト識別タスクにおいてより優れた性能を発揮するか?
  • RQ4ボーカルコンテンツに焦点を当てた場合(例:ヴォーカリスト識別)、i-vectorとDCNNの相対的性能にどのような影響が生じるか?
  • RQ5識別的モデルと生成的モデルの両方の強みを活かすことで、ハイブリッドモデルが最先端のアーティスト識別性能を達成できるか?

主な発見

  • DCNNとi-vectorのレイト融合が、すべてのタスクで最良の性能を示し、ヴォーカリスト識別では3.241%のEERと76.0%の正解率を達成。個々のモデルを顕著に上回った。
  • DCNNの性能はトレーニングアーティスト数の増加に伴い滑らかに向上したが、i-vectorの性能は初期に飽和した。これはi-vectorが教師なし学習の性質上、トレーニングデータサイズにあまり依存しないことを示唆している。
  • i-vectorはヴォーカリスト識別(8.257% EER)において、アーティスト識別(10.785% EER)よりも優れた性能を示し、ボーカル特徴のモデル化に長けていることが示された。
  • エアリー融合は、スコアリング前に異なる表現を統合するため、特徴の混同が生じ、個々のモデルよりも性能が低下した。
  • 誤りマトリクスの分析から、DCNNは訓練例が少ないアーティストに対して安定したモデルを構築できず、i-vectorは初期にモデルを構築できたが、トレーニングサイズの増大に伴いアーティスト間の類似性が増加した。
  • ハイブリッドモデルは強い補完性を示した:DCNNは高レベルの音楽的特徴を捉えており、i-vectorは特にボーカル中心のタスクで声の特徴による区別に優れていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。