Skip to main content
QUICK REVIEW

[論文レビュー] CNN Architectures for Large-Scale Audio Classification

Shawn Hershey, Sourish Chaudhuri|arXiv (Cornell University)|Sep 29, 2016
Music and Audio Processing被引用数 14
ひとこと要約

本論文は、7000万本の動画からなるYouTube-100Mデータセット(30,871ラベル)を用いて、標準的な畳み込みニューラルネットワーク(CNN)アーキテクチャ—AlexNet、VGG、Inception、ResNet—を大規模音声分類に適用して評価している。ログメルスペクトログ램を用いて画像ベースのCNNから音声分類へ転移学習を実行した結果、音声イベント検出(AED)タスクで最先端の性能を達成し、Audio SetデータセットにおいてResNet埋め込みを用いることでmAPが1.3倍向上した。

ABSTRACT

Convolutional Neural Networks (CNNs) have proven very effective in image classification and show promise for audio. We use various CNN architectures to classify the soundtracks of a dataset of 70M training videos (5.24 million hours) with 30,871 video-level labels. We examine fully connected Deep Neural Networks (DNNs), AlexNet [1], VGG [2], Inception [3], and ResNet [4]. We investigate varying the size of both training set and label vocabulary, finding that analogs of the CNNs used in image classification do well on our audio classification task, and larger training and label sets help up to a point. A model using embeddings from these classifiers does much better than raw features on the Audio Set [5] Acoustic Event Detection (AED) classification task.

研究の動機と目的

  • 最先端の画像分類CNNアーキテクチャが、大規模音声分類タスクに効果的に適応可能かどうかを調査すること。
  • トレーニングデータセットのサイズとラベル語彙のサイズが音声分類性能に与える影響を評価すること。
  • 大規模音声モデルから学習された表現が、下流の音声イベント検出(AED)タスクにどれほど転送可能かを評価すること。
  • 動画レベル分類において、フレームレベルの予測を単純に平均化する手法が、より複雑な時系列モデリングを上回るか否かを検証すること。

提案手法

  • 7000万本のYouTube動画から重複のない960msの音声フレームを抽出し、すべての動画レベルラベルを継承した。
  • 各音声フレームをログメルスペクトログラムに変換し、事前学習済みCNNの2次元画像入力として扱った。
  • AlexNet、VGG、Inception、ResNet-50といった複数のCNNアーキテクチャを、トレーニングデータとラベルセットの異なるサブセットで学習・評価した。
  • 30,000ラベルのモデルで学習を高速化するために、最終層の直前で128ユニットのボトルネック層を導入した。
  • フレームレベル分類器の出力を平均化して、全体のサウンドトラック予測を生成した。これは視覚的動画分類手法を模倣したものである。
  • 最良の性能を示したResNetモデルからの埋め込みと、元のログメル特徴量を用いて、Audio Setデータセットで全結合ネットワークをファインチューニングした。

実験結果

リサーチクエスチョン

  • RQ1標準的な画像ベースのCNNアーキテクチャが、大規模音声分類タスクに適用された場合、どの程度の性能を示すか?
  • RQ2トレーニングデータセットのサイズとラベル語彙のサイズを拡大することで、モデルの一般化性能と性能にどのような影響が生じるか?
  • RQ3大規模音声分類タスクで学習された表現が、下流の音声イベント検出(AED)タスクの性能向上に寄与できるか?
  • RQ4フレームレベルの予測を単純に平均化する手法は、動画レベル分類において十分であるか?それとも、より複雑な時系列モデリングが必要か?

主な発見

  • 評価されたアーキテクチャの中で、ResNet-50が最も優れた性能を示し、より単純なDNNやAlexNet・VGGといった初期のCNNを上回った。
  • 30,000ラベルまでの大きなラベル語彙で学習させたことで、小さな評価セットにおいてもわずかだが一貫した性能向上が見られ、正則化の恩恵があると考えられた。
  • 23,000から7000万本の動画にまでトレーニングデータセットを拡大したところ、性能が向上したが、70万~7000万本の動画で学習したモデルはほぼ同一の結果を示し、あるスケールを超えると収益が減少することを示唆した。
  • 30,000ラベルで学習した7000万本の動画モデルは、ResNet埋め込みを用いることで、Audio Setデータセットでバランスの取れたmAPが0.314、AUCが0.959を達成した。これはログメルベースライン(mAP 0.137)に対して135%の向上である。
  • 7万本および2万3千本の動画で学習したモデルと7000万本のモデルとの間の性能差は、過学習の兆候を示しており、より強い正則化やデータオーグメンテーションにより緩和可能であると考えられた。
  • フレームレベルの予測を単純に平均化する手法が、より複雑な時系列モデリングとほぼ同等の性能を示した。これは、局所的なフレームレベル表現が、動画レベル分類において非常に識別力が高いことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。