Skip to main content
QUICK REVIEW

[論文レビュー] Audio Concept Classification with Hierarchical Deep Neural Networks

Mirco Ravanelli, Benjamin Elizalde|arXiv (Cornell University)|Oct 11, 2017
Music and Audio Processing参考文献 14被引用数 3
ひとこと要約

本稿では、ユーザーアップロード動画における音声コンセプト分類のための階層的ディープニューラルネットワーク(H-DNN)を提案する。短時間の文脈を49フレームのウィンドウで統合し、長時間の変調を段階的なニューラルネットワークでモデル化する。TRECVID-MEDデータセットにおいて、GMMベースラインより54%相対的向上、最良のDNNベースラインより12%向上を達成し、制御不能な環境下での意味的音声理解に階層的ディープラーニングの有効性を示している。

ABSTRACT

Audio-based multimedia retrieval tasks may identify semantic information in audio streams, i.e., audio concepts (such as music, laughter, or a revving engine). Conventional Gaussian-Mixture-Models have had some success in classifying a reduced set of audio concepts. However, multi-class classification can benefit from context window analysis and the discriminating power of deeper architectures. Although deep learning has shown promise in various applications such as speech and object recognition, it has not yet met the expectations for other fields such as audio concept classification. This paper explores, for the first time, the potential of deep learning in classifying audio concepts on User-Generated Content videos. The proposed system is comprised of two cascaded neural networks in a hierarchical configuration to analyze the short- and long-term context information. Our system outperforms a GMM approach by a relative 54%, a Neural Network by 33%, and a Deep Neural Network by 12% on the TRECVID-MED database

研究の動機と目的

  • ノイズが多く、多様性に富み、制御不能な条件下で録音されたユーザーメイドコンテンツ(UGC)動画における意味的音声コンセプト(例:笑い、音楽、エンジン音)の分類という課題に取り組む。
  • 従来のモデル(GMMなど)が限界を示す中で、特に階層的ディープニューラルネットワーク(H-DNN)を含むディープラーニングアーキテクチャの潜在的可能性を検討する。
  • 段階的なニューラルネットワークが、音声ストリームにおける短時間の音響パターンと長時間の時間的変調を効果的にモデル化できるかを調査する。
  • 文脈ウィンドウサイズ、次元削減(DCT)、事前学習(RBM)、階層的処理が分類精度に与える影響を評価する。
  • H-DNNの出力が、上位レベルのマルチメディア検索タスクにおける強固な意味的低レベル特徴として機能できることを示す。

提案手法

  • 本システムは二段階の階層的アーキテクチャを採用する:最初のMLPがMFCC(14次元)の49フレームの文脈ウィンドウを処理し、その後、最初のネットワークの出力から導出されたスパarsな長時間文脈ウィンドウを分析する第二のMLPが処理を行う。
  • 入力特徴はMFCC(C0–C12)にエネルギーを加えたもので、フレームごとに正規化され、25msのハミング窓と10msのシフトを用いて49フレームの文脈ウィンドウが適用される。
  • 最初のネットワークの前段で離散コサイン変換(DCT)による次元削減を実施し、時間的相関を低減する。
  • 最初のネットワークはReLU活性化関数とソフトマックス出力層を用い、後続確率を出力する。第二のネットワークはこれらの後続確率を処理し、長時間の依存関係をモデル化する。
  • 深層構造における学習安定性と性能向上を図るため、制限付きボルツマンマシン(RBM)を用いた事前学習を実施する。
  • H-DNNはバックプロパゲーションを用いてエンドツーエンドで学習され、TRECVID-MEDデータセットにおけるフレーム単位の正答率(F.A.)で評価される。

実験結果

リサーチクエスチョン

  • RQ1階層的ディープニューラルネットワークは、従来のGMMや標準的なDNNに比べ、ユーザーアップロード動画からの音声コンセプト分類において優れた性能を示せるか?
  • RQ2短時間と長時間の両方の文脈モデリングを組み合わせることで、現実世界の制御不能な音声環境における音声コンセプト分類精度が向上するか?
  • RQ3層数、ニューロン数、事前学習、文脈ウィンドウサイズといったアーキテクチャ選択が、このタスクの性能に与える影響は何か?
  • RQ4H-DNNの後続確率は、上位レベルのマルチメディアイベント検出のための効果的特徴として機能できるか?
  • RQ5同じ深さを持つ標準的なDNNはなぜ収束しないのか?階層的設計は次元の呪いを緩和できるか?

主な発見

  • H-DNNはTRECVID-MEDデータセットでフレーム単位の分類精度36.93%を達成し、GMMベースライン(24.07%)に対して54%の相対的向上を示した。
  • 最良のDNNベースライン(32.96%)に対して12%の相対的向上を達成した。
  • 49フレームの文脈ウィンドウとDCTに基づく次元削減の組み合わせが性能向上に顕著に寄与し、文脈ウィンドウ、DCT、RBM事前学習、階層的処理のすべてを組み合わせた際の向上が最大であった。
  • RBMによる事前学習は、深く広いアーキテクチャにおいてのみ性能向上をもたらし、特に1層あたり2000ニューロンの3層ネットワークで顕著な向上が観察された。
  • 同じ深さを持つ単一の深層ネットワークに比べ、H-DNNアーキテクチャはより頑健であった。後者は次元の呪いと局所的最小値の問題により収束しなかった。
  • 特定のコンセプトでは顕著な性能向上が確認された:風(63% vs. 51%)、会話(68% vs. 58%)、金属音(73% vs. 53%)、エンジン音(6% vs. 3%)、多様な音声イベントにおいて一貫した向上が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。