Skip to main content
QUICK REVIEW

[論文レビュー] Large-scale weakly supervised audio classification using gated convolutional neural network

Yong Xu, Qiuqiang Kong|View|Oct 1, 2017
Music and Audio Processing参考文献 13被引用数 13
ひとこと要約

本論文は、ログメルスペクトログ램と学習可能なゲート型線形ユニット(GLUs)を用いて関連する音声特徴に動的に注目することができる、時系列アテンションを備えたゲート型畳み込み再帰ニューラルネットワーク(Gated-CRNN)を提案する。この手法は、時系列アノテーションのない弱教師ありYouTube音声データに対して、大規模な弱教師あり音声分類で優れた性能を示し、DCASE 2017の音声タギングサブタスクで1位(F1: 55.6%)および弱教師あり音声イベント検出で2位(等誤差率: 0.73)を達成した。

ABSTRACT

In this paper, we present a gated convolutional neural network and a temporal attention-based localization method for audio classification, which won the 1st place in the large-scale weakly supervised sound event detection task of Detection and Classification of Acoustic Scenes and Events (DCASE) 2017 challenge. The audio clips in this task, which are extracted from YouTube videos, are manually labeled with one or a few audio tags but without timestamps of the audio events, which is called as weakly labeled data. Two sub-tasks are defined in this challenge including audio tagging and sound event detection using this weakly labeled data. A convolutional recurrent neural network (CRNN) with learnable gated linear units (GLUs) non-linearity applied on the log Mel spectrogram is proposed. In addition, a temporal attention method is proposed along the frames to predicate the locations of each audio event in a chunk from the weakly labeled data. We ranked the 1st and the 2nd as a team in these two sub-tasks of DCASE 2017 challenge with F value 55.6\% and Equal error 0.73, respectively.

研究の動機と目的

  • 時間的イベント境界が提供されていないが、音声タグのみが与えられる弱教師ありデータを用いた大規模音声分類の課題に対処すること。
  • 標準的なCNNやRNNが短時間の音声イベントに注目する能力に制限を受けるのを克服するため、学習可能なアテンション機構を導入すること。
  • 時間的アノテーションを必要とせずに、音声タギングと弱教師あり音声イベント検出を統合的に実行する深層学習フレームワークを構築すること。
  • CRNNアーキテクチャにゲート型線形ユニット(GLUs)と時系列アテンションモジュールを統合することで、特徴表現と局所化精度を向上させること。

提案手法

  • ターゲット音声イベントに関連する単位に動的に注目できるように、畳み込み層の活性化関数をReLUから学習可能なゲート型線形ユニット(GLUs)に置き換える。
  • 生の音声波形をログメルスペクトログラムに変換し、64フィルタと3×3カーネルサイズを有する3段のゲート型畳み込みブロックに通す。
  • タスク(音声タギング対S.E.D.)に応じて2×2または1×2のカーネルサイズを用いたマックスプーリングを適用した後、128ユニットの双方向ゲート型再帰ネットワーク(Bi-GRU)を用いて長距離時系列依存性をモデル化する。
  • フレームごとのアテンション重みを生成する時系列アテンション機構を導入し、音声イベントをチャンク内に局所化可能にすることで、真のタイムスタンプがなくても弱教師あり検出が可能になる。
  • Adam最適化を用い、バイナリクロスエントロピー損失関数で学習を行い、クラス不均衡の改善のためミニバッチデータバランスを適用する。
  • ログメルとMFCC特徴量で学習したモデルのファージョンにより一般化性能が向上し、両サブタスクで最先端の結果が得られた。

実験結果

リサーチクエスチョン

  • RQ1学習可能なゲート型線形ユニット(GLUs)は、関連する時間周波数ユニットに注目することで、音声分類における特徴表現を向上させることができるか?
  • RQ2時間的アノテーションが一切ない音声タグのみを用いて、統合的な深層学習モデルが音声タギングと弱教師あり音声イベント検出の両方を効果的に実行できるか?
  • RQ3再帰層の後に適用される時系列アテンション機構は、弱教師ありデータにおける短時間音声イベントの局所化精度を向上させるか?
  • RQ4提案されたGated-CRNNは、DCASE 2017チャレンジにおけるF1スコアおよび誤差率の観点から、ベースラインモデルと比較してどのように優れているか?

主な発見

  • ログメルスペクトログラムを用いた提案されたGated-CRNNは、音声タギングサブタスクにおいて評価セットでF1スコア55.6%を達成し、DCASE 2017チャレンジで1位となった。
  • ログメルとMFCC特徴量で学習したGated-CRNNモデルのファージョンは、音声タギングタスクでF1スコア57.7%を達成し、2位のシステムを3ポイント上回った。
  • 弱教師あり音声イベント検出において、Gated-CRNNシステムは等誤差率(EER)0.73およびF1スコア51.8%を達成し、参加チームの中で2位となった。
  • 時系列アテンション機構は、'train'や'train horn'などの音声イベントを高い精度で局所化できたが、短いセグメントではわずかな誤検出が発生した。
  • ミニバッチデータバランスの適用により、F1、適合率、再現率のスコアが顕著に向上し、弱教師あり音声データにおけるクラス不均衡の対処においてその重要性が示された。
  • S.E.D.サブタスクにおいて、DCASE 2017のベースライン(F1: 28.4%)を20ポイント以上上回った。これは、提案されたアーキテクチャとアテンション機構の有効性を確認するものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。