Skip to main content
QUICK REVIEW

[論文レビュー] Learning audio sequence representations for acoustic event classification

Zixing Zhang, Ding Liu|arXiv (Cornell University)|Jul 27, 2017
Music and Audio Processing参考文献 32被引用数 13
ひとこと要約

本稿では、音声イベント分類(AEC)のための可変長音声系列の固定長ベクトル表現を学習する非教師あり再帰的オートエンコーダフレームワークを提案する。双方向RNNエンコーダ・デコーダを入力系列の再構築に訓練させることで、顕著な時間的パターンを捉え、GRU-RNNを用いた際には229個の音声イベントクラスで47.7%のF1スコア、39.0%の未加重正答率(UA)を達成し、最先端性能を示した。これは、手作業で設計された特徴量よりも顕著に優れている。

ABSTRACT

Acoustic Event Classification (AEC) has become a significant task for machines to perceive the surrounding auditory scene. However, extracting effective representations that capture the underlying characteristics of the acoustic events is still challenging. Previous methods mainly focused on designing the audio features in a `hand-crafted' manner. Interestingly, data-learnt features have been recently reported to show better performance. Up to now, these were only considered on the frame level. In this article, we propose an unsupervised learning framework to learn a vector representation of an audio sequence for AEC. This framework consists of a Recurrent Neural Network (RNN) encoder and an RNN decoder, which respectively transforms the variable-length audio sequence into a fixed-length vector and reconstructs the input sequence on the generated vector. After training the encoder-decoder, we feed the audio sequences to the encoder and then take the learnt vectors as the audio sequence representations. Compared with previous methods, the proposed method can not only deal with the problem of arbitrary-lengths of audio streams, but also learn the salient information of the sequence. Extensive evaluation on a large-size acoustic event database is performed, and the empirical results demonstrate that the learnt audio sequence representation yields a significant performance improvement by a large margin compared with other state-of-the-art hand-crafted sequence features for AEC.

研究の動機と目的

  • 可変長音声系列に対する堅牢で判別的な表現を学ぶという課題に対処すること。
  • 環境の変化に敏感で、しばしば手動でのチューニングを要する、従来の手作業特徴量の限界を克服すること。
  • カテゴリラベルなしで大規模なラベルなし音声データを活用できる非教師あり表現学習フレームワークを構築すること。
  • AECに不可欠な長距離時間的依存関係を捉えた、エンドツーエンドのシーケンスレベル表現の学習を可能にすること。

提案手法

  • シーケンス・ツー・シーケンスのオートエンコーダアーキテクチャを用い、双方向RNNエンコーダと単方向RNNデコーダで構成される。
  • エンコーダは、可変長の入力音声系列(特徴量ベクトル形式)を固定長のボトルネックベクトル表現にマップする。
  • デコーダは、学習済みのベクトル表現から元の系列を再構築し、分類ラベルが一切不要な再構築損失によってモデルを訓練する。
  • オートエンコーダの入力には、元の特徴量系列に加え、逆順の系列も含め、時間的パターンの学習を強化する。
  • 確率的勾配降下法を用いてエンドツーエンドで訓練され、ボトルネック層の出力を最終的な音声系列表現として使用する。
  • 訓練後、エンコーダを用いて新たな音声系列から固定長表現を抽出し、後続の分類タスクに活用する。

実験結果

リサーチクエスチョン

  • RQ1非教師ありディープラーニングフレームワークは、音声イベント分類のための可変長音声系列に対して、コンactで情報豊富な表現を効果的に学習できるか?
  • RQ2学習されたシーケンス表現の性能は、MFCC、eGeMAPS、AVEC11といった従来の手作業特徴量と比べてどの程度優れているか?
  • RQ3特に訓練データが少ないクラスを含む多様な音声イベントクラスに、提案手法はどの程度一般化可能か?
  • RQ4学習された表現は、フレームレベル特徴量や固定長プーリング戦略と比較して、長距離時間的依存関係をより効果的に捉えられるか?

主な発見

  • 提案手法は、GRU-RNNを用いて229個の音声イベントクラスで47.7%のF1スコアおよび39.0%の未加重正答率(UA)を達成し、すべての手作業特徴量セットを顕著に上回った。
  • 検証されたRNNベースのオートエンコーダの変種の中で、ED:2048-1設定が最良の性能を示し、一部の指標では2D-CNNやアテンションベースのモデルでさえも上回った。
  • 学習された表現は、SVMおよびGRU-RNN分類器の両方において、BoAW、eGeMAPS、AVEC11、ComParE13といったベースライン特徴量を一貫して上回った。
  • LDAを用いた可視化により、学習された表現空間で明確なクラス分離が確認され、効果的な判別的学習が行われたことが示された。
  • フレームワークは可変長入力に対して堅牢であり、長大な系列をキーワードの特徴を保持したまま固定次元のベクトルに効果的に圧縮できた。
  • 結果から、シーケンス再構築による非教師あり事前学習は、AECにおける汎用的音声表現を学習する強力な戦略であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。