Skip to main content
QUICK REVIEW

[論文レビュー] Learning spectro-temporal features with 3D CNNs for speech emotion recognition

Jaebok Kim, Khiet P. Truong|arXiv (Cornell University)|Aug 14, 2017
Emotion and Mood Recognition参考文献 23被引用数 9
ひとこと要約

本稿では、スプライストラム・テンポラル特徴を共同で学習するための3次元畳み込みニューラルネットワーク(3D CNN)を提案する。この手法は、パラメータ数を減らしながら周波数的および時間的ダイナミクスをモデル化でき、2D-CNN-LSTMハイブリッド手法を上回る性能を発揮する。大規模かつ多様な話者独立データセットにおいて優れた性能を示し、特徴空間におけるクラス分離性が向上し、ニュートラルと怒りの間の誤りが顕著に減少する。

ABSTRACT

In this paper, we propose to use deep 3-dimensional convolutional networks (3D CNNs) in order to address the challenge of modelling spectro-temporal dynamics for speech emotion recognition (SER). Compared to a hybrid of Convolutional Neural Network and Long-Short-Term-Memory (CNN-LSTM), our proposed 3D CNNs simultaneously extract short-term and long-term spectral features with a moderate number of parameters. We evaluated our proposed and other state-of-the-art methods in a speaker-independent manner using aggregated corpora that give a large and diverse set of speakers. We found that 1) shallow temporal and moderately deep spectral kernels of a homogeneous architecture are optimal for the task; and 2) our 3D CNNs are more effective for spectro-temporal feature learning compared to other methods. Finally, we visualised the feature space obtained with our proposed method using t-distributed stochastic neighbour embedding (T-SNE) and could observe distinct clusters of emotions.

研究の動機と目的

  • ディープラーニングを用いて、音声感情認識(SER)におけるスペクトロトランスパーサルダイナミクスをモデル化する課題に対処すること。
  • 手作業で作成された特徴に依存することを軽減し、多様で大規模な話者独立データセットにおける一般化性能を向上させること。
  • 3D CNNが、中程度のパラメータ数で短期的および長期的な周波数的および時間的特徴を効果的に学習できるかどうかを評価すること。
  • 現実的で「野生の状況」に近い環境下で、3D CNNの性能を最先端の手法(例:CNN-LSTM や DNN-ELM)と比較すること。
  • t-SNEを用いて学習された特徴の判別力の可視化と分析を行うこと。

提案手法

  • 本手法は、周波数、時間、チャネルの3次元テンソルとして扱うことで、2次元スペクトログ램スライスの系列を3D CNNで処理し、周波数的および時間的パターンの共同学習を可能にする。
  • モデルは、誘導的バイアスとモデル容量のバランスを取るために、浅い時間的カーネルと中程度の深さの周波数的カーネルを有する同種の層を採用する。
  • t-SNE可視化と分類のため、ソフトマックス分類器の前の最終全結合層から発話単位の特徴を抽出する。
  • モデルは、IEMOCAP、SEMAINE、RECOLA など7つの統合コーパスを含む話者独立設定で訓練および評価される。
  • 統計的有意性は、ペアド t 検定からの p 値を用いて評価され、クラスごとの性能は混同行列を報告する。
  • t-SNE を用いて高次元特徴空間を可視化し、感情カテゴリに対応するクラスタ構造が明確に現れる。

実験結果

リサーチクエスチョン

  • RQ1中程度のパラメータ数で、3D CNNは音声感情認識のためのスペクトロトランスパーサル特徴を効果的に学習できるか?
  • RQ2特に、浅い時間的カーネルと深い周波数的カーネルのアーキテクチャ設計が、SERにおける性能にどのように影響を与えるか?
  • RQ33D CNNを用いた特徴学習は、話者独立なSERにおいて、CNN-LSTM や他のディープラーニングベースラインを上回るか?
  • RQ4t-SNEによる可視化から、学習された特徴がどの程度クラス判別性を示すか?
  • RQ5本モデルは、現実世界の「野生の状況」に近い、不均衡でマルチコーパスのデータセットにおいて、どの程度の性能を発揮するか?

主な発見

  • 同種の3D CNNアーキテクチャにおいて、浅い時間的カーネルと中程度の深さの周波数的カーネルを組み合わせた構成が、調査された設定の中で最適な性能を達成する。
  • 3D CNNモデルは、2D-CNN-LSTM-DNNと比較して、「ニュートラル」と「怒り」の間の誤りを28%、および「ニュートラル」と「悲しみ」の間の誤りを17%減少させる。
  • 3D CNN-DNNモデルは、評価されたすべての手法の中で最高の分類精度を達成し、DNN-ELM や LSTM-ELM、2D-CNN-LSTM-DNN を上回る。
  • t-SNEの可視化から、3D CNNはそれぞれの感情クラス(ニュートラル、ハッピー、悲しみ、怒り)に対して、より判別性が高く、明確に分離されたクラスタを学習していることが示された。
  • 再帰的メモリ機構を有する2D-CNN-LSTMと比較して、3D CNNはスペクトロトランスパーサル特徴学習において、より効果的かつ効率的である。
  • 本モデルは、多様で現実世界のコーパスを含む大規模な話者独立評価環境でも、強力な一般化可能性を示し、頑健であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。