Skip to main content
QUICK REVIEW

[論文レビュー] An Ensemble 1D-CNN-LSTM-GRU Model with Data Augmentation for Speech Emotion Recognition

Md. Rayhan Ahmed, Salekul Islam|arXiv (Cornell University)|Dec 10, 2021
Speech and Audio Processing被引用数 11
ひとこと要約

本論文は、データ拡張を組み合わせた1D-CNN、LSTM、GRUアーキテクチャを統合したアンサンブル深層学習モデルを提案し、スティーブト・エモーショナル・レコognitionの精度を向上させることを目的としている。局所的特徴抽出ブロック(LFAB)を用いて、拡張畳み込み、バッチ正規化、マックスプーリングを実装し、LSTMおよびGRUによる長期的時系列モデリングを統合することで、手動で作成された音声特徴とノイズ/ピッチ/スケール変更のデータ拡張を用いることで過学習を低減し、TESS、EMO-DB、RAVDESS、SAVEE、CREMA-Dの5つのベンチマークデータセットにおいて、最先端の加重平均正答率を達成した。

ABSTRACT

In this paper, we propose an ensemble of deep neural networks along with data augmentation (DA) learned using effective speech-based features to recognize emotions from speech. Our ensemble model is built on three deep neural network-based models. These neural networks are built using the basic local feature acquiring blocks (LFAB) which are consecutive layers of dilated 1D Convolutional Neural networks followed by the max pooling and batch normalization layers. To acquire the long-term dependencies in speech signals further two variants are proposed by adding Gated Recurrent Unit (GRU) and Long Short Term Memory (LSTM) layers respectively. All three network models have consecutive fully connected layers before the final softmax layer for classification. The ensemble model uses a weighted average to provide the final classification. We have utilized five standard benchmark datasets: TESS, EMO-DB, RAVDESS, SAVEE, and CREMA-D for evaluation. We have performed DA by injecting Additive White Gaussian Noise, pitch shifting, and stretching the signal level to generalize the models, and thus increasing the accuracy of the models and reducing the overfitting as well. We handcrafted five categories of features: Mel-frequency cepstral coefficients, Log Mel-Scaled Spectrogram, Zero-Crossing Rate, Chromagram, and statistical Root Mean Square Energy value from each audio sample. These features are used as the input to the LFAB blocks that further extract the hidden local features which are then fed to either fully connected layers or to LSTM or GRU based on the model type to acquire the additional long-term contextual representations. LFAB followed by GRU or LSTM results in better performance compared to the baseline model. The ensemble model achieves the state-of-the-art weighted average accuracy in all the datasets.

研究の動機と目的

  • アンサンブルフレームワーク内で複数のディープニューラルネットワークアーキテクチャを統合することで、スティーブト・エモーショナル・レコognitionの正答率を向上させること。
  • 追加白色ガウスノイズ、ピッチシフト、信号ストレッチなどの有効なデータ拡張技術を用いて、過学習を軽減し、モデルの汎化性能を向上させること。
  • 拡張1D畳み込み、バッチ正規化、マックスプーリングを備えた新規の局所的特徴抽出ブロック(LFAB)を用いて、音声からロバストな局所的および長期的時系列特徴を抽出すること。
  • TESS、EMO-DB、RAVDESS、SAVEE、CREMA-Dを含む多様で標準的なベンチマークデータセットにおいて、モデルの性能を評価すること。
  • 1D-CNN + LSTM/GRUのハイブリッドアーキテクチャが、単体モデルに比べて、感情分類のための局所的および順序的な音声パターンをより効果的に捉えられることを実証すること。

提案手法

  • モデルは、連続する拡張1D畳み込み層、その後にマックスプーリングとバッチ正規化を配置した局所的特徴抽出ブロック(LFAB)で構成され、生の音声から階層的な局所的特徴を抽出する。
  • 3つの異なるモデルを構築:1つは全結合層のみ、1つはGRU、1つはLSTMを用い、それぞれLFABが抽出した特徴を処理して長期依存性をモデル化する。
  • 3つのモデルの出力を重み付き平均化するアンサンブル戦略を適用し、最終的な分類性能を向上させる。
  • メル周波数ケプストラム係数、ログメルスケールスペクトログラム、ゼロクロッシングレート、クロマグラム、ルート平均二乗エネルギーという5つの手作業特徴が抽出され、LFABブロックへの入力として使用される。
  • 追加白色ガウスノイズ、ピッチシフト、時間ストレッチを用いてデータ拡張が実施され、トレーニングデータの多様性を高め、過学習を低減する。
  • アンサンブル出力に対してソフトマックス層を用いて最終分類が実施され、モデル重みは標準的な誤差逆伝播法により最適化される。

実験結果

リサーチクエスチョン

  • RQ11D-CNN、LSTM、GRUのアンサンブルは、個々のアーキテクチャに比べ、スティーブト・エモーショナル・レコognitionの正答率を向上させることができるか?
  • RQ2拡張畳み込みを備えた局所的特徴抽出ブロック(LFAB)の統合は、音声信号からの特徴抽出を向上させるか?
  • RQ3ノイズ注入、ピッチシフト、時間ストレッチによるデータ拡張は、スティーブト・エモーショナル・レコognitionにおけるモデルの汎化性能向上と過学習低減にどの程度寄与するか?
  • RQ4同じ特徴抽出バックボーンを用いた場合、LSTMとGRUの異なる組み合わせが、多様なスティーブト・エモーショナル・レコognitionデータセットにおける性能にどのように影響を与えるか?
  • RQ5提案されたアンサンブルモデルは、TESS、EMO-DB、RAVDESS、SAVEE、CREMA-Dを含む複数のベンチマークデータセットで最先端の性能を達成するか?

主な発見

  • アンサンブルモデルは、すべての5つのベンチマークデータセット(TESS、EMO-DB、RAVDESS、SAVEE、CREMA-D)において、最先端の加重平均正答率を達成した。
  • LFABに続くGRUまたはLSTMを備えたモデルは、再帰層を含まないベースラインモデルよりも優れた性能を示し、長期的時系列依存性のモデリングの重要性を裏付けた。
  • データ拡張は過学習を顕著に低減し、特にSAVEEやCREMA-Dのような小さなデータセットにおいてモデルの汎化性能を向上させた。
  • メル周波数ケプストラム係数、ログメルスケールスペクトログラム、ゼロクロッシングレート、クロマグラム、RMSエネルギーといった手作業特徴の使用は、モデル性能の向上に有効であることが実証された。
  • 重み付き平均化アンサンブル戦略は、3つのモデルの予測を効果的に統合し、単体モデルよりもよりロバストで正確な分類を実現した。
  • RAVDESSデータセットでは、これまで報告された最高の正答率を達成し、加重平均正答率が以前の最先端手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。