Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Window Data Augmentation Approach for Speech Emotion Recognition

Sarala Padi, Dinesh Manocha|arXiv (Cornell University)|Oct 19, 2020
Emotion and Mood Recognition参考文献 39被引用数 5
ひとこと要約

本稿では、学習データが限られているため発生する過学習を緩和する目的で、複数の窓サイズを用いて音声特徴を抽出することで、モデルの一般化性能を向上させるマルチウインドウデータ拡張(MWA-SER)手法を提案する。複数スケールのウインドウ処理により追加の訓練サンプルを生成することで、IEMOCAP、SAVEE、RAVDESSの各データセットにおいて性能が向上し、単一窓ベースラインと比較してSAVEEでは最大14%、IEMOCAPでは6%の精度向上を達成した。

ABSTRACT

We present a Multi-Window Data Augmentation (MWA-SER) approach for speech emotion recognition. MWA-SER is a unimodal approach that focuses on two key concepts; designing the speech augmentation method and building the deep learning model to recognize the underlying emotion of an audio signal. Our proposed multi-window augmentation approach generates additional data samples from the speech signal by employing multiple window sizes in the audio feature extraction process. We show that our augmentation method, combined with a deep learning model, improves speech emotion recognition performance. We evaluate the performance of our approach on three benchmark datasets: IEMOCAP, SAVEE, and RAVDESS. We show that the multi-window model improves the SER performance and outperforms a single-window model. The notion of finding the best window size is an essential step in audio feature extraction. We perform extensive experimental evaluations to find the best window choice and explore the windowing effect for SER analysis.

研究の動機と目的

  • 音声感情認識(SER)の深層学習モデルにおける過学習を、限られた訓練データの影響で緩和すること。
  • 窓サイズの選定が音声特徴抽出およびSER性能に与える影響を調査すること。
  • 複雑な生成モデルに依存せずに、多様で情報量の多い訓練サンプルを生成するデータ拡張戦略を開発すること。
  • 一貫した実験設定のもとで、複数のベンチマークデータセット(IEMOCAP、SAVEE、RAVDESS)に対して提案手法を評価すること。
  • 異なるデータセットおよび感情カテゴリにおいて、感情認識を向上させる最適な窓サイズの組み合わせを特定すること。

提案手法

  • 本手法は音声特徴抽出においてマルチウインドウアプローチを採用し、25ms、50ms、100ms、200msの窓サイズを用いて複数の時間スケールでの特徴を生成する。
  • 各窓サイズが別個の特徴セットを生成するため、使用した窓サイズの数に等しい割合で訓練サンプル数が増加する。
  • 1次元畳み込みニューラルネットワーク(CNN)を、拡張された特徴セット上で学習させ、音声信号からの感情分類を実行する。
  • 本手法は、IEMOCAP、SAVEE、RAVDESSという3つのベンチマークデータセットに適用され、モデルアーキテクチャおよび訓練プロトコルを一貫して使用する。
  • 本手法はGANや複雑な信号変換に依存せず、窓処理による信号の内在的変動に焦点を当てる。
  • 異なる組み合わせ(例:3ウインドウ、4ウインドウ)を用いてウインドウ処理戦略を評価し、各データセットごとの最適な設定を同定する。

実験結果

リサーチクエスチョン

  • RQ1マルチウインドウデータ拡張は、単一窓特徴抽出と比較して、SER性能にどのように影響するか?
  • RQ2異なるデータセットにおいて感情認識精度を最大化するための最適な窓サイズの組み合わせは何か?
  • RQ3ウインドウ処理の影響は、SERにおける抽出特徴の識別能力にどのように現れるか?
  • RQ4なぜ特定の感情クラス(例:'happy' や 'excited')は特に高い誤分類率を示すのか?また、マルチウインドウ処理はこの現象にどのように影響するか?
  • RQ5マルチウインドウ拡張は、信号長や感情分布が異なる多様なデータセットに一般化可能か?

主な発見

  • IEMOCAPデータセットでは、マルチウインドウモデルが単一窓ベースラインと比較して、精度で6%、WAPで9%、WAF1で7%の向上を達成した。
  • SAVEEデータセットでは、マルチウインドウアプローチが精度で14%、WAPで7%、WAF1で12%の向上を示し、特にこのデータセットで顕著な性能向上が確認された。
  • RAVDESSデータセットでは、マルチウインドウモデルが精度、WAP、WAF1ともに2%ずつ向上し、IEMOCAPやSAVEEと比較して一貫したがやや控えめな向上を示した。
  • 'happy' および 'excited' クラスは、特にIEMOCAPにおいて 'neutral' と頻繁に混同され、短い持続時間と重複する発話特徴が原因である。
  • 'sad' および 'neutral' クラスは、3つのデータセットすべてで高い誤分類率を示しており、プロソディックおよびスペクトル的特徴に内在的な類似性があることが示唆された。
  • 最適な窓サイズの組み合わせはデータセットごとに異なり、IEMOCAP(Exp 1)では50、100、200ms、IEMOCAP(Exp 2)では25、50、100ms、SAVEEでは100および200ms、RAVDESSでは25、50、100、200msが最適であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。