Skip to main content
QUICK REVIEW

[論文レビュー] Speech Emotion Recognition with Multiscale Area Attention and Data Augmentation

Mingke Xu, Fan Zhang|arXiv (Cornell University)|Feb 3, 2021
Speech and Audio Processing参考文献 22被引用数 4
ひとこと要約

本稿では、音声感情認識(SER)のためのマルチスケール領域注意メカニズムと声帯路長摂動(VTLP)を組み合わせた手法を提案する。本手法は、異なる空間的粒度における特徴表現を強化し、データ拡張によるロバスト性を向上させる。IEMOCAPデータセットにおいて、重み付き正確度79.34%、不加重正確度77.54%を達成し、新たな最先端性能を樹立した。

ABSTRACT

In Speech Emotion Recognition (SER), emotional characteristics often appear in diverse forms of energy patterns in spectrograms. Typical attention neural network classifiers of SER are usually optimized on a fixed attention granularity. In this paper, we apply multiscale area attention in a deep convolutional neural network to attend emotional characteristics with varied granularities and therefore the classifier can benefit from an ensemble of attentions with different scales. To deal with data sparsity, we conduct data augmentation with vocal tract length perturbation (VTLP) to improve the generalization capability of the classifier. Experiments are carried out on the Interactive Emotional Dyadic Motion Capture (IEMOCAP) dataset. We achieved 79.34% weighted accuracy (WA) and 77.54% unweighted accuracy (UA), which, to the best of our knowledge, is the state of the art on this dataset.

研究の動機と目的

  • 固定粒度の注意機構に起因するSERモデルの限界を是正すること。これは、スペクトログラムのスケールに応じた多様な感情エネルギーパターンを捉え損なう可能性があるため。
  • IEMOCAPデータセットにVTLPに基づくデータ拡張を適用することで、低データ環境下におけるモデルの汎化性能を向上させること。
  • 複数の空間的粒度で感情特徴に動的に注目できる、新規のマルチスケール領域注意メカニズムの開発。
  • 音声感情認識におけるIEMOCAPベンチマークで最先端の性能を達成すること。

提案手法

  • スペクトログラム表現における可変サイズの領域(例:1×1、2×2、3×3、4×4)に対して注目を計算するマルチスケール領域注意メカニズムを導入。これにより、局所的および広範な感情的キューを両方注目可能となる。
  • 特徴マップから得られるクエリ、キー、バリュー行列を用いて自己注意機構を変更。注意スコアはスケーリングされたドット積注意に基づくソフトマックスで計算される。
  • 声帯路長を摂動させることで訓練データを拡張するVTLPを適用。感情ラベルを保持しつつ、データの多様性とロバスト性を向上させる。
  • バッチ正規化を施した5層のCNNに続き、注意層と全結合層を用いた分類器を採用。入力としてlogMelスペクトログラムを用いる。
  • キーにはMax、Mean、Sample(摂動済み平均)を、バリューにはMax、Mean、Sumを用い、最適な注意表現を探索。
  • アブレーションスタディを実施し、注目タイプ、VTLP、領域サイズ、特徴選択の各要因がモデル正確度に与える影響を評価。

実験結果

リサーチクエスチョン

  • RQ1スペクトログラムにおける異なる空間的粒度で感情パターンを捉えることで、マルチスケール領域注意がSER性能を向上させ得るか?
  • RQ2VTLPに基づくデータ拡張は、リソースが限られたSER環境においてモデルの汎化性能と正確度を向上させるか?
  • RQ3マルチスケール領域注意における最適な最大領域サイズと特徴コンビネーション(例:Max、Mean、Sample)は何か?
  • RQ4マルチスケール注意とデータ拡張の統合は、IEMOCAPデータセットにおいて先行する最先端モデルと比較して優れているか?

主な発見

  • 提案されたマルチスケール領域注意メカニズムは、IEMOCAPデータセットで79.34%の重み付き正確度と77.54%の不加重正確度を達成し、文献に報告されたすべての先行手法を上回った。
  • VTLPデータ拡張は、マルチスケール領域注意と組み合わせた場合、正確度を約0.5%絶対値上昇させ、リソースが限られた状況下での有効性を示した。
  • VTLPで拡張されたデータで学習した場合、最適な最大領域サイズは3×3であったが、元のデータで学習した場合は4×4が最良であった。これは、データ分布に敏感であることを示唆している。
  • キー特徴にSample、バリュー特徴にMaxを組み合わせた場合、正確度が78.44%に達し、最高となった。これは、キー計算における確率的摂動がモデルのロバスト性を向上させることを示している。
  • アブレーションスタディの結果、マルチスケール領域注意とVTLPの両方が性能向上に顕著な寄与をしていることが確認され、最良のモデルでは79.34%のWAと77.54%のUAを達成した。
  • 特徴マップの可視化結果から、領域注意は標準的なCNNと比較して、より広範な時間的文脈を捉えていることが分かった。これは、長期的な感情パターンの認識に有益である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。