Skip to main content
QUICK REVIEW

[論文レビュー] Learning Representations of Affect from Speech

Sayan Ghosh, Eugene Laksana|arXiv (Cornell University)|Nov 15, 2015
Emotion and Mood Recognition参考文献 18被引用数 16
ひとこと要約

本論文では、ノイズ除去および再帰的オートエンコーダーを用いて、生の音声スペクトログラムから、活性化強度や価値(valence)といったパラリンギスティックな感情的属性の判別性のある教師なし表現を学習することを提案する。最も優れたモデル(128 FFTバイナリー、5フレームの時間的文脈を有する重み共有スタックドオートエンコーダー)は、IEMOCAPデータセットにおける4クラスの感情認識で48.10%の重み付き正解率を達成し、標準的な特徴抽出手法を上回り、最先端の手法と同等の性能を示した。

ABSTRACT

There has been a lot of prior work on representation learning for speech recognition applications, but not much emphasis has been given to an investigation of effective representations of affect from speech, where the paralinguistic elements of speech are separated out from the verbal content. In this paper, we explore denoising autoencoders for learning paralinguistic attributes i.e. categorical and dimensional affective traits from speech. We show that the representations learnt by the bottleneck layer of the autoencoder are highly discriminative of activation intensity and at separating out negative valence (sadness and anger) from positive valence (happiness). We experiment with different input speech features (such as FFT and log-mel spectrograms with temporal context windows), and different autoencoder architectures (such as stacked and deep autoencoders). We also learn utterance specific representations by a combination of denoising autoencoders and BLSTM based recurrent autoencoders. Emotion classification is performed with the learnt temporal/dynamic representations to evaluate the quality of the representations. Experiments on a well-established real-life speech dataset (IEMOCAP) show that the learnt representations are comparable to state of the art feature extractors (such as voice quality features and MFCCs) and are competitive with state-of-the-art approaches at emotion and dimensional affect recognition.

研究の動機と目的

  • 音声における感情的およびパラリンギスティックな属性の教師なし表現学習を調査し、MFCCなどの標準的特徴抽出手法を越えることを目的とする。
  • オートエンコーダーが、分類的感情(例:怒り、喜び、悲しみ、ニュートラル)および次元的感情(活性化、価値)の判別性のある表現を学習できるかどうかを評価すること。
  • 感情表現学習のための異なるスペクトログラムタイプ(FFT、ログメル)、時間的文脈窓、およびオートエンコーダー構造(スタックド、ディープ、重み共有/非共有)を比較すること。
  • ノイズ除去オートエンコーダーとBLSTMベースの再帰的オートエンコーダーを組み合わせることで、発話レベルの感情表現を学習する有効性を検討すること。
  • IEMOCAPデータセットを用いた発話者独立のクロスバリデーションプロトコルにより、下流の感情分類タスクを通じて学習された表現の質を評価すること。

提案手法

  • ノイズを入力に追加した音声スペクトログラム(FFTおよびログメル)を対象に、tanh活性化関数を用いた順方向ネットワークを介して低次元のボトルネック表現を学習するノイズ除去オートエンコーダーを訓練する。
  • パrameter数の削減と正則化の役割を果たすために、重み共有(W = W′^T)を用い、再構成誤差を最小化するバックプロパゲーションにより訓練する。
  • 時間的文脈を統合するために、入力スペクトログラムに5フレームのスライディングウインドウを適用し、系列情報の符号化を実現する。
  • スタックドおよびディープオートエンコーダー構造を評価し、保留済みの検証セット上で最良の構成(TIED-128-5)を選定する。
  • 最良のスペクトログラム・オートエンコーダー構成からの活性化を対象に、BLSTM-RNNを再帰的オートエンコーダーとして訓練し、系列レベルの表現を学習する。
  • BLSTMエンコーダーから発話レベルの表現を抽出し、それをマルチレイヤーパーセプトロン(MLP)の初期化に用いることで、感情分類を実行する。

実験結果

リサーチクエスチョン

  • RQ1ノイズ除去オートエンコーダーは、生の音声スペクトログラムから分類的および次元的感情的特徴の判別性のある表現を効果的に学習できるか?
  • RQ2異なるスペクトログラムタイプ(FFT対ログメル)および時間的文脈窓は、学習された感情表現の質にどのように影響するか?
  • RQ3スタックドオートエンコーダーにおける重み共有は、非共有重みと比較して表現品質を向上させるか?
  • RQ4再帰的オートエンコーダー(特にBLSTM-RNN)は、順方向オートエンコーダーと比較して、動的で発話レベルの感情パターンをより効果的に捉えられるか?
  • RQ5学習された表現は、標準的特徴抽出手法(例:MFCC、プロソディック特徴)と比較して、下流の感情分類タスクでどのように性能を示すか?

主な発見

  • 最良の性能を示したのはTIED-128-5構成(128 FFTバイナリー、5フレームの文脈、重み共有)であり、検証セット上で選定された最適モデルとなった。
  • ボトルネック層の表現は、活性化強度に対して非常に判別性が高く、高活性化感情(怒り、興奮)と低活性化感情(悲しみ)を効果的に分離していた。
  • 表現はまた、否定的価値(怒り、悲しみ)と肯定的価値(喜び)の分離にも効果的に機能しており、感情のセンチメントに敏感であることが示された。
  • 最終的なMLP分類器は、事前学習済みオートエンコーダー重みを初期化に用い、5-fold leave-one-session-outクロスバリデーションスキームを用いてIEMOCAPデータセットで48.10%の重み付き正解率を達成した。
  • 非事前学習MLP(46.75%の重み付き正解率)およびCOVAREPベースのソフトマックス分類器(44.67%の重み付き正解率)を上回ったことから、教師なし事前学習の価値が示された。
  • BLSTMオートエンコーダーは発話レベルの表現を効果的に捉えており、可視化により感情状態の意味のあるクラスタリングが観察された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。