Skip to main content
QUICK REVIEW

[論文レビュー] Emotion Recognition From Speech With Recurrent Neural Networks

V. K. Chernykh, Prikhodko, Pavel|arXiv (Cornell University)|Jan 27, 2017
Speech and Audio Processing参考文献 32被引用数 127
ひとこと要約

要約: 本論文は、音声からの感情認識のための再帰型ニューラルネットワーク(RNN)アプローチと Connectionist Temporal Classification(CTC)損失を提案し、IEMOCAPで評価し、ベースラインおよび人間の性能と比較している。

ABSTRACT

In this paper the task of emotion recognition from speech is considered. Proposed approach uses deep recurrent neural network trained on a sequence of acoustic features calculated over small speech intervals. At the same time special probabilistic-nature CTC loss function allows to consider long utterances containing both emotional and neutral parts. The effectiveness of such an approach is shown in two ways. Firstly, the comparison with recent advances in this field is carried out. Secondly, human performance on the same task is measured. Both criteria show the high quality of the proposed method.

研究の動機と目的

  • 長い発話の中で感情が局在している可能性があるという課題に対処する。
  • フレームレベルの特徴を発話レベルの感情ラベルに整列するために、CTC損失を用いた深い再帰型ニューラルネットワークを活用する。
  • 話者独立のクロスバリデーションの下で、CTCベースのシーケンス学習をフレームワイズおよび1ラベルベースのベースラインと比較する。
  • 提案手法の品質を同じタスクに対する人間の性能と比較して評価する。

提案手法

  • 音声を200 msフレーム、100 msのオーバーラップで前処理し、各フレームから34の声学特徴を抽出(MFCC、クロマ、エネルギーなど)。
  • NULLを含む拡張ラベルセットに対して確率を出力する Bidirectional LSTM ベースのニューラルネットワークを使用する。
  • 長い入力シーケンスの非対齐を扱い、感情ラベルのシーケンスを生成するためにCTC損失で学習する。
  • 話者依存性を避けるために grouped cross-validation の下でCTCをフレームワイズおよび1ラベルベースのベースラインと比較する。
  • 全体の正確さと平均クラス正解率を用いて評価し、クラス不均衡に対処する。

実験結果

リサーチクエスチョン

  • RQ1長い音声シーケンスのフレームレベルの音響特徴から発話レベルの感情をCTCベースのRNNモデルで正確に認識できるか。
  • RQ2IEMOCAPデータセットにおいて、話者独立評価の下でCTCアプローチはフレームワイズおよび1ラベルベースとどう比較されるか。
  • RQ3人間の評価者間の主観性とラベルの一貫性がモデル性能に与える影響はどの程度か。
  • RQ4機械の性能は感情認識タスクにおいて人間の性能にどれだけ近いか。

主な発見

  • CTCは全体正確度54%および平均クラス正解率54%を達成し、フレームワイズ(45%/41%)および1ラベル(51%/49%)のベースラインを上回り、人間の性能(69%/70%)に近づく。
  • 長い発話に対してフレームワイズのベースラインは不安定さを示す一方で、CTCは堅牢な性能を維持する。
  • 人間の評価者はモデルより高い正確さを達成しており、感情ラベル付けの主観的側面と改善の余地を浮き彫りにする。
  • モデルの誤りパターンは人間のラベリング不一致と部分的に整合しており、モデルが人間と同様の知覚キューを捉えていることを示唆する。
  • このアプローチは、音声におけるCTCを用いたエンドツーエンドのシーケンスモデリングによる感情認識の有効性を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。