Skip to main content
QUICK REVIEW

[論文レビュー] Divide-and-Conquer based Ensemble to Spot Emotions in Speech using MFCC and Random Forest

Abdul Malik Badshah|arXiv (Cornell University)|Oct 5, 2016
Emotion and Mood Recognition参考文献 9被引用数 9
ひとこと要約

本稿では、MFCC特徴量とランダムフォレスト分類器を用いた、分割統治型アンサンブルフレームワークを提案する。感情を中立/感情的、そして肯定的/否定的、最終的に個々の感情に段階的に階層的に構造化することで、段階的でタスク特化型の予測により分類精度を向上させ、従来の手法と比較してベンチマークデータセット上で優れた性能を達成した。

ABSTRACT

Besides spoken words, speech signals also carry information about speaker gender, age, and emotional state which can be used in a variety of speech analysis applications. In this paper, a divide and conquer strategy for ensemble classification has been proposed to recognize emotions in speech. Intrinsic hierarchy in emotions has been utilized to construct an emotions tree, which assisted in breaking down the emotion recognition task into smaller sub tasks. The proposed framework generates predictions in three phases. Firstly, emotions are detected in the input speech signal by classifying it as neutral or emotional. If the speech is classified as emotional, then in the second phase, it is further classified into positive and negative classes. Finally, individual positive or negative emotions are identified based on the outcomes of the previous stages. Several experiments have been performed on a widely used benchmark dataset. The proposed method was able to achieve improved recognition rates as compared to several other approaches.

研究の動機と目的

  • 内在的な感情の階層構造を活用することで、発話感情認識の精度を向上させること。
  • タスクの分解により、多クラス感情分類の複雑さを低減すること。
  • ランダムフォレスト分類器を用いて意思決定境界を強化する段階的アンサンブルフレームワークを設計すること。
  • 発話感情認識のための広く用いられるベンチマークデータセット上で、提案手法を評価すること。
  • 従来の単一段階分類モデルと比較して、向上した認識率を示すこと。

提案手法

  • フレームワークは、分類タスクを3段階に逐次分解する感情の階層的ツリーを構築する。
  • 段階1では、MFCC特徴量とランダムフォレストを用いて、入力音声を中立的か感情的かに分類する。
  • 段階2では、感情的と分類された音声を、肯定的か否定的かの感情カテゴリにさらに分類する。
  • 段階3では、肯定的または否定的の分岐内において、個々の感情(例:喜び、怒り)を専用のランダムフォレストモデルで特定する。
  • MFCCは、音声信号のスペクトル的特徴を表す音声特徴量として抽出される。
  • 階層的段階間の予測を統合するアンサンブル戦略により、全体の分類の頑健性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1階層的分割統治戦略は、発話感情認識システムの精度を向上させることができるか?
  • RQ2感情の階層を用いた段階的分類は、直接的な多クラス分類と比較して性能にどのように影響を与えるか?
  • RQ3MFCC特徴量とランダムフォレスト分類器は、階層的フレームワーク内での感情認識の向上にどの程度寄与するか?
  • RQ4提案されたアンサンブル手法は、ベンチマークデータセット上で既存の最先端手法を上回るか?
  • RQ5内在的な感情構造の使用は、複雑な感情分類タスクの簡略化にどの程度有効か?

主な発見

  • 提案手法は、広く用いられるベンチマークデータセットにおいて、いくつかのベースライン手法と比較して向上した認識率を達成した。
  • 中立/感情的、肯定的/否定的、個々の感情の段階への階層的分解が、分類性能の向上に寄与した。
  • 入力特徴量としてのMFCCは、感情検出に適した関連する音声的パターンを効果的に捉えていた。
  • ランダムフォレスト分類器は、アンサンブルフレームワークの各段階で優れた一般化能力を示した。
  • 分割統治戦略により、多クラス感情分類の複雑さが低減され、より正確な予測が得られた。
  • アンサンブルアプローチは、非階層的および単一段階分類モデルと比較して、認識精度の面で優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。