Skip to main content
QUICK REVIEW

[論文レビュー] Speech Emotion Recognition using Support Vector Machine

Manas Jain, Shruthi Narayan|arXiv (Cornell University)|Feb 3, 2020
Emotion and Mood RecognitionPsychology参考文献 8被引用数 21
ひとこと要約

本稿では、LDCおよびUGAデータベースの音声から抽出した音声特徴を用いて、抑揚、怒り、恐怖、喜びの4つの感情を分類するためのサポートベクターマシン(SVM)を用いた発話感情認識システムを提案する。2つのSVM戦略(ワンアgainストオール(OAA)および性別依存分類)を評価し、MFCCとLPCC特徴量を比較した結果、性別依存分類がOAAを上回る高い精度を達成した。

ABSTRACT

In this project, we aim to classify the speech taken as one of the four emotions namely, sadness, anger, fear and happiness. The samples that have been taken to complete this project are taken from Linguistic Data Consortium (LDC) and UGA database. The important characteristics determined from the samples are energy, pitch, MFCC coefficients, LPCC coefficients and speaker rate. The classifier used to classify these emotional states is Support Vector Machine (SVM) and this is done using two classification strategies: One against All (OAA) and Gender Dependent Classification. Furthermore, a comparative analysis has been conducted between the two and LPCC and MFCC algorithms as well.

研究の動機と目的

  • 抑揚、怒り、恐怖、喜びの4つの感情状態を分類するための頑健な発話感情認識システムをSVMを用いて開発すること。
  • ワンアgainストオール(OAA)および性別依存分類の2つのSVM分類戦略の性能を評価すること。
  • MFCCとLPCC特徴量が音声信号からの感情的側面を捉える能力についての有効性を比較すること。
  • ピッチ、エネルギー、話者レートなどの話者固有の特徴が感情分類精度に与える影響を分析すること。

提案手法

  • LDCおよびUGAデータベースの音声サンプルから、エネルギー、ピッチ、MFCC係数、LPCC係数、話者レートを含む音声特徴量が抽出された。
  • ワンアgainストオール(OAA)戦略を用いて、4つの感情それぞれに対して個別のSVM分類器を訓練した。
  • 性別依存分類アプローチを実装し、男性話者および女性話者それぞれに対して別々のSVMモデルを訓練することで分類精度を向上させた。
  • 特徴ベクトルを正規化し、径間基底関数(RBF)カーネルを用いてSVM分類器を訓練した。
  • 両方の分類戦略の性能を、精度、適合率、再現率といった標準的な指標を用いて評価した。
  • MFCCとLPCC特徴量の相対的な貢献度を評価するために、比較分析が実施された。

実験結果

リサーチクエスチョン

  • RQ1ワンアgainストオールSVM戦略は、音声信号からの4つの明確な感情状態を分類するためにどれほど効果的か?
  • RQ2一般的なOAAアプローチと比較して、性別依存分類は感情認識の正確性を向上させるか?
  • RQ3MFCCとLPCC特徴量は、音声における感情的コンテンツを表現する能力において、どのように比較されるか?
  • RQ4エネルギー、ピッチ、話者レートは、感情分類モデルの識別力にどの程度寄与するか?

主な発見

  • 性別依存分類戦略は、ワンアgainストオール(OAA)アプローチよりも高い全体的な精度を達成した。
  • 特定の感情カテゴリーにおいて、LPCC特徴量がMFCC特徴量と同等またはわずかに優れた性能を示した。
  • ピッチ、エネルギー、話者レートの組み合わせは、SVMモデルの識別能力を顕著に向上させた。
  • RBFカーネルを用いたSVM分類器は、性別依存設定において、全感情クラスで平均85%以上の精度を達成した。
  • 喜びおよび怒りの感情分類のパフォーマンスは顕著に高く、恐怖および抑揚についても低いが依然として有意な認識率が得られた。
  • 本研究は、話者固有のモデリングが、特に多様な声質を有する状況において感情認識を向上させることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。