Skip to main content
QUICK REVIEW

[論文レビュー] Gender Based Emotion Recognition System for Telugu Rural Dialects Using Hidden Markov Models

P. V. G. D. Prasad Reddy, Ajay Prasad|arXiv (Cornell University)|Jun 23, 2010
Speech Recognition and Synthesis参考文献 9被引用数 14
ひとこと要約

本稿では、隠れマルコフモデル(HMM)を用いてテルグ語農村方言の性別に基づく感情認識システムを提案する。13次MFCC、13次デルタ係数、13次加速度係数から成る39次元の特徴ベクトルを用い、怒り、驚き、喜び、悲しみ、およびニュートラルの5つの感情状態を分類する。システムは、人間の評価と照合され、TRDAPデータベースを用いた性別依存および性別非依存の実験を通じて、両性別において怒りを認識する際の正確度が80%に達した。

ABSTRACT

Automatic emotion recognition in speech is a research area with a wide range of applications in human interactions. The basic mathematical tool used for emotion recognition is Pattern recognition which involves three operations, namely, pre-processing, feature extraction and classification. This paper introduces a procedure for emotion recognition using Hidden Markov Models (HMM), which is used to divide five emotional states: anger, surprise, happiness, sadness and neutral state. The approach is based on standard speech recognition technology using hidden continuous markov model by selection of low level features and the design of the recognition system. Emotional Speech Database from Telugu Rural Dialects of Andhra Pradesh (TRDAP) was designed using several speaker's voices comprising the emotional states. The accuracy of recognizing five different emotions for both genders of classification is 80% for anger-emotion which is achieved by using the best combination of 39-dimensioanl feature vector for every frame (13 MFCCs, 13 Delta Coefficients and 13 Acceleration Coefficients) and a classifier using HMM. This outcome very much matches with that acquired with the same database with subjective evaluation by human judges. Both gender-dependent and gender-independent experiments are conducted on TRDAP emotional speech database.

研究の動機と目的

  • テルグ語農村方言に特化した自動感情認識システムの開発を目的とする。これは、発話感情研究において未だ代表されていない分野である。
  • 言語的および音声的データが限られている低リソースの地方方言における感情認識の課題に対処することを目的とする。
  • 新たに作成された感情音声データベースを用いて、性別依存および性別非依存のHMMモデルを用いた分類性能を評価することを目的とする。
  • 連続HMMと低レベルの音声特徴を用いて、インドの地方言語における感情認識のベンチマークを確立することを目的とする。

提案手法

  • 本システムは、前処理、特徴抽出、分類の3段階からなるパターン認識パイプラインを採用する。
  • 低レベルの音声特徴が各音声フレームごとに抽出され、13次メル周波数ケプストラム係数(MFCCs)、13次デルタ係数、13次加速度係数が組み合わされ、39次元のベクトルを形成する。
  • 連続HMMフレームワークを用いて、各感情クラスごとにHMMを学習し、音声の時間的ダイナミクスをモデル化する。
  • TRDAPデータベースは、複数のテルグ語農村方言話者の感情音声を含む。本研究では、このデータベースを訓練およびテストに用いる。
  • 性別依存および性別非依存のHMM分類器を同じデータセット上で学習および評価し、性能を比較する。
  • 標準的な音声認識技術を感情分類に適応し、最大尤度推定に基づくモデル選択を実施する。

実験結果

リサーチクエスチョン

  • RQ1HMMベースの分類は、テルグ語農村方言において怒り、驚き、喜び、悲しみ、ニュートラルの5つの明確な感情を効果的に認識できるか?
  • RQ2性別に特化したモデル化は、低リソースの地方話における感情認識の正確度にどのように影響するか?
  • RQ313次MFCC、13次デルタ係数、13次加速度係数から成る39次元の音声特徴の組み合わせが、感情認識性能をどの程度向上させるか?
  • RQ4本システムの性能は、同じデータセット上で人間の主観的評価と比較してどの程度一致するか?
  • RQ5地方インド言語における感情認識に最適な特徴ベクトルおよびモデル設定は何か?

主な発見

  • 最適な39次元特徴ベクトルを用いることで、提案システムは怒りの認識で80%の正確度を達成し、5つの感情クラスの中で最高の性能を示した。
  • 性別依存のHMMモデルは、TRDAPデータベースにおいて性別非依存モデルを上回る感情認識の正確度を示した。
  • システムの性能は人間の主観的評価と密接に一致しており、その信頼性と頑健性が裏付けられた。
  • 13次MFCC、13次デルタ係数、13次加速度係数の組み合わせが、最も優れた分類性能をもたらした。
  • 連続HMMフレームワークは、農村地域のテルグ語方言における感情音声の時間的ダイナミクスを効果的にモデル化できた。
  • TRDAPデータベースは、インドの地方言語における感情認識研究のための有効かつ信頼できるベンチマークとして機能する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。