Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing Speech Emotion Recognition using Manta-Ray Based Feature Selection

Soham Chattopadhyay, Arijit Dey|arXiv (Cornell University)|Sep 18, 2020
Speech and Audio Processing被引用数 8
ひとこと要約

本論文は、メル周波数ケプストラム係数(MFCC)と線形予測符号化(LPC)特徴量を組み合わせ、その後にマントラ・レイ・フォーリング最適化(MFO)を用いた特徴選択を施す、新しい音声感情認識フレームワークを提案する。マルチレイヤーパーセプトロン(MLP)分類器を用いて、SAVEEデータセットで97.49%、Emo-DBデータセットで97.68%の最先端の精度を達成し、非冗長な最適化された特徴サブセットを通じて優れた性能を示している。

ABSTRACT

Emotion recognition from audio signals has been regarded as a challenging task in signal processing as it can be considered as a collection of static and dynamic classification tasks. Recognition of emotions from speech data has been heavily relied upon end-to-end feature extraction and classification using machine learning models, though the absence of feature selection and optimization have restrained the performance of these methods. Recent studies have shown that Mel Frequency Cepstral Coefficients (MFCC) have been emerged as one of the most relied feature extraction methods, though it circumscribes the accuracy of classification with a very small feature dimension. In this paper, we propose that the concatenation of features, extracted by using different existing feature extraction methods can not only boost the classification accuracy but also expands the possibility of efficient feature selection. We have used Linear Predictive Coding (LPC) apart from the MFCC feature extraction method, before feature merging. Besides, we have performed a novel application of Manta Ray optimization in speech emotion recognition tasks that resulted in a state-of-the-art result in this field. We have evaluated the performance of our model using SAVEE and Emo-DB, two publicly available datasets. Our proposed method outperformed all the existing methods in speech emotion analysis and resulted in a decent result in these two datasets with a classification accuracy of 97.06% and 97.68% respectively.

研究の動機と目的

  • 複数の特徴抽出手法を統合することで、音声感情認識(SER)における冗長で最適でない特徴の課題に対処すること。
  • 新規の生物模倣最適化アルゴリズム「マントラ・レイ・フォーリング最適化(MFO)」を用いて、最も識別的な特徴を選択することで分類精度を向上させること。
  • 標準的な公開データセット(SAVEE および Emo-DB)上で提案手法を検証し、既存の最先端手法と性能を比較すること。
  • ハイブリッド特徴表現(MFCC + LPC)とメタヒューリスティック最適化を組み合わせることで、SER性能を向上させる有効性を検証すること。
  • 異なる分類器(KNN および MLP)とデータセットにおけるモデルの頑健性と一般化能力を評価すること。

提案手法

  • 音声信号の前処理を実施し、音声信号からMFCCおよびLPC特徴量を抽出することで包括的な特徴ベクトルを構築する。
  • MFCCとLPCの特徴量を連結して、スペクトル的および線形予測的特徴を両方捉える高次元の初期特徴セットを生成する。
  • マントラ・レイ・フォーリング最適化(MFO)アルゴリズムを適用し、連結された特徴セットから最も関連性が高く冗長性のない特徴を選択することで、次元削減を実現しつつ識別力を維持する。
  • 選択された特徴量を、2つの隠れ層(それぞれ5ニューロン)を持つマルチレイヤーパーセプトロン(MLP)分類器と、k=5のKNN分類器に供給し、比較的評価を実施する。
  • 両方のデータセット(SAVEE および Emo-DB)で5分割交差検証を実施し、精度、適合率、再現率、F1スコアといった標準指標を用いてモデルの性能を評価する。
  • MFOに基づく特徴選択の有効性を検証するため、遺伝的アルゴリズム、粒子群最適化、グレーワルフ最適化と比較する。

実験結果

リサーチクエスチョン

  • RQ1MFCCとLPC特徴量の連結は、音声感情認識モデルの識別力を向上させることができるか?
  • RQ2マントラ・レイ・フォーリング最適化(MFO)の適用は、他のメタヒューリスティックアルゴリズムと比較して、特徴選択の質と分類精度を向上させるか?
  • RQ3本手法は、SAVEE や Emo-DB といった標準ベンチマークデータセットにおいて、既存の最先端手法と比較してどのように性能を発揮するか?
  • RQ4MLP分類器とKNN分類器を用いた場合、最適化された特徴セットの性能にどのような影響を与えるか?
  • RQ5MFOによる次元削減は、分類精度を損なわずにモデル効率をどの程度向上させるか?

主な発見

  • 提案手法は、MFOに基づく特徴選択を用いたMLP分類器により、SAVEEデータセットで97.49%の最先端の分類精度を達成した。
  • Emo-DBデータセットでは、97.68%の分類精度を達成し、文献に報告されたすべての既存手法を上回った。
  • MFOアルゴリズムは、SAVEEデータセットから43の特徴量、Emo-DBデータセットから61の特徴量を選択し、次元削減を顕著に実現しながらも高い精度を維持した。
  • MLP分類器はKNN分類器を上回り、Emo-DBで97.68%、SAVEEで97.06%の精度を達成し、各foldでF1スコアと適合率が高かった。
  • 他の最適化アルゴリズムと比較して、MFOは最高の精度(SAVEEで97.06%、Emo-DBで97.68%)を達成し、特にEmo-DBにおいて優れた適合率と再現率を示した。
  • 5分割交差検証の複数のfoldにおいて、精度、適合率、再現率、F1スコアの標準偏差が低く、一貫した性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。