Skip to main content
QUICK REVIEW

[論文レビュー] Speech Emotion Recognition Based on Multi-feature and Multi-lingual Fusion

Chunyi Wang|arXiv (Cornell University)|Jan 16, 2020
Emotion and Mood Recognition参考文献 16被引用数 4
ひとこと要約

本稿では、低リソース状況下での精度向上を目的として、音声感情認識のためのマルチフィーチャーかつマルチリンガルな統合手法を提案する。中国語および英語の音声データセットから抽出したハンドクラフト特徴量とディープニューラルネットワーク特徴量を、文脈内および文脈間の両レベルで統合することで、ベースラインモデルに比べ顕著な精度向上を達成した。特に小規模データセット上での性能向上が顕著である。

ABSTRACT

A speech emotion recognition algorithm based on multi-feature and Multi-lingual fusion is proposed in order to resolve low recognition accuracy caused by lack of large speech dataset and low robustness of acoustic features in the recognition of speech emotion. First, handcrafted and deep automatic features are extracted from existing data in Chinese and English speech emotions. Then, the various features are fused respectively. Finally, the fused features of different languages are fused again and trained in a classification model. Distinguishing the fused features with the unfused ones, the results manifest that the fused features significantly enhance the accuracy of speech emotion recognition algorithm. The proposed solution is evaluated on the two Chinese corpus and two English corpus, and is shown to provide more accurate predictions compared to original solution. As a result of this study, the multi-feature and Multi-lingual fusion algorithm can significantly improve the speech emotion recognition accuracy when the dataset is small.

研究の動機と目的

  • 大規模な音声データセットが限られる状況による音声感情認識の認識精度の低さを是正すること。
  • 異なる特徴タイプを複数の言語にまたがって統合することで、音響特徴量のロバスト性を向上させること。
  • マルチリンガルデータ統合を通じて、モデルの汎化性能と性能を向上させること。
  • 低リソース環境下における特徴統合戦略の有効性を評価すること。
  • 中国語および英語の両言語から抽出したハンドクラフト特徴量とディープ特徴量の統合が、認識精度の向上に寄与することを実証すること。

提案手法

  • 既存の中国語および英語の音声感情認識データセットから、ハンドクラフト特徴量(例:プロソディック特徴、スペクトル特徴)およびディープニューラルネットワーク特徴量(例:DNNからの出力)を抽出する。
  • 各言語内において、複数の特徴タイプを別々に統合することで、表現の豊かさを高める。
  • 文脈間統合では、中国語および英語から得られた統合済み特徴量を統合し、統一されたクロスリンガル表現を生成する。
  • 最終的な統合特徴表現を用いて分類モデルを学習し、感情ラベルを予測する。
  • 統合済み特徴量と非統合特徴量を比較することで、統合戦略の有効性を検証する。
  • 2つの中国語および2つの英語の音声感情コーパスを用いて、クロスリンガルな汎化性能を確認する評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1ハンドクラフト特徴量とディープ特徴量の統合は、音声感情認識の精度向上に寄与するか?
  • RQ2中国語および英語のデータセットからの特徴量のマルチリンガル統合は、モデル性能の向上に寄与するか?
  • RQ3訓練データが限られた状況下で、特徴量統合は認識精度にどのように影響するか?
  • RQ4提案された統合戦略は、個々の特徴タイプや単一言語データを用いる場合よりも優れているか?
  • RQ5クロスリンガル特徴量統合は、低リソース環境下でのロバスト性および汎化性能をどの程度向上させるか?

主な発見

  • 提案されたマルチフィーチャーおよびマルチリンガル統合手法は、非統合または単一特徴表現を用いたモデルと比較して、顕著に音声感情認識の精度を向上させた。
  • 中国語および英語の両方のデータセットからの統合特徴量は、単一言語からの特徴量よりも、よりロバストで判別力のある表現を生成した。
  • 本手法は小規模データセット上でも高い精度を達成し、言語をまたいだ強力な汎化能力を示した。
  • ハンドクラフト特徴量とディープ特徴量の組み合わせは、特にデータが少ない環境下でモデル性能を顕著に向上させた。
  • 2つの中国語および2つの英語コーパスを用いた実験的結果から、多様なデータセットにおいて一貫した性能向上が確認された。
  • 本研究では、すでに統合済みの特徴量を文脈間で統合することで、文脈内統合のみに比べてより優れた結果が得られることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。