Skip to main content
QUICK REVIEW

[論文レビュー] Deep Net Features for Complex Emotion Recognition

Bhalaji Nagarajan, O.V. Ramana Murthy|arXiv (Cornell University)|Oct 31, 2018
Emotion and Mood Recognition参考文献 2被引用数 3
ひとこと要約

本論文は、複雑な感情認識、特に好奇心の認識に、事前学習済みモデル—AudioSet Net、VoxCeleb Net、Deep Speech Net—の深層ニューラルネットワーク特徴を活用することを提案する。これらのネットワークの深層部における高レベル表現を抽出・符号化することで、特徴ベクトルを生成し、EmoReactデータセット上でF1スコア0.85を達成した。これは、従来のベースライン0.69を顕著に上回った結果である。

ABSTRACT

This paper investigates the influence of different acoustic features, audio-events based features and automatic speech translation based lexical features in complex emotion recognition such as curiosity. Pretrained networks, namely, AudioSet Net, VoxCeleb Net and Deep Speech Net trained extensively for different speech based applications are studied for this objective. Information from deep layers of these networks are considered as descriptors and encoded into feature vectors. Experimental results on the EmoReact dataset consisting of 8 complex emotions show the effectiveness, yielding highest F1 score of 0.85 as against the baseline of 0.69 in the literature.

研究の動機と目的

  • 好奇心のような複雑な感情を認識するための、音声的特徴、音声イベント特徴、語彙的特徴の多様性の有効性を調査すること。
  • AudioSet Net、VoxCeleb Net、Deep Speech Netといった事前学習済み深層ニューラルネットワークが、感情認識における特徴抽出にどの程度有効であるかを評価すること。
  • これらのモデルの深層部からの高レベル表現が、複雑な感情分類のための強力な記述子として機能できるかどうかを検討すること。
  • 特に8つの感情クラスを含むEmoReactデータセットにおいて、既存のベースラインを上回る性能を向上させること。

提案手法

  • 大規模な音声および音声データで学習された、異なるタスクを目的とした事前学習済みのAudioSet Net、VoxCeleb Net、Deep Speech Netモデルを活用する。
  • ネットワークのより深い、より抽象的な層から特徴表現を抽出し、高レベルな意味的パターンを捉える。
  • 抽出された深層特徴を、後続の分類タスクに適したコンパクトで判別力のある特徴ベクトルに符号化する。
  • EmoReactデータセット上で、好奇心を含む8つの複雑な感情を認識するため、分類器を組み合わせた深層特徴で学習する。
  • 標準的な指標、特にF1スコアを用いて性能を評価し、従来の最先端手法と比較する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みモデルから得られる音声的、音声イベント的、語彙的特徴は、複雑な感情認識にどの程度寄与するか?
  • RQ2AudioSet Net、VoxCeleb Net、Deep Speech Netからの深層表現は、感情認識性能をどの程度向上できるか?
  • RQ3事前学習済みネットワークの高レベル特徴は、好奇心のような複雑な感情に対して効果的に一般化できるか?
  • RQ4これらの深層ネットワーク特徴を用いることで、既存のベースラインに比べてどの程度の性能向上が達成できるか?

主な発見

  • 提案手法は、EmoReactデータセット上でF1スコア0.85を達成し、従来のベースライン0.69を顕著に上回った。
  • 事前学習済みネットワークの高層層から抽出された深層特徴は、微細な感情状態を捉えるのに非常に効果的であった。
  • 音声的特徴、音声イベント特徴、自動音声翻訳に基づく語彙的特徴の組み合わせが、複雑な感情の判別力を強化した。
  • 異なる音声応用タスク向けに微調整された事前学習済みモデルでさえ、感情認識に強力で転送可能な表現を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。