Skip to main content
QUICK REVIEW

[論文レビュー] Investigation of Multimodal Features, Classifiers and Fusion Methods for Emotion Recognition

Zheng Lian, Ya Li|arXiv (Cornell University)|Sep 13, 2018
Emotion and Mood Recognition参考文献 49被引用数 17
ひとこと要約

本論文は、EmotiW 2018 チャレンジ向けに、手作業で作成した特徴量と深層ニューラルネットワーク(DNN)から抽出されたボトルネック特徴量を用いて、音声、映像、テキストのマルチモーダルを統合する感情認識システムを提案する。時間的要因を考慮した分類器と非時間的分類器の両方を評価し、マルチモーダル統合にビームサーチ統合(BS-Fusion)を適用した。テストセットでは60.34%の精度を達成し、優勝者からわずか1.5%低い水準にとどまり、強力な統合戦略により高い競争力を持つことを示している。

ABSTRACT

Automatic emotion recognition is a challenging task. In this paper, we present our effort for the audio-video based sub-challenge of the Emotion Recognition in the Wild (EmotiW) 2018 challenge, which requires participants to assign a single emotion label to the video clip from the six universal emotions (Anger, Disgust, Fear, Happiness, Sad and Surprise) and Neutral. The proposed multimodal emotion recognition system takes audio, video and text information into account. Except for handcraft features, we also extract bottleneck features from deep neutral networks (DNNs) via transfer learning. Both temporal classifiers and non-temporal classifiers are evaluated to obtain the best unimodal emotion classification result. Then possibilities are extracted and passed into the Beam Search Fusion (BS-Fusion). We test our method in the EmotiW 2018 challenge and we gain promising results. Compared with the baseline system, there is a significant improvement. We achieve 60.34% accuracy on the testing dataset, which is only 1.5% lower than the winner. It shows that our method is very competitive.

研究の動機と目的

  • EmotiW 2018 チャレンジ向けに、6つの普遍的でない感情またはニュートラルのいずれかに動画クリップを分類する、耐障害性の高いマルチモーダル感情認識システムを開発すること。
  • 音声、映像、テキストモダリティから得られる手作業特徴量とディープラーニングベースの特徴量(ボトルネック特徴量)を統合する有効性を検証すること。
  • 統合の前段階として、個々のモダリティのパフォーマンスを最適化するために、時間的分類器(例:RNN や LSTM)と非時間的分類器(例:SVM や MLP)の両方を、単一モダリティの感情認識において評価すること。
  • 特にビームサーチ統合(BS-Fusion)を含む統合戦略を検討し、マルチモーダル予測を効果的に統合し、全体の分類精度を向上させること。

提案手法

  • 音声(例:プロソディック特徴量)、映像(例:顔面のランドマークやアクションユニット)、テキスト(例:センチメントや感情の語彙)から手作業で作成した特徴量を抽出する。
  • トランスファー学習を用いて事前学習済みの深層ニューラルネットワーク(DNN)からボトルネック特徴量を抽出し、各モダリティの高次元表現を捉える。
  • 個々の単一モダリティ分類器のパフォーマンスを最適化するために、時間的分類器(例:RNN や LSTM)と非時間的分類器(例:SVM や MLP)の両方を、単一モダリティの感情認識において評価する。
  • 個々の単一モダリティ分類器の予測結果を、ビームサーチ統合(BS-Fusion)を用いて統合する。BS-Fusion は、最良の信頼度を持つ連携予測を探索するための逐次的デコード戦略である。
  • 統合プロセスは、モダリティ間の信頼度と多様性のバランスを最適化することで、最終的な分類の耐障害性を向上させる。
  • 最終的なシステムは、7つの感情ラベルのうち1つにラベル付けされた短い動画クリップを含む、EmotiW 2018 データセット上で訓練および評価される。

実験結果

リサーチクエスチョン

  • RQ1音声、映像、テキストモダリティにおいて、手作業特徴量と深層ボトルネック特徴量の性能はどのように比較されるか?
  • RQ2時間的分類器と非時間的分類器のどちらが、動画クリップにおける感情認識において優れた単一モダリティ性能を示すか?
  • RQ3ビームサーチ統合(BS-Fusion)は、単純な統合手法(例:早期統合や後期統合)と比較して、どの程度マルチモーダル感情認識の精度を向上させるか?
  • RQ4音声、映像、テキスト特徴量の異なる組み合わせが、マルチモーダル環境下での最終分類パフォーマンスにどのように寄与するか?
  • RQ5DNNボトルネック特徴量によるトランスファーラーニングが、EmotiW 2018 チャレンジ全体のシステム精度に及ぼす影響は何か?

主な発見

  • 提案されたマルチモーダルシステムは、EmotiW 2018 テストセットで60.34%の精度を達成し、競争の激しいチャレンジ環境下でも優れたパフォーマンスを示した。
  • DNNボトルネック特徴量の使用により、手作業特徴量のみを使用した場合と比較して、特に音声および映像モダリティにおいて、単一モダリティのパフォーマンスが顕著に向上した。
  • ビームサーチ統合(BS-Fusion)は、単純な早期統合や後期統合戦略を上回り、多様な予測経路を効果的に探索することで、最終意思決定の信頼度を向上させた。
  • 時間的分類器は、映像および音声モダリティにおいて非時間的分類器を上回るパフォーマンスを示し、感情認識において時系列的ダイナミクスをモデル化することが重要であることを示唆した。
  • システムのパフォーマンスは優勝エントリからわずか1.5%低い水準にとどまり、トップランクでないにもかかわらず、高い競争力を持つことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。