Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Emotion Recognition for One-Minute-Gradual Emotion Challenge

Ziqi Zheng, Chenjie Cao|arXiv (Cornell University)|May 3, 2018
Emotion and Mood Recognition参考文献 26被引用数 22
ひとこと要約

本稿では、音声、視覚、テキスト特徴を専用モデルを用いて抽出した後、SVMを用いた統合手法を用いて、1分間の動画クリップから連続的な覚醒度と価値の予測を行うマルチモーダルアプローチを提示する。この手法は、検証セットにおいて覚醒度で0.397、価値で0.520のコンcordance相関係数(CCC)を達成し、最先端の性能を発揮し、ベースラインシステムを著しく上回る。

ABSTRACT

The continuous dimensional emotion modelled by arousal and valence can depict complex changes of emotions. In this paper, we present our works on arousal and valence predictions for One-Minute-Gradual (OMG) Emotion Challenge. Multimodal representations are first extracted from videos using a variety of acoustic, video and textual models and support vector machine (SVM) is then used for fusion of multimodal signals to make final predictions. Our solution achieves Concordant Correlation Coefficient (CCC) scores of 0.397 and 0.520 on arousal and valence respectively for the validation dataset, which outperforms the baseline systems with the best CCC scores of 0.15 and 0.23 on arousal and valence by a large margin.

研究の動機と目的

  • 1分間の動画クリップにおける段階的な感情の変化を連続的次元感情空間を用いてモデル化する課題に対処すること。
  • マルチモーダルデータを活用することで、覚醒度と価値の予測をベースラインシステムを上回るように改善すること。
  • 多様なモダリティを統合する強固な統合戦略を構築し、感情認識性能を向上させること。

提案手法

  • 専用の音声、動画、テキストモデルを用いて動画からマルチモーダル表現を抽出する。
  • 支持ベクターマシン(SVM)を用いてマルチモーダル信号を早期統合し、連続的覚醒度と価値を予測する。
  • 覚醒度と価値の次元に基づく連続的次元感情モデルを用いて、動的な感情の変化を捉える。
  • One-Minute-Gradual(OMG)Emotion Challengeデータセットを用いてモデルを学習および検証する。
  • 検証データ上でコンコードアンス相関係数(CCC)を最大化するように統合プロセスを最適化する。
  • 多様な事前学習済みモデルを用いて特徴抽出を行い、モダリティ間で豊富な表現を確保する。

実験結果

リサーチクエスチョン

  • RQ1音声、動画、テキスト特徴のマルチモーダル統合は、長時間の動画クリップにおける連続的感情予測を改善できるか?
  • RQ2マルチモーダル信号のSVMベースの統合は、覚醒度と価値の予測においてベースラインモデルと比較してどのように異なるか?
  • RQ3連続的次元モデルは、1分間の動画シーケンスにおける段階的な感情の変化をどの程度正確に捉えることができるか?

主な発見

  • 提案手法は、検証データセットにおいて覚醒度予測でコンコードアンス相関係数(CCC)0.397を達成した。
  • 価値予測においてもCCCが0.520に達し、ベースラインシステムを著しく上回った。
  • 結果は、ベースラインモデルがそれぞれ覚醒度で0.15、価値で0.23を達成したのに対し、著しい改善が確認された。
  • マルチモーダル表現とSVMベースの統合により、より正確で安定した感情予測が可能になった。
  • 連続的次元モデルを用いることで、1分間の動画クリップにおける段階的な感情の遷移を効果的に捉えることができた。
  • これらの発見は、連続的感情認識タスクにおいて、多様なモダリティの早期統合の有効性を確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。