Skip to main content
QUICK REVIEW

[論文レビュー] Computer Vision Estimation of Emotion Reaction Intensity in the Wild

Qian Yang, Ali Kargarandehkordi|arXiv (Cornell University)|Mar 19, 2023
Emotion and Mood RecognitionPsychology被引用数 3
ひとこと要約

本論文は、深層学習を用いて、制御されていない現実世界の環境(イン・ザ・ワイルド)で感情反応の強度を推定するコンピュータビジョン手法を提案する。視覚のみのモデルを4つと、視覚・音声のマルチモーダルモデルを1つ導入し、事前学習済みのResNet50を用いてHume-Reactionデータセットでテスト時のピアソン相関係数0.4080を達成した。これは、離散的なカテゴリを超えて、微細な感情強度を予測する生産用途に適したモデルへの重要な一歩である。

ABSTRACT

Emotions play an essential role in human communication. Developing computer vision models for automatic recognition of emotion expression can aid in a variety of domains, including robotics, digital behavioral healthcare, and media analytics. There are three types of emotional representations which are traditionally modeled in affective computing research: Action Units, Valence Arousal (VA), and Categorical Emotions. As part of an effort to move beyond these representations towards more fine-grained labels, we describe our submission to the newly introduced Emotional Reaction Intensity (ERI) Estimation challenge in the 5th competition for Affective Behavior Analysis in-the-Wild (ABAW). We developed four deep neural networks trained in the visual domain and a multimodal model trained with both visual and audio features to predict emotion reaction intensity. Our best performing model on the Hume-Reaction dataset achieved an average Pearson correlation coefficient of 0.4080 on the test set using a pre-trained ResNet50 model. This work provides a first step towards the development of production-grade models which predict emotion reaction intensities rather than discrete emotion categories.

研究の動機と目的

  • アクションユニット、感情の価値・覚醒度、カテゴリー分類といった従来の感情表現を越えて、感情計算分野を前進させること。
  • 離散的な感情ラベルではなく、連続的な感情反応強度を予測するモデルを開発すること。
  • 制御されていない現実世界の動画データにおける感情推定の課題に対処すること。
  • デジタル行動ヘルスケア、ロボット工学、メディアアナリティクスにおける実用的応用を進めるために、頑健な感情強度予測を貢献すること。

提案手法

  • 動画フレームからの視覚特徴にのみ特化して学習した、4つの深層ニューラルネットワークを開発した。
  • 視覚的および音声的特徴を併用して学習したマルチモーダルな深層学習モデルを構築し、強度推定の精度を向上させた。
  • 限られたデータでも性能を向上させるために、特徴抽出に事前学習済みのResNet50バックボーンを活用した。
  • 事前学習モデルを感情反応強度の回帰タスクに適応させるため、トランスファー学習の手法を適用した。
  • 連続的な強度予測のため、平均二乗誤差損失関数を最適化に用いた。
  • Hume-Reactionテストセットにおける性能をピアソン相関係数で評価した。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、制御されていない現実世界の動画データにおいて、連続的な感情反応強度を効果的に推定できるか?
  • RQ2音声モダリティを組み込むことで、視覚のみのモデルと比較して、感情強度推定の精度がどの程度向上するか?
  • RQ3視覚のみのモデルは、イン・ザ・ワイルドな状況で微細な感情反応強度を予測する際に、どの程度の性能の上限に達するか?
  • RQ4本研究で提案するアプローチは、価値・覚醒度やカテゴリー分類といった従来の感情計算表現と比較して、どのように異なるか?

主な発見

  • 最高性能を示したモデルは、Hume-Reactionテストセットでピアソン相関係数0.4080を達成し、感情反応強度推定の強力なベースラインを提供した。
  • マルチモーダルモデルは、すべての視覚のみのモデルを上回り、視覚・音声の統合が強度予測において価値があることを示した。
  • 事前学習済みのResNet50バックボーンの使用により、イン・ザ・ワイルドデータセットにおけるモデルの収束性と性能が顕著に向上した。
  • 結果から、感情反応強度は現実世界の設定において、コンピュータビジョンシステムが測定可能な妥当なターゲットであることが示唆された。
  • 本研究は、離散的でない感情カテゴリを超えた連続的な感情強度推定分野における今後の研究の基盤となるベンチマークを確立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。