Skip to main content
QUICK REVIEW

[論文レビュー] Analyzing the Affect of a Group of People Using Multi-modal Framework

Xiaohua Huang, Abhinav Dhall|arXiv (Cornell University)|Oct 12, 2016
Face and Expression Recognition参考文献 37被引用数 3
ひとこと要約

本論文は、顔、上半身、シーンレベルの手がかりを統合する新しい情報集約手法を用いて、グループレベルの感情認識(GER)のためのマルチモーダルフレームワークを提案する。このアプローチは、2つの挑戦的なデータベースで最先端の性能を達成し、HAPPEIでは平均絶対誤差(MAE)が0.4835、GAFFでは66.67%の正答率を示した。これは、マルチモーダル統合が現実世界の制約のある環境において、信頼性と精度を顕著に向上させることを示している。

ABSTRACT

Millions of images on the web enable us to explore images from social events such as a family party, thus it is of interest to understand and model the affect exhibited by a group of people in images. But analysis of the affect expressed by multiple people is challenging due to varied indoor and outdoor settings, and interactions taking place between various numbers of people. A few existing works on Group-level Emotion Recognition (GER) have investigated on face-level information. Due to the challenging environments, face may not provide enough information to GER. Relatively few studies have investigated multi-modal GER. Therefore, we propose a novel multi-modal approach based on a new feature description for understanding emotional state of a group of people in an image. In this paper, we firstly exploit three kinds of rich information containing face, upperbody and scene in a group-level image. Furthermore, in order to integrate multiple person's information in a group-level image, we propose an information aggregation method to generate three features for face, upperbody and scene, respectively. We fuse face, upperbody and scene information for robustness of GER against the challenging environments. Intensive experiments are performed on two challenging group-level emotion databases to investigate the role of face, upperbody and scene as well as multi-modal framework. Experimental results demonstrate that our framework achieves very promising performance for GER.

研究の動機と目的

  • 顔検出が遮蔽、照明、ポーズの変動によって失敗しやすい、制約のない現実世界環境におけるグループレベルの感情認識の課題に対処すること。
  • 顔レベルの情報が信頼性がない場合に、上半身およびシーンレベルの手がかりが感情認識にどのように補完的役割を果たすかを調査すること。
  • 複数の個人からの集団感情状態を符号化する、集団レベルの表現に変換する、頑健な情報集約手法を開発すること。
  • 顔、上半身、シーン特徴を統合するマルチモーダル統合フレームワークを設計・評価し、GER性能の向上を図ること。
  • HAPPEIおよびGAFFの2つの挑戦的なデータベースを用いて、回帰(幸福度の強度)および分類(ポジティブ/ニュートラル/ネガティブ)の両タスクにおいて、フレームワークの妥当性を検証すること。

提案手法

  • フレームワークは、顔レベル(顔の表情を用いて)、上半身レベル(ポーズと姿勢を用いて)、シーンレベル(文脈的な環境的手がかりを用いて)の3種類の特徴を抽出する。
  • 複数の個人からの集団感情状態を符号化する情報集約手法を提案し、個々のレベルの特徴を集団レベルの表現に変換する。
  • 複数のカーネル学習(MKL)を用いて顔、上半身、シーン特徴を統合するマルチモーダル統合戦略を採用し、一般化性能を向上させるために再考された局所的MKLアプローチを適用する。
  • 社会心理学の原則を想起させる、ハイブリッドなボトムアップ(個々の属性)およびトップダウン(シーンおよび集団構造)のモデリングアプローチを採用する。
  • フレームワークは、回帰(HAPPEIにおける平均絶対誤差)および分類(GAFFにおける認識正答率)の両方の指標を用いて評価される。
  • パラメータチューニングはHAPPEIデータベースで実施され、GAFFデータベースに適用され、データセット間でのモデル構成の一貫性が保証される。

実験結果

リサーチクエスチョン

  • RQ1現実世界の課題(遮蔽、照明、ポーズ変動)により顔検出が失敗した場合、上半身およびシーンレベルの特徴がグループレベルの感情認識を向上させることができるか?
  • RQ2顔、上半身、シーン情報のマルチモーダル統合は、制約のある環境におけるグループ感情認識の信頼性と精度をどのように向上させるか?
  • RQ3多様な社会的状況下で、顔、上半身、シーンモダリティの相対的寄与度は、グループレベルの感情予測にどの程度寄与するか?
  • RQ4提案された情報集約手法は、グループ画像内の複数の個人からの集団感情状態を効果的に符号化できるか?
  • RQ5提案されたマルチモーダルフレームワークは、GEMやCCRFベースのモデルといった既存の最先端手法と比較して、ベンチマークデータセットでどのように性能を発揮するか?

主な発見

  • 提案されたマルチモーダルフレームワークは、HAPPEIデータベースで平均絶対誤差(MAE)0.4835を達成し、すべての単一モダリティベースラインおよび既存のGEMモデルを上回った。
  • 顔のみの性能(MAE = 0.5187)は、最先端のGEMモデルと同等であったが、マルチモーダル統合によりMAEが0.0457低下し、顕著な改善が確認された。
  • 上半身およびシーン特徴の統合は性能向上に寄与しており、シーン特徴のみでHIカーネルにおいてMAE 0.7273を達成した。これは、文脈に依存する感情推論においてシーン特徴の価値を示している。
  • GAFFデータベースでは、マルチモーダルシステムが66.67%の認識正答率を達成し、顔のみ(58.33%)および上半身のみ(46.57%)のベースラインを上回り、より複雑な特徴組み合わせ(67.64%)に近い性能を示した。
  • 提案された情報集約手法は、個々のレベルの手がかりを統合して統一された表現に変換することで、集団レベルの感情を効果的に捉えており、困難な環境下での信頼性を向上させた。
  • 結果から、顔レベルのデータが遮蔽、ポーズ、照明の変動によって信頼性が低下する状況において、マルチモーダル統合がグループレベルの感情認識に不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。