Skip to main content
QUICK REVIEW

[論文レビュー] Context-Dependent Models for Predicting and Characterizing Facial Expressiveness

Victoria Lin, Jeffrey M. Girard|arXiv (Cornell University)|Dec 10, 2019
Emotion and Mood Recognition参考文献 17被引用数 4
ひとこと要約

本稿では、人間がアノテートした表現力スコアを備えたBP4D+データセットの拡張版を紹介し、視覚的情報から一時的な顔の表現力を予測する文脈依存モデルを提案する。統計的および深層学習モデルを用いて、感情的文脈(例:驚き、痛み、嫌悪)ごとに表現力を別々にモデル化することで、正解にほぼ人間水準の相関を達成し、表現力を駆動する文脈特異的な視覚的シグナル(例:アクションユニット強度、顔面の変位)を明らかにした。

ABSTRACT

In recent years, extensive research has emerged in affective computing on topics like automatic emotion recognition and determining the signals that characterize individual emotions. Much less studied, however, is expressiveness, or the extent to which someone shows any feeling or emotion. Expressiveness is related to personality and mental health and plays a crucial role in social interaction. As such, the ability to automatically detect or predict expressiveness can facilitate significant advancements in areas ranging from psychiatric care to artificial social intelligence. Motivated by these potential applications, we present an extension of the BP4D+ dataset with human ratings of expressiveness and develop methods for (1) automatically predicting expressiveness from visual data and (2) defining relationships between interpretable visual signals and expressiveness. In addition, we study the emotional context in which expressiveness occurs and hypothesize that different sets of signals are indicative of expressiveness in different contexts (e.g., in response to surprise or in response to pain). Analysis of our statistical models confirms our hypothesis. Consequently, by looking at expressiveness separately in distinct emotional contexts, our predictive models show significant improvements over baselines and achieve comparable results to human performance in terms of correlation with the ground truth.

研究の動機と目的

  • 視覚的情報から一時的な顔の表現力を自動的に予測する手法の開発。これは人工的社交知能や精神的健康評価の分野において重要である。
  • 異なる感情的文脈における表現力を規定する解釈可能な視覚的シグナル(例:顔の動き、ジェスチャー、身体の姿勢)を特定・特徴づけること。
  • 表現力を示す視覚的シグナルのセットが、感情的文脈(例:驚き対痛み対嫌悪)によって異なるという仮説を検証すること。
  • 応答強度、感情の強度、動きの多様性といった複数の側面からの人間の評価を統合し、潜在変数に基づく一貫性のある表現力スコアを生成することで、堅牢なモデリングを可能にすること。
  • 全感情状態にわたる単一の一般モデルではなく、文脈に特化したモデルを訓練することで、予測性能を向上させること。

提案手法

  • BP4D+データセットに、応答強度、感情の強度、身体・顔の動きに関する人間のアノテーションを追加し、確率的モデリングを用いて潜在変数に基づく表現力スコアを導出。
  • OpenFaceを用いて抽出した視覚特徴(顔のランドマーク、アクションユニット、運動軌跡)を用い、深層学習モデルおよび解釈可能な統計モデル(ElasticNetを含む)を訓練。
  • 感情的文脈(驚き、痛み、嫌悪)ごとにデータをセグメント化して学習することで、文脈依存的なシグナル寄与度をモデル化可能な文脈特化型モデルを設計。
  • 解釈可能な線形モデル(ElasticNet)の特徴重みを用いて、各文脈における特定の視覚的シグナルと表現力との関係を分析・可視化。
  • 正解との相関およびNRMSE指標を用いてモデルを評価し、人間ベースライン性能と比較。統計的有意性検定を実施。
  • 複数側面からの人間評価を統合する潜在変数モデリングを適用し、訓練および評価に用いる一貫性のある統合表現力スコアを生成。

実験結果

リサーチクエスチョン

  • RQ1驚き、痛み、嫌悪といった異なる感情的文脈ごとに表現力を別々にモデル化することで、単一の統合モデルと比較して予測性能が向上するか?
  • RQ2顔のアクションユニット、速度、変位といった特定の視覚的シグナルのうち、どのものが異なる感情的文脈において表現力の予測に最も寄与するか?
  • RQ3同じ視覚的シグナルが、異なる感情状態において表現力にどのように寄与するか、その寄与度の違いはどの程度か?
  • RQ4文脈特化型モデルは、表現力予測において正解との相関で人間水準に達する性能を達成できるか?
  • RQ5解釈可能なモデルの重みは、知られている感情反応と整合性のある心理的妥当性を持つ視覚的シグナルをどのように明らかにするか?

主な発見

  • 文脈特化型モデルは一般モデルおよびベースラインを著しく上回り、正解との相関が0.84に達し、人間ベースラインの0.86に近い水準に達した。
  • ElasticNetモデルは正解との相関が0.84に達し、すべてのベースラインを上回ったが、依然として人間ベースラインより顕著に高いNRMSEと低い相関を示した。
  • 全文脈にわたり、アクションユニット数、アクションユニット強度、点の変位といった顔の運動特徴が表現力の予測に最も予測力を持つシグナルであった。
  • 驚きの文脈では、高い表現力は、点の変位と速度の増加、頭部変位の低下、およびアクションユニット数の増加と関連しており、反射的驚き反応に一致する。
  • 痛みの文脈では、高い表現力はアクションユニット強度と数の増加に関連していたが、点の速度は低く、これは制御された反応や抑制的反応を示唆している。
  • 嫌悪の文脈では、高い表現力はアクションユニット強度、点の変位、および頭部変位の増加に関連しており、不快な刺激からの後退反応に一致する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。