Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Facial Expression Analysis For Dimensional Affect Recognition Using Geometric Features

Vassilios Vonikakis, Stefan Winkler|arXiv (Cornell University)|Jun 15, 2021
Emotion and Mood Recognition参考文献 22被引用数 4
ひとこと要約

本稿では、幾何的特徴量と部分最小二乗法(PLS)回帰を用いた、計算効率の高い顔の感情分析システムを提案する。2次元顔ランドマークから、覚醒度、価値、強度を同時に推定し、深層学習モデルと同等の性能を達成しながら、著しく低い計算コストを実現するとともに、学習された特徴量の直感的な解釈可能性を提供する。

ABSTRACT

Despite their continued popularity, categorical approaches to affect recognition have limitations, especially in real-life situations. Dimensional models of affect offer important advantages for the recognition of subtle expressions and more fine-grained analysis. We introduce a simple but effective facial expression analysis (FEA) system for dimensional affect, solely based on geometric features and Partial Least Squares (PLS) regression. The system jointly learns to estimate Arousal and Valence ratings from a set of facial images. The proposed approach is robust, efficient, and exhibits comparable performance to contemporary deep learning models, while requiring a fraction of the computational resources.

研究の動機と目的

  • 実世界の低強度状況における分類的顔の感情認識の限界を克服するため、次元的感情モデルを採用すること。
  • 制約のない(「野生の」)状況下でも効果的に動作する、軽量で効率的なFEAシステムを開発すること。
  • 2次元顔ランドマークからのみの幾何的特徴量を用いて、覚醒度、価値、強度を同時に推定可能にすること。
  • 顔のランドマーク間の距離を入力特徴量として用いることで、モデルの解釈可能性を確保すること。
  • 深層学習モデルと同等の性能を達成しながら、計算リソースをその数分のの一に抑えること。

提案手法

  • 入力画像から2次元顔ランドマークを検出するために、教師付き降下法(SDM)を用いる。
  • ランドマークに基づく顔の正面化処理を実施し、頭部の姿勢のばらつきを補正することで、非正面視角に対する耐性を向上させる。
  • 49個の顔ランドマーク間の1176組のペアワイズ距離を抽出し、感情表現のための幾何的特徴量とする。
  • 幾何的特徴量から覚醒度、価値、強度を同時に予測する部分最小二乗法(PLS)回帰モデルを学習する。
  • データ拡張のためにMorphSetフレームワークを活用し、分類的データセットをバランスの取れた次元的AVIアノテーション付きデータセットに変換する。
  • 多様な実世界のデータ分布において優れた汎化性能と安定性を示したため、29成分のPLSを選定し、最終モデルとする。

実験結果

リサーチクエスチョン

  • RQ1幾何的特徴量に基づくアプローチは、深層学習モデルと比較して競争力のある性能を達成できるか?
  • RQ2照明やポーズの変動がある実世界の条件下で、本システムはどの程度の性能を示すか?
  • RQ3学習された幾何的特徴量は、心理学的・生理学的観察に基づく顔の変形パターンとどの程度一致するか?
  • RQ4分布外のデータに対して、リッジ回帰やPCRと比較して、PLS回帰はより優れた汎化性能を示すか?
  • RQ5モデルの予測結果は、顔の解剖学的構造と感情的意味の観点から意味的に解釈可能か?

主な発見

  • PLSベースのシステムは、テストセットにおいて覚醒度で平均二乗誤差(MSE)0.0314、価値で0.0388、強度で0.0281を達成し、深層学習モデルと同等の性能を示した。
  • テストした全回帰手法の中で、29成分のPLSがライブウェブカメラ映像の定性的なテストにおいて最も安定かつ頑健な性能を示し、未学習のデータ分布への汎化性能に優れていることが示された。
  • 覚醒度に最も寄与する幾何的特徴量は、目と比較して眉の内側部分との距離に関わる特徴量であり、高覚醒度の表情と psychophysically 観察されるパターンと一致している。
  • 口角の拡散性の増加と内側眉の上昇は、高い価値と強く関連しており、本物の笑顔と偽りの笑顔に関する既存の知見と整合的である。
  • 強度は、主に内側眉から目の距離と口の拡散性に関連する特徴量の組み合わせとして予測された。これは、顔の変形の大きさを反映している。
  • PLSモデルの重みにより、感情に関連する顔の特徴を直感的に解釈可能にした。可視化図において太く、濃い線で示された特徴量は、予測された感情値への寄与度が高かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。