Skip to main content
QUICK REVIEW

[論文レビュー] SenTion: A framework for Sensing Facial Expressions

Rahul Islam, Karan Ahuja|arXiv (Cornell University)|Aug 16, 2016
Emotion and Mood Recognition参考文献 38被引用数 7
ひとこと要約

SenTionは、幾何的特徴にInter Vector Angles (IVA)、外見的特徴にHistogram of Gradients (HOG)を融合させた、人物に依存せずスケールに不変な顔の表情認識フレームワークを提案する。ハイブリッドモデルはCK+データセットで97.38%の正確性を達成し、GPU非加速の標準CPU上で15–18 fpsのリアルタイム性能を発揮し、最先端の手法を上回りながらも、リソースが限られた応用に適した計算効率を維持する。

ABSTRACT

Facial expressions are an integral part of human cognition and communication, and can be applied in various real life applications. A vital precursor to accurate expression recognition is feature extraction. In this paper, we propose SenTion: A framework for sensing facial expressions. We propose a novel person independent and scale invariant method of extracting Inter Vector Angles (IVA) as geometric features, which proves to be robust and reliable across databases. SenTion employs a novel framework of combining geometric (IVA's) and appearance based features (Histogram of Gradients) to create a hybrid model, that achieves state of the art recognition accuracy. We evaluate the performance of SenTion on two famous face expression data set, namely: CK+ and JAFFE; and subsequently evaluate the viability of facial expression systems by a user study. Extensive experiments showed that SenTion framework yielded dramatic improvements in facial expression recognition and could be employed in real-world applications with low resolution imaging and minimal computational resources in real-time, achieving 15-18 fps on a 2.4 GHz CPU with no GPU.

研究の動機と目的

  • 多様なデータベースにわたり信頼性高く動作する人物に依存せずスケールに不変な顔の表情認識システムの開発。
  • 既存手法の限界、すなわち高い計算コスト、スケールおよび被験者変動への感受性、データセット間での一般化性の低さを是正すること。
  • 幾何的(IVA)および外見ベース(HOG)特徴を統合したハイブリッド特徴統合モデルを構築し、正確性と頑健性を向上させること。
  • 顔の表情の表現と認識のしやすさを測定する新しいユーザースタディを実施し、実世界における顔の表情認識システムの実用的有用性を検証すること。

提案手法

  • スケールおよび個人特異的変動に不変である新しい幾何的特徴抽出法としてInter Vector Angles (IVA)を提案する。
  • IVA特徴とHistogram of Gradients (HOG)を融合し、形状とテクスチャ両方の情報を捉えるハイブリッド特徴表現を構築する。
  • CK+およびJAFFEデータセットで訓練・交差検証を実施する標準的な分類パイプラインを採用し、特徴選択と分類を実施する。
  • 5名の非俳優を対象に、リッカート尺度を用いて表情の表現しやすさと認識しやすさを評価するユーザースタディを実施し、3名の第三者評価者による盲検評価を実施する。
  • 標準的な指標(正確性、混同行列、フレームレート(15–18 fps))を用いて性能を評価し、GPU非加速の2.4 GHz CPU上で評価を実施する。
  • 一般化性能をテストするためのクロスデータセット評価を実施し、異なるデータセットにおける特徴の優位性(IVA対HOG)を分析する。

実験結果

リサーチクエスチョン

  • RQ1幾何的(IVA)および外見ベース(HOG)特徴を統合したハイブリッドモデルは、複数の顔の表情データベースで優れた安定性を示すか?
  • RQ2提案されたIVAに基づく幾何的特徴は、既存の幾何的または外見ベースの手法と比較して、スケールおよび被験者変動に対する頑健性において優れているか?
  • RQ3実世界の非演技的状況において、顔の表情はどの程度表現しやすく、認識されやすいと人間が感じているか?
  • RQ4提案されたシステムは、GPU非加速の標準CPU上で低計算コストで高い正確性を達成し、リアルタイムでの展開が可能か?

主な発見

  • ハイブリッドなSenTionモデルはCK+データセットで97.38%の正確性を達成し、最先端の手法を上回り、強力な一般化能力を示した。
  • CK+データセットではIVA特徴がより顕著な寄与を示したが、JAFFEデータセットではHOG特徴がより優位であった。これは両特徴の相補的な強みを示している。
  • 2.4 GHz CPU上でGPU非加速でも15–18 fpsのフレームレートを達成した。これは、最小限の計算リソースでリアルタイム応用が可能であることを裏付けた。
  • ユーザースタディの結果、「嬉しい」「驚き」「怒り」の感情が最も表現しやすく、認識されやすく、表現のしやすさと認識のしやすさに強い相関が認められた。
  • 「怒り」「悲しみ」「嫌悪」の間で誤認識が観察された。これは特にJAFFEデータセットで強度の低い表情を示す場合に、幾何的および外見的特徴が重複するためである。
  • ハイブリッドモデル(IVA + HOG)は、単独の特徴セットよりも安定性と正確性に優れており、追加の適応なしに複数のデータセットで有効であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。