Skip to main content
QUICK REVIEW

[論文レビュー] FERA 2017 - Addressing Head Pose in the Third Facial Expression Recognition and Analysis Challenge

Michel Valstar, Enrique Sánchez|arXiv (Cornell University)|Feb 14, 2017
Emotion and Mood Recognition参考文献 26被引用数 7
ひとこと要約

本論文は、BP4D+データセットを用いて多様な頭部ポーズ下でのアクションユニット(AU)検出と強度推定に焦点を当てた、FERA 2017を提示する。9つの合成2次元ビューを3次元データから導出し、前方視点(5番と6番)でのみ学習された幾何的特徴を用いたCRF/CORFモデルを採用。限られた学習データにもかかわらず、あらゆるビューで頑健な性能を発揮し、特に極端なポーズ(1番と9番)での改善の余地が著しく大きいことが示された。

ABSTRACT

The field of Automatic Facial Expression Analysis has grown rapidly in recent years. However, despite progress in new approaches as well as benchmarking efforts, most evaluations still focus on either posed expressions, near-frontal recordings, or both. This makes it hard to tell how existing expression recognition approaches perform under conditions where faces appear in a wide range of poses (or camera views), displaying ecologically valid expressions. The main obstacle for assessing this is the availability of suitable data, and the challenge proposed here addresses this limitation. The FG 2017 Facial Expression Recognition and Analysis challenge (FERA 2017) extends FERA 2015 to the estimation of Action Units occurrence and intensity under different camera views. In this paper we present the third challenge in automatic recognition of facial expressions, to be held in conjunction with the 12th IEEE conference on Face and Gesture Recognition, May 2017, in Washington, United States. Two sub-challenges are defined: the detection of AU occurrence, and the estimation of AU intensity. In this work we outline the evaluation protocol, the data used, and the results of a baseline method for both sub-challenges.

研究の動機と目的

  • 特に非前方視点において、多様な頭部ポーズ下での顔の表情認識のためのベンチマークデータの不足に対処すること。
  • 既存のベンチマークであまり検討されていないが、極めて重要な側面であるAU強度推定の評価を可能にすること。
  • 単一の表情クリップにとどまらず、自然な表情の遷移を伴う長時間で非セグメンテーションされた動画シーケンスをサポートすること。
  • 顔の表情認識システムの比較可能性と再現可能性を向上させるための標準化された評価プロトコルを提供すること。
  • 制御されたラボ環境と実世界の状況の間のギャップを埋めるために、変動するカメラ角度と表情強度を模擬すること。

提案手法

  • BP4D+データセットの3次元ソースデータを用いて、頭部ポーズに基づく幾何的投影により9つの合成2次元ビューを生成した。
  • 前方視点(5番と6番)でのみ学習された条件付きランダムフィールド(CRF)および制約付き順序回帰森(CORF)モデルを採用し、非前方視点への一般化を保証した。
  • 追跡された顔のランドマークから幾何的特徴を抽出し、顔の形状とダイナミクスを符号化。次元削減には相関特徴選択(CFS)を適用。
  • 時間的モデリングのためスライディングウィンドウ法(90フレーム、30フレームのシフト)を採用。フレーム単位の予測は最尤推定により集約。
  • 非前方視点を標準的な前方視点空間に投影するための前方化技術を用い、ポーズ間での特徴の一貫性を向上させた。
  • 複数の指標を用いて性能を評価:AU発生にはF1、正解率、2AFC。強度推定にはICC、RMSE、PCC。

実験結果

リサーチクエスチョン

  • RQ1前方視点でのみ学習した顔の表情認識システムは、現実世界の極端な頭部ポーズに効果的に一般化できるか?
  • RQ2学習データが前方視点に限定されている場合、異なるカメラ視点におけるAU強度推定の性能はどのように変化するか?
  • RQ3ポーズの変動や部分的閉塞が生じる状況下で、幾何的特徴とCRFモデリングがAU検出および強度推定にどれほど向上効果をもたらすか?
  • RQ4特にゼロ強度のAUに顕著なクラス不均衡が生じる場合、強度推定モデルの信頼性にどのような影響を与えるか?
  • RQ5前方データでのみ学習した1つのモデルが、幾何的前方化と時間的モデリングを用いて非前方視点でも頑健な性能を達成できるか?

主な発見

  • ベースラインシステムは、視点4の学習データが存在しないにもかかわらず、全視点でAU発生検出に非自明な性能を示し、F1スコアが前方視点(例:視点4は視点5と6とほぼ同等に性能を発揮)と近い水準に達した。
  • 極端な視点(例:視点1と9)では性能が著しく低下しており、深刻なポーズ変動への対処の余地が依然として大きいことが示された。
  • 強度推定に関しては、常に最頻値クラスを予測する場合より高い性能を示し、いくつかのAUではICCスコアが0.5を超えたが、AU1、AU4、AU17については高すぎるクラス不均衡(約90%がゼロ強度)のためICCが低く抑えられた。
  • RMSEとICCの結果は、クラス不均衡の影響にもかかわらず、常に確率的予測より優れており、モデルが意味のある強度パターンを学習していることが確認された。
  • 前方化技術により、特に視点4における性能が向上した。これは、幾何的正規化がポーズに起因するばらつきを軽減するのに有効であることを示唆している。
  • 時間的モデリングを組み込んだCRF/CORFモデルは、フレーム単位のベースラインを上回り、欠損またはノイズのあるフレームの処理においても、時間的ダイナミクスを活用できる点で優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。