Skip to main content
QUICK REVIEW

[論文レビュー] FEAFA: A Well-Annotated Dataset for Facial Expression Analysis and 3D Facial Animation

Yanfu Yan, Ke Lü|arXiv (Cornell University)|Apr 2, 2019
Face recognition and analysis参考文献 33被引用数 4
ひとこと要約

FEAFAは、122名の参加者から収集された実世界の状況下でのウェブカメラ映像から手動でアノテートされた99,356フレームを含む、顔面表情の新しい高精細データセットである。9つの対称的で10つの非対称的なFACS行動単位(AU)および4つの記述子について、連続的で浮動小数点の強度値(0–1)がアノテートされており、深層畳み込みニューラルネットワーク(CNN)による正確なAU値回帰と、3次元再構築を経由せずに2次元動画からの予測値からブレンドシェイプモデルを駆動することで3次元顔面アニメーションを実現できる。

ABSTRACT

Facial expression analysis based on machine learning requires large number of well-annotated data to reflect different changes in facial motion. Publicly available datasets truly help to accelerate research in this area by providing a benchmark resource, but all of these datasets, to the best of our knowledge, are limited to rough annotations for action units, including only their absence, presence, or a five-level intensity according to the Facial Action Coding System. To meet the need for videos labeled in great detail, we present a well-annotated dataset named FEAFA for Facial Expression Analysis and 3D Facial Animation. One hundred and twenty-two participants, including children, young adults and elderly people, were recorded in real-world conditions. In addition, 99,356 frames were manually labeled using Expression Quantitative Tool developed by us to quantify 9 symmetrical FACS action units, 10 asymmetrical (unilateral) FACS action units, 2 symmetrical FACS action descriptors and 2 asymmetrical FACS action descriptors, and each action unit or action descriptor is well-annotated with a floating point number between 0 and 1. To provide a baseline for use in future research, a benchmark for the regression of action unit values based on Convolutional Neural Networks are presented. We also demonstrate the potential of our FEAFA dataset for 3D facial animation. Almost all state-of-the-art algorithms for facial animation are achieved based on 3D face reconstruction. We hence propose a novel method that drives virtual characters only based on action unit value regression of the 2D video frames of source actors.

研究の動機と目的

  • 既存のデータセットが通常は二値または5段階の強度スケールに限定されていることから、細分化された連続的な顔面表情アノテーションの不足に応えること。
  • 顔面表情分析およびアニメーションの向上を図るため、連続的な顔面行動単位(AU)強度の正確な回帰を可能にすること。
  • 多様な人種的・文化的背景を持つ実世界のデータを用いた、深層学習を用いた統合的AU値回帰のベンチマークを提供すること。
  • 3次元形状再構築を回避する、2次元動画フレームからの直接的なAU値回帰に基づく、新規の3次元顔面アニメーションパイプラインを実証すること。
  • 公開可能で詳細にアノテートされたデータセットを通じて、将来的な顔面表情認識、画像操作、およびアニメーション分野の研究を支援すること。

提案手法

  • FEAFAデータセットは、122名の参加者から123本のウェブカメラ動画を収集することで構築された。
  • 各フレームは、独自開発の「Expression Quantification Tool」を用いて手動でアノテートされ、9つの対称的AU、10つの非対称的AU、2つの対称的AD、2つの非対称的ADに対して、0から1の浮動小数点強度値が割り当てられた。
  • 2次元動画フレームからのすべてのAU強度を同時に回帰するためのベースライン深層学習システムを、畳み込みニューラルネットワーク(CNN)を用いて開発した。
  • 3次元顔面アニメーションパイプラインは、予測されたAU値を用いてブレンドシェイプモデルを駆動する。仮想キャラクターの顔は、ニュートラル状態と表情固有のブレンドシェイプの線形結合として再構築される。
  • 動的なAU依存関係および同時発現パターンを活用することで、アニメーションのリアリズムと時間的整合性を向上させた。
  • システムはAlexNetの特徴量を活用し、3次元再構築を必要とせず、標準的なハードウェアでも18 fps以上のリアルタイム性能を達成した。

実験結果

リサーチクエスチョン

  • RQ1連続的で高解像度のAU強度アノテーション(0–1)は、離散的な5段階スケールと比較して、顔面表情分析の精度を向上させるか?
  • RQ23次元形状再構築を明示的に行わず、2次元動画フレームのみで、どれほどリアルな3次元顔面アニメーションを生成できるか?
  • RQ3細分化されたアノテーションと多様な実世界データを用いた、深層CNNを用いた統合的AU値回帰は、どの程度有効か?
  • RQ4AU関係性および動的依存関係をモデル化することで、より自然で現実的と思える顔面アニメーションを生成できるか?
  • RQ5FEAFAデータセットは、既存のベンチマークと比較して、AU検出および強度推定タスクの支援において、どの程度優れているか?

主な発見

  • FEAFAデータセットには、122名の参加者による123本の動画から得られた99,356フレームが含まれており、25の顔面運動成分(9つの対称的AU、10つの非対称的AU、2つの対称的AD、2つの非対称的AD)について連続的なAU強度アノテーションが付与されている。
  • 提案されたCNNベースのベースラインシステムは、2次元動画フレームからのAU強度の統合的回帰を安定して達成し、正確で連続的な表情表現を可能にした。
  • 3次元顔面アニメーションパイプラインは、2次元動画入力とAU値回帰のみで、3次元再構築を経由せず、リアルなキャラクターのアニメーションを生成した。
  • アニメーションシステムは、標準的な消費者用ハードウェアでも18 fpsを超える速度で動作し、実用的応用におけるリアルタイム実現可能性を示した。
  • 連続的なAU強度アノテーションにより、離散的な5段階スケールと比較して、より正確なAU検出および強度推定が可能になった。AU値は、事前に定義された区間を用いてFACS強度レベルA–Eにマッピングされた。
  • このデータセットは、顔面表情認識、画像操作、および改善された人間-コンピュータインタラクションを含む、幅広い将来的な応用を支援できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。