Skip to main content
QUICK REVIEW

[論文レビュー] Attended End-to-end Architecture for Age Estimation from Facial Expression Videos

Wenjie Pei, Hamdi Dibeklioğlu|arXiv (Cornell University)|Nov 23, 2017
Face recognition and analysis参考文献 60被引用数 12
ひとこと要約

本稿では、顔の表情動画からの年齢推定のためのエンド・ツー・エンドのアテンションベースの深層学習モデルであるSIAMを提案する。このモデルは、空間的外見特徴を抽出するための畳み込みネットワークと、時間的ダイナミクスをモデル化するための再帰的ネットワークを組み合わせており、空間的および時間的アテンション機構によって強化されている。モデルは大規模データセットにおいて最先端の性能を達成しており、特に十分な訓練データが用意されている場合に顕著な精度向上と解釈可能性の向上を示している。これは、外見とダイナミクスの共同最適化によって実現されている。

ABSTRACT

The main challenges of age estimation from facial expression videos lie not only in the modeling of the static facial appearance, but also in the capturing of the temporal facial dynamics. Traditional techniques to this problem focus on constructing handcrafted features to explore the discriminative information contained in facial appearance and dynamics separately. This relies on sophisticated feature-refinement and framework-design. In this paper, we present an end-to-end architecture for age estimation, called Spatially-Indexed Attention Model (SIAM), which is able to simultaneously learn both the appearance and dynamics of age from raw videos of facial expressions. Specifically, we employ convolutional neural networks to extract effective latent appearance representations and feed them into recurrent networks to model the temporal dynamics. More importantly, we propose to leverage attention models for salience detection in both the spatial domain for each single image and the temporal domain for the whole video as well. We design a specific spatially-indexed attention mechanism among the convolutional layers to extract the salient facial regions in each individual image, and a temporal attention layer to assign attention weights to each frame. This two-pronged approach not only improves the performance by allowing the model to focus on informative frames and facial areas, but it also offers an interpretable correspondence between the spatial facial regions as well as temporal frames, and the task of age estimation. We demonstrate the strong performance of our model in experiments on a large, gender-balanced database with 400 subjects with ages spanning from 8 to 76 years. Experiments reveal that our model exhibits significant superiority over the state-of-the-art methods given sufficient training data.

研究の動機と目的

  • 顔の表情動画からの年齢推定において、従来のハンドクラフト特徴量手法の限界を克服し、外見とダイナミクスの共同学習を可能にする。
  • エンド・ツー・エンドのフレームワーク内で、顕著な顔領域を捉える空間的アテンションと、情報量の多い動画フレームを特定する時間的アテンションを統合することで、性能を向上させる。
  • 特定の顔領域や動画フレームが年齢推定予測にどのように寄与しているかを可視化することで、解釈可能性を提供する。
  • 訓練データ量の増加に伴うモデルのスケーラビリティと性能向上の程度を評価する。特に、ハンドクラフト特徴量ベースラインと比較しての性能差を検証する。

提案手法

  • 個々の顔の表情動画フレームから潜在的外見表現を抽出するために畳み込みニューラルネットワーク(CNN)を用いる。
  • 時間的経過に伴う表情の変化を捉えるために、連続するフレーム間の時間的ダイナミクスをモデル化するための再帰的ニューラルネットワーク(RNN)を採用する。
  • 各フレーム内の顕著な顔領域(例:しわ、目)を強調するため、畳み込み層内に空間的にインデックスされたアテンション機構を導入する。
  • RNNの出力上に時間的アテンション層を適用し、年齢推定に対する関連性に基づいてフレームに動的重みを割り当てる。
  • 手動による特徴量設計を一切行わず、CNN、RNN、アテンションモジュール、回帰ヘッドを含む全アーキテクチャをエンド・ツー・エンドで同時に学習する。
  • 400名の被験者(年齢8〜76歳)からなる、性別がバランス取れた大規模データセットを訓練および評価に使用し、データサイズおよび表情タイプに影響する要因についてのアブレーションスタディを実施。

実験結果

リサーチクエスチョン

  • RQ1顔の表情動画からの年齢推定において、エンド・ツー・エンドの深層学習モデルが外見と時間的ダイナミクスを共同最適化できるか?
  • RQ2空間的および時間的アテンション機構の統合が、年齢推定における性能向上と解釈可能性にどのように寄与するか?
  • RQ3訓練データ量の増加に伴い、モデルの性能が顕著に向上するか。特に、ハンドクラフト特徴量手法と比較しての差異は?
  • RQ4大規模データセットでは優れた性能を示すが、UvA-NEMO 憎悪データセット(小規模)ではなぜ性能が劣化するのか?

主な発見

  • 大規模なUvA-NEMO スマイルデータベース(1,000本以上)では、SIAMは平均絶対誤差(MAE)4.74年を達成し、ハンドクラフト特徴量を用いた最先端手法を顕著に上回った。
  • 訓練データ量の増加に伴い、モデルの性能が著しく向上する傾向を示しており、より多くのデータがあればさらなる性能向上が期待できる。
  • 小規模なUvA-NEMO 憎悪データベース(518本)では、SIAMのMAEは6.96年となり、ハンドクラフト特徴量ベースラインを上回らなかった。主な要因は訓練データの制限にある。
  • スマイルデータベースのポーズ付きサブセット(643本)での評価では、SIAMのMAEは6.41年に上昇した。これは、データサイズと表情タイプが性能に影響を与えることを示している。
  • 空間的および時間的アテンション機構により、年齢推定に関連する顔領域(例:目や口の周辺)や情報量の多いフレームを可視化したアテンションマップを提供した。
  • アブレーションスタディの結果、アテンション機構を統合したエンド・ツー・エンドの共同学習が、分離された特徴設計よりも優れた特徴学習と回帰精度を実現していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。