Skip to main content
QUICK REVIEW

[論文レビュー] Deep Representation of Facial Geometric and Photometric Attributes for Automatic 3D Facial Expression Recognition

Huibin Li, Jian Sun|arXiv (Cornell University)|Nov 10, 2015
Face recognition and analysis参考文献 37被引用数 12
ひとこと要約

本論文は、3次元顔スキャンから幾何的および光沢的属性マップ(幾何、法線、曲率、テクスチャ)を抽出し、事前学習済みの畳み込みニューラルネットワーク(CNN)に供給することで、3次元顔の表情認識のためのディープ表現フレームワークを提案する。本手法は、線形SVMの融合を用いてBU-3DFEで84.87%の正確度を達成し、同じプロトコル下で手作業で設計された特徴量や先行の最先端手法を上回る、最先端の性能を発揮する。

ABSTRACT

In this paper, we present a novel approach to automatic 3D Facial Expression Recognition (FER) based on deep representation of facial 3D geometric and 2D photometric attributes. A 3D face is firstly represented by its geometric and photometric attributes, including the geometry map, normal maps, normalized curvature map and texture map. These maps are then fed into a pre-trained deep convolutional neural network to generate the deep representation. Then the facial expression prediction is simplyachieved by training linear SVMs over the deep representation for different maps and fusing these SVM scores. The visualizations show that the deep representation provides a complete and highly discriminative coding scheme for 3D faces. Comprehensive experiments on the BU-3DFE database demonstrate that the proposed deep representation can outperform the widely used hand-crafted descriptors (i.e., LBP, SIFT, HOG, Gabor) and the state-of-art approaches under the same experimental protocols.

研究の動機と目的

  • 照明やポーズの変化に対処できない2次元FERの限界を、3次元顔の幾何と光沢データを活用することで克服する。
  • 密な対応関係と登録に依存するモデルベースの3次元FER手法が抱える被験者バイアスと高い計算コストを克服する。
  • 市販のディープ特徴量を用いて、完全に自動的で、頑健かつ判別力のある3次元顔の表情表現を開発する。
  • 標準化されたプロトコル下で、3次元属性マップのディープ表現が、手作業で設計された特徴量や最先端手法を上回ることを実証する。

提案手法

  • 3次元顔スキャンを、幾何マップ、法線マップ(x, y, z成分)、曲率マップ、テクスチャマップの4つの2次元属性マップとして表現する。
  • 事前学習済みのVGG-verydeep-19 CNNを用い、各属性マップから畳み込み特徴量を抽出する。このCNNは微調整するか、そのまま使用する。
  • CNNの最終全結合層から各マップごとにディープ特徴量を抽出し、顔の属性を高次元で非線形に符号化する。
  • 各マップのディープ特徴量に対して、別個の線形SVMを学習し、顔の表情を予測する。
  • 意思決定レベルでSVMスコアを統合して、最終的な表情予測を生成する。
  • 学習されたフィルターや特徴マップの可視化により、ディープ表現の完全性と判別力の妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ13次元顔の幾何的および光沢的属性のディープ表現は、従来の手作業で設計された特徴量(例:LBP、SIFT、HOG、Gabor)よりも、3次元FERで優れた性能を発揮するか?
  • RQ2属性マップに事前学習済みのCNNを適用することで、3次元顔の表情認識に向けたより判別力があり、包括的な特徴表現が得られるか?
  • RQ3標準化されたプロトコル下で、本手法は最先端の3次元FER手法と比較して、正確性と頑健性の点で優れているか?
  • RQ4特に恐怖や悲しみといった難しいクラスにおいて、ディープ表現が判別能力をどの程度維持できるか?
  • RQ5市販のディープ特徴量と単純な線形SVMを組み合わせることで、非線形カーネルや複数カーネル学習を用いた複雑なモデルを上回ることができるか?

主な発見

  • 提案されたディープ表現は、BU-3DFEデータセットのプロトコルIで平均83.48%、プロトコルIIで84.87%の認識正確度を達成し、表VIIに示されたすべての最先端手法を上回った。
  • Gabor特徴量よりも判別力が高く、特に恐怖の表情を区別する能力が優れており、正しく分類された割合が68.19%に達した(Gabor特徴量では62.84%)。
  • 可視化された学習済みフィルターより、ディープ特徴量が局所的および大域的な顔の構造を捉えていることが確認され、完全性と高い判別能力を示している。
  • 複雑なモデルの微調整や複数カーネル学習を一切必要とせず、線形SVMと1種類のディープ特徴量のみでSOTAの結果を達成した。
  • プロトコルIとIIの性能差は、プロトコルIIが被験者バイアスを含んでいることを示しており、本手法はより忠実なプロトコルIでも頑健かつ信頼性がある性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。