Skip to main content
QUICK REVIEW

[論文レビュー] Deep Covariance Descriptors for Facial Expression Recognition

Naima Otberdout, Anis Kacem|arXiv (Cornell University)|May 10, 2018
Emotion and Mood Recognition参考文献 27被引用数 19
ひとこと要約

本論文では、VGG-faceおよびExpNetから得られる特徴を対称正定値(SPD)行列として表現し、リーマン多様体上に埋め込むことで、顔の表情認識に深く畳み込み特徴記述子を用いる手法を提案する。SPD多様体上にガウス径路関数(RBF)カーネルを適用することで、Oulu-CASIAおよびSFEWデータセットにおいて、全結合層を用いた標準的なソフトマックス分類を上回る最先端の性能を達成した。

ABSTRACT

In this paper, covariance matrices are exploited to encode the deep convolutional neural networks (DCNN) features for facial expression recognition. The space geometry of the covariance matrices is that of Symmetric Positive Definite (SPD) matrices. By performing the classification of the facial expressions using Gaussian kernel on SPD manifold, we show that the covariance descriptors computed on DCNN features are more efficient than the standard classification with fully connected layers and softmax. By implementing our approach using the VGG-face and ExpNet architectures with extensive experiments on the Oulu-CASIA and SFEW datasets, we show that the proposed approach achieves performance at the state of the art for facial expression recognition.

研究の動機と目的

  • 空間的関係を捉えるコン pact で判別力の高い表現に深層CNN特徴を符号化することで、顔の表情認識を向上させること。
  • 顔領域内の空間的依存関係をモデル化する点で、標準的なDCNNの限界を克服すること。
  • 共分散行列の幾何的構造を、対称正定値(SPD)多様体上の点として活用することで分類性能を向上させること。
  • ベンチマークデータセット上で提案手法を評価し、最先端の手法と比較すること。
  • グローバルおよびローカルの共分散記述子が、表情固有のパターンを効果的に捉えられるかを調査すること。

提案手法

  • 顔画像に対して事前学習済みのVGG-faceおよびExpNetモデルから深層畳み込み特徴を抽出する。
  • 512個の特徴マップを統合して1枚の画像あたり1つのSPD行列としてグローバル共分散記述子を計算する。
  • 顔の特徴点を用いて局所的顔領域を検出し、領域固有の特徴マップを抽出してローカル共分散記述子を得る。
  • 各局所的領域の特徴を局所的共分散行列として表現し、SPD行列の集合を形成する。
  • SPD多様体上に有効な正定値ガウスRBFカーネルを適用して、SVMベースの分類を可能にする。
  • SPD行列のリーマン幾何の内在的構造を活用して、多様体の性質を考慮した分類器を訓練および評価する。

実験結果

リサーチクエスチョン

  • RQ1標準的なソフトマックス分類と比較して、深層CNN特徴の共分散記述子が顔の表情認識を向上させられるか?
  • RQ2SPD多様体の幾何的構造が、顔の表情データに対する分類性能をどのように向上させるか?
  • RQ3グローバルおよびローカル共分散記述子を組み合わせることで、単独で使用する場合よりも高い性能が得られるか?
  • RQ4Oulu-CASIAおよびSFEWのような標準ベンチマークにおいて、提案手法は最先端の手法と比較してどのように差をつけるか?
  • RQ5特にSFEWのような困難なデータセットにおいて、顔の特徴点検出の信頼性がローカル共分散記述子の品質に与える影響は何か?

主な発見

  • 提案手法は、同じ評価プロトコルを用いた過去の手法と比較して、Oulu-CASIAデータセットで最先端の性能を達成した。
  • SFEWデータセットでは、複数の最先端手法を大きく上回り、2番目の高い正確度を達成した。
  • SPD多様体上にガウスRBFカーネルを適用することで、全結合層を用いた標準的なソフトマックス分類よりも優れた分類性能が得られた。
  • 可視化結果から、類似した表情(例:笑顔はピンク/紫、驚きは青)に対して一貫した色のパターンが共分散記述子に現れ、判別力のある特徴学習が行われていることが示された。
  • ローカル共分散記述子は、顔領域ごとに明確なパターンを捉えており、空間的モデリングの有効性が示された。
  • SFEWの約30%の画像で顔の特徴点検出に失敗したため、ローカルおよびグローバル記述子を組み合わせた利点がそのデータセットでは制限された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。