Skip to main content
QUICK REVIEW

[論文レビュー] Deep Multi-Facial Patches Aggregation Network For Facial Expression Recognition

Ahmed Rachid Hazourli, Amine Djeghri|arXiv (Cornell University)|Feb 20, 2020
Emotion and Mood Recognition被引用数 7
ひとこと要約

本稿では、顔の表情認識(FER)のための深層マルチフェイシャルパッチ集約ネットワーク(MFP-CNN)を提案する。この手法は、目の周辺、眉、鼻、口の7つの顔領域から深層特徴を抽出するために、それぞれに特化したサブネットワークを用い、グローバルなCNNを介して特徴を統合する。さらに、条件付きGANと画像変換に基づく2つの新しいデータ拡張技術を導入し、一般化性能を向上させる。CK+データセットにおいて98.07%の正確性を達成し、最新のフレームベース手法を上回る性能を示すとともに、特にニュートラルおよび軽蔑の表情に対する相関問題に対しても効果的に対処している。

ABSTRACT

In this paper, we propose an approach for Facial Expressions Recognition (FER) based on a deep multi-facial patches aggregation network. Deep features are learned from facial patches using deep sub-networks and aggregated within one deep architecture for expression classification . Several problems may affect the performance of deep-learning based FER approaches, in particular, the small size of existing FER datasets which might not be sufficient to train large deep learning networks. Moreover, it is extremely time-consuming to collect and annotate a large number of facial images. To account for this, we propose two data augmentation techniques for facial expression generation to expand FER labeled training datasets. We evaluate the proposed framework on three FER datasets. Results show that the proposed approach achieves state-of-art FER deep learning approaches performance when the model is trained and tested on images from the same dataset. Moreover, the proposed data augmentation techniques improve the expression recognition rate, and thus can be a solution for training deep learning FER models using small datasets. The accuracy degrades significantly when testing for dataset bias.

研究の動機と目的

  • 深層学習ベースのFERにおいて、ラベル付きの顔の表情データセットが限られているという課題に対処するため、学習データを拡張するためのデータ拡張技術を提案すること。
  • 目の周辺、眉、鼻、口といった判別性の高い顔領域に注目し、パッチベースの特徴学習によってFERの性能を向上させること。
  • 複数の顔領域の特徴表現を集約する深層ニューラルネットワークアーキテクチャを構築すること。
  • ラボ環境下と実世界の状況を含むさまざまな条件を持つデータセット間でのモデル一般化性能を評価し、データベースバイアスを主な制限要因として特定すること。
  • CK+データセットにおいて、フレームベースの深層学習モデルとシーケンスベースの手法を比較し、その有効性を検証すること。

提案手法

  • MFP-CNNアーキテクチャは、顔のランドマーク検出を用いて、左目、右目、左眉、右眉、鼻、口、および全体の顔の7つの局所的顔パッチを抽出する。
  • 各顔パッチは、その領域に特化した深層畳み込みサブネットワークによって処理され、階層的な空間的特徴を学習する。
  • 7つのサブネットワークの出力を連結し、グローバルな畳み込みネットワークに供給することで、表情分類に適した高レベルの表現を学習する。
  • 2つのデータ拡張技術を提案する:(1) 条件付きGANを用いた顔の表情生成、(2) カラージャイタ、回転、スケーリングなどの画像変換関数のセットを用いた新しいトレーニングサンプルの合成。
  • モデルは交差エントロピー損失を用いてエンドツーエンドで学習され、CK+、JAFFE、SFEWの3つのベンチマークデータセットで評価される。
  • SFEWデータセットに対して微調整を適用することで、制約のない実世界の顔の表情に対する性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1複数の顔領域からの特徴を集約するパッチベースのディープラーニングアーキテクチャは、全体像を扱う手法と比較してFER性能を向上させることができるか?
  • RQ2提案されたデータ拡張技術(条件付きGANと画像変換)は、小規模な顔の表情データセットにおいて、どの程度モデルの一般化性能を向上させるか?
  • RQ3CK+データセットで学習し、SFEWのような制約のない実世界のデータセットでテストした場合、MFP-CNNの性能はどのようになるか。また、微調整によってドメインシフトの影響を軽減できるか?
  • RQ4なぜモデルの性能がデータセット間評価で著しく低下するのか。また、この低下にデータベースバイアスが果たす役割は何か?
  • RQ5シーケンスベースの手法が優勢であるにもかかわらず、フレームベースのディープラーニングモデルがCK+データセットで最先端の性能を達成できるか?

主な発見

  • MFP-CNNはCK+データセットで98.07%の正確性を達成し、既存のフレームベース手法を上回る性能を示しており、特にニュートラルおよび軽蔑の表情の分類においても高い性能を示している。
  • CK+で学習し、JAFFEデータセットでテストした場合、正確性は61.97%にとどまり、嫌悪とニュートラルの表情の間で高い誤認識が見られ、顕著なドメインシフトが確認された。
  • CK+で学習したモデルを制約のないSFEWデータセットでテストしたところ、正確性はわずか32.7%にとどまり、実世界の状況への一般化性能が著しく低いことが明らかになった。
  • SFEWデータセットの80%でモデルを微調整することで、残りの20%で正確性が86.36%に向上し、ドメインシフトの影響が顕著に軽減されることが示された。
  • 提案されたデータ拡張技術、特に条件付きGANに基づく生成手法は、認識率の向上に寄与し、小規模データセットにおける過学習の緩和に効果的である。
  • 局所的パッチ特徴を用いることで、顔の表情におけるクラス内変動に対して高いロバスト性を示し、同じデータセットでの評価においても高い性能を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。