Skip to main content
QUICK REVIEW

[論文レビュー] Feature Decomposition and Reconstruction Learning for Effective Facial Expression Recognition

Delian Ruan, Yan Yan|arXiv (Cornell University)|Apr 12, 2021
Emotion and Mood Recognition参考文献 31被引用数 11
ひとこと要約

本稿では、顔の動きに配慮した潜在表現と、特徴の再構成を用いた内的および外部的関係モジュールにより、共有される表現の類似性と表現固有の変異を明示的にモデル化する、顔の表情認識のための新規な深層学習フレームワーク、特徴分解・再構成学習(FDRL)を提案する。FDRLは、特徴を顔の動きに配慮した潜在表現に分解し、それらを再構成することで、RAF-DBで89.47%、SFEWで62.16%の最先端性能を達成し、微細な表情の識別において優れた性能を示している。

ABSTRACT

In this paper, we propose a novel Feature Decomposition and Reconstruction Learning (FDRL) method for effective facial expression recognition. We view the expression information as the combination of the shared information (expression similarities) across different expressions and the unique information (expression-specific variations) for each expression. More specifically, FDRL mainly consists of two crucial networks: a Feature Decomposition Network (FDN) and a Feature Reconstruction Network (FRN). In particular, FDN first decomposes the basic features extracted from a backbone network into a set of facial action-aware latent features to model expression similarities. Then, FRN captures the intra-feature and inter-feature relationships for latent features to characterize expression-specific variations, and reconstructs the expression feature. To this end, two modules including an intra-feature relation modeling module and an inter-feature relation modeling module are developed in FRN. Experimental results on both the in-the-lab databases (including CK+, MMI, and Oulu-CASIA) and the in-the-wild databases (including RAF-DB and SFEW) show that the proposed FDRL method consistently achieves higher recognition accuracy than several state-of-the-art methods. This clearly highlights the benefit of feature decomposition and reconstruction for classifying expressions.

研究の動機と目的

  • 顔の動きの高さの類似性により引き起こされる微細な表情の違いを区別する課題に対処すること。
  • 特徴表現における共有される表情の類似性と表現固有の変異を明示的にモデル化すること。
  • 潜在特徴における内部的および外部的関係の学習により、微細な表情認識を向上させること。
  • FARのための判別的特徴学習を強化する統合的でエンド・トゥ・エンドで訓練可能なフレームワークを開発すること。

提案手法

  • 特徴分解ネットワーク(FDN)は、バックボーンから抽出された特徴を、顔の動きに配慮した潜在特徴に分解し、共通表現学習を促進するためにコンパクトネス損失を用いる。
  • 特徴再構成ネットワーク(FRN)は、2つのモジュールを用いて元の表情特徴を再構成する:内部関係モジュール(Intra-RM)は各潜在特徴内の内部的関係をモデル化し、外部関係モジュール(Inter-RM)は潜在特徴間の外部的関係をモデル化する。
  • Intra-RMは各潜在特徴の重要度重み(Intra-W)を計算し、判別的成分を強調する。一方、Inter-RMは特徴間の依存関係を捉え、表現を精緻化する。
  • このフレームワークは、バックボーンCNN、FDN、FRN、および表情予測ヘッドをエンド・トゥ・エンドの訓練スキームで統合する。
  • FDNでは、表現の類似性を捉える密度的でコンactな潜在特徴表現を促進するために、コンパクトネス損失が用いられる。
  • 再構成損失により、FRNが元の表情特徴を回復するよう学習され、判別的情報が保持される。

実験結果

リサーチクエスチョン

  • RQ1共有および固有の表情特徴の明示的分解が、微細な表情カテゴリの認識性能を向上させるか?
  • RQ2潜在特徴間の内部的および外部的関係が、微細な表情の違いを区別するためにどのように寄与するか?
  • RQ3表現の類似性と変異を別々にモデル化することで、ラボ内および屋外の両方のデータセットでの一般化性能が向上するか?
  • RQ4特徴の再構成が、顔の表情認識における判別的特徴学習をどの程度向上させるか?

主な発見

  • FDRLはRAF-DBデータセットで89.47%の認識精度を達成し、最先端手法を上回っている。
  • SFEWデータセットでは、62.16%の精度を達成し、屋外で困難なデータに対して強い性能を示している。
  • t-SNE可視化により、FDRL特徴はベースラインモデルと比較して、クラス間分離性が高く、クラス内分散が小さいことが確認された。
  • 平均Intra-Wベクトルの分布から、異なる表情が異なる潜在特徴を活性化しており、一部の特徴は複数の表情で類似した重みを示していることがわかった。これは、Inter-RMの必要性を裏付けている。
  • アブレーションスタディにより、FDNとFRN、特にIntra-RMとInter-RMの組み合わせが性能向上に不可欠であることが確認された。
  • バックボーン、FDN、FRNを統合した完全なFDRLモデルが最良の性能を達成しており、共同の分解・再構成学習パラダイムの有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。