[論文レビュー] Emotion Separation and Recognition from a Facial Expression by Generating the Poker Face with Vision Transformers
本論文では、ペairedデータなしで感情を顔の表情から分離するためのVision Transformerベースのモデル、PF-ViTを提案する。マスクド自己符号化と敵対的学習を用いることで、4つのリアルなFERベンチマークで最先端の性能を達成し、それぞれ92.07%(RAF-DB)、67.23%(AffectNet-7)、64.10%(AffectNet-8)、91.16%(FERPlus)の精度を達成した。
Representation learning and feature disentanglement have garnered significant research interest in the field of facial expression recognition (FER). The inherent ambiguity of emotion labels poses challenges for conventional supervised representation learning methods. Moreover, directly learning the mapping from a facial expression image to an emotion label lacks explicit supervision signals for capturing fine-grained facial features. In this paper, we propose a novel FER model, named Poker Face Vision Transformer or PF-ViT, to address these challenges. PF-ViT aims to separate and recognize the disturbance-agnostic emotion from a static facial image via generating its corresponding poker face, without the need for paired images. Inspired by the Facial Action Coding System, we regard an expressive face as the combined result of a set of facial muscle movements on one's poker face (i.e., an emotionless face). PF-ViT utilizes vanilla Vision Transformers, and its components are firstly pre-trained as Masked Autoencoders on a large facial expression dataset without emotion labels, yielding excellent representations. Subsequently, we train PF-ViT using a GAN framework. During training, the auxiliary task of poke face generation promotes the disentanglement between emotional and emotion-irrelevant components, guiding the FER model to holistically capture discriminative facial details. Quantitative and qualitative results demonstrate the effectiveness of our method, surpassing the state-of-the-art methods on four popular FER datasets.
研究の動機と目的
- 顔の表情認識(FER)データセットにおける曖昧さとノイズを軽減するため、感情を関係のない顔の変動から分離する。
- 顔の詳細に明示的な監視がないため、アイデンティティ、ポーズ、照明に敏感な教師ありFER手法の限界を克服する。
- マスクド自己符号化による自己教師付き事前学習を活用し、ラベルなし顔画像のみでエンドツーエンドの感情表現学習を可能にする。
- 感情分類とリアルなポーカーフェイス生成を同時に実行する統合フレームワークを開発し、耐性と分離性を向上させる。
- ハイブリッドアーキテクチャや大規模事前学習データが不要な、アンマスクドVision TransformerがSOTAのFER性能を達成できることを示す。
提案手法
- 大規模なラベルなし顔の表情データセット上でVision Transformerをマスクド自己符号化器(MAE)として事前学習し、強力で汎用性の高い表現を学習する。
- エンコーダ、トークン分離器、生成器、識別器、分類ヘッドからなる新規アーキテクチャ、PF-ViTを設計する。
- エンコーダを用いて顔画像を潜在表現にマップし、分離器がその表現を感情固有の成分と直交する感情無関係な残差に分解する。
- 生成器を、元の表現のある顔を再構築し、感情無関係な成分からリアルなポーカーフェイスを合成するように敵対的学習で訓練する。識別器を用いる。
- 生成器と識別器をエンコーダとともに敵対的損失を用いて同時に訓練し、ペアドデータがなくても高精細なポーカーフェイス合成を可能にする。
- 分類ヘッドを用いて、感情成分のみを入力として使用し、全モデルを微調整して離散的 emotion カテゴリを認識する。
実験結果
リサーチクエスチョン
- RQ1大規模事前学習データやハイブリッドアーキテクチャが不要な、アンマスクドVision Transformerが、ペアドデータなしで最先端のFER性能を達成できるか?
- RQ2自己教師付き表現学習と敵対的生成を用いて、潜在空間で感情と非感情的顔の成分を効果的に分離できるか?
- RQ3分離表現としてのポーカーフェイス(感情のない顔)を生成することで、顔の表情認識の耐性と精度が向上するか?
- RQ4提案手法は、ペアドデータを必要とせず、アイデンティティの変動やノイズのあるラベルを含むリアルなデータセットにも一般化可能か?
- RQ5事前学習時のマスキング比が、最終的なFERモデルの性能と生成されたポーカーフェイスの品質にどのように影響するか?
主な発見
- PF-ViTは、RAF-DBデータセットで92.07%という新たな最先端の精度を達成し、従来手法を上回った。
- AffectNet-7では67.23%の精度を達成し、既存のSOTA手法を上回った。
- AffectNet-8では64.10%の精度を達成し、より困難でノイズの多いデータセットでも強力な性能を示した。
- FERPlusデータセットでは91.16%の精度を達成し、多様なベンチマークにわたる耐性を確認した。
- アブレーションスタディの結果、トレーニング時のマスキング比が高いほどFER性能が低下し、最良の精度はトレーニング時マスキング比0.5、推論時0の組み合わせで達成された。
- 推論時において、生成器と識別器は削除可能であり、最終的な分類タスクに計算コストを追加しない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。