Skip to main content
QUICK REVIEW

[論文レビュー] From Static to Dynamic: Adapting Landmark-Aware Image Models for Facial Expression Recognition in Videos

Yin Chen, Jia Li|arXiv (Cornell University)|Dec 9, 2023
Emotion and Mood Recognition被引用数 4
ひとこと要約

本論文では、時間的モデリングアダプタ(TMAs)と新規の感情アンカーに基づく自己蒸留損失(SDL)を統合することで、事前学習済みのランドマークに敏感な画像モデルを動的顔認識(DFER)動画にパrameter効率的かつ効果的に適応するS2Dというフレームワークを提案する。本手法は、DFEWでSOTA性能を達成し、追加パラメータが10%未塔に抑えられ、曇ったラベルに対するロバスト性とランドマークに敏感な特徴を用いた時間的ダイナミクスのモデリングを著しく向上させる。

ABSTRACT

Dynamic facial expression recognition (DFER) in the wild is still hindered by data limitations, e.g., insufficient quantity and diversity of pose, occlusion and illumination, as well as the inherent ambiguity of facial expressions. In contrast, static facial expression recognition (SFER) currently shows much higher performance and can benefit from more abundant high-quality training data. Moreover, the appearance features and dynamic dependencies of DFER remain largely unexplored. To tackle these challenges, we introduce a novel Static-to-Dynamic model (S2D) that leverages existing SFER knowledge and dynamic information implicitly encoded in extracted facial landmark-aware features, thereby significantly improving DFER performance. Firstly, we build and train an image model for SFER, which incorporates a standard Vision Transformer (ViT) and Multi-View Complementary Prompters (MCPs) only. Then, we obtain our video model (i.e., S2D), for DFER, by inserting Temporal-Modeling Adapters (TMAs) into the image model. MCPs enhance facial expression features with landmark-aware features inferred by an off-the-shelf facial landmark detector. And the TMAs capture and model the relationships of dynamic changes in facial expressions, effectively extending the pre-trained image model for videos. Notably, MCPs and TMAs only increase a fraction of trainable parameters (less than +10\%) to the original image model. Moreover, we present a novel Emotion-Anchors (i.e., reference samples for each emotion category) based Self-Distillation Loss to reduce the detrimental influence of ambiguous emotion labels, further enhancing our S2D. Experiments conducted on popular SFER and DFER datasets show that we achieve the state of the art.

研究の動機と目的

  • 限られた、曇った、多様性に欠ける動画データのための静的顔認識(SFER)と動的顔認識(DFER)の性能格差を是正すること。
  • 豊富で高品質なSFERデータセットと事前学習済み画像モデルを、DFERの事前知識として活用すること。
  • 再訓練を一切行わず、軽量アダプタを用いて時間的ダイナミクスを効果的にモデリングすること。
  • 感情アンカーを用いた新規の自己蒸留損失により、曇った感情ラベルの影響を低減すること。
  • 再訓練なしで、計算コストを最小限に抑えつつ、既存手法を上回るパラメータ効率的かつ実用的なDFERフレームワークを構築すること。

提案手法

  • マルチビュー補完プロンプタ(MCPs)を備えた事前学習済みビジョントランスフォーマー(ViT)をSFERデータで微調整し、ランドマークに敏感な外見特徴を強化する。
  • 時間的モデリングアダプタ(TMAs)を画像モデルに挿入することで、動画クリップ内の逐次的ダイナミクスを捉え、エンドツーエンドの動画レベル学習を可能にする。
  • MCPsは、事前学習済み検出器(MobileFaceNet)から得た顔ランドマーク特徴を統合し、幾何的顔構造を反映した外見表現を豊かにする。
  • 感情アンカーに基づく自己蒸留損失(SDL)は、各感情カテゴリごとに参照サンプルを用いてソフトラベルを生成し、曇った表現におけるモデルの不確実性を低減する。
  • S2Dフレームワークは、ベース画像モデルと比較してわずかに900万パラメータ(約10%増加)の追加可学習パラメータでエンドツーエンドに訓練される。
  • t-SNEと注視可視化を用いて特徴の識別性と時間的注視パターンを分析し、モデルが動的変化を捉える能力を検証する。

実験結果

リサーチクエスチョン

  • RQ1追加パラメータを最小限に抑えながら、事前学習済みのランドマークに敏感な画像モデルを動画ベースの顔認識に効果的に適応できるか?
  • RQ2軽量かつ効率的な方法で、顔の表情における時間的ダイナミクスを効果的にモデリングできるか?
  • RQ3感情アンカーを用いた自己蒸留により、DFERデータセットにおける曇った感情ラベルの影響をどの程度低減できるか?
  • RQ4静的SFERの知識と動的動画モデリングを統合することで、野生環境下のDFERベンチマークでSOTA性能を達成できるか?
  • RQ5既存のSOTA手法と比較して、本手法はパラメータ効率性と性能の両面で優れているか?

主な発見

  • S2Dは、DFEWテストセットで78.9%の新しいSOTAの加重平均リcall(WAR)を達成し、MAE-DFER や DFER-CLIP などの先行手法を上回る性能を示した。
  • 本モデルは、ベース画像モデルと比較してわずか900万のチューナブルパラメータでこの性能を達成しており、10%未塔のパラメータ増加に抑えられた。
  • TMAsの導入により、t-SNE可視化で示されるように、特徴の識別性が著しく向上し、よりコンパクトで分離性の高い特徴クラスタが得られた。
  • SDLモジュールにより予測の曇りが低減された。例えば、曇ったケースにおいて「happy」と「neutral」の信頼度差は0.02から0.23に上昇した。
  • 注視可視化により、モデルが時間経過とともに顔の領域(目、口)を動的に注視していることが確認され、筋肉の動きの変化を捉えていることが示された。
  • データ不足にもかかわらず、『disgust』や『fear』のようなレアクラスでも性能が向上したが、サンプル数が限られているため依然として挑戦的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。