[論文レビュー] MAE-DFER: Efficient Masked Autoencoder for Self-supervised Dynamic Facial Expression Recognition
MAE-DFER は、大規模なラベルなし顔映像データを用いて事前学習を行う自己教師ありマスク化自己符号化モデルであり、効率的な局所-グローバル相互作用 Transformer(LGI-Former)エンコーダーを採用した動的顔貌表情認識(DFER)フレームワークを提案する。外見の再構成と時間的顔貌運動のモデリングを併せて行うことで性能を向上させ、複数のベンチマークで VideoMAE よりも 38% 少ない FLOPs で最先端の結果を達成した。
Dynamic facial expression recognition (DFER) is essential to the development of intelligent and empathetic machines. Prior efforts in this field mainly fall into supervised learning paradigm, which is severely restricted by the limited labeled data in existing datasets. Inspired by recent unprecedented success of masked autoencoders (e.g., VideoMAE), this paper proposes MAE-DFER, a novel self-supervised method which leverages large-scale self-supervised pre-training on abundant unlabeled data to largely advance the development of DFER. Since the vanilla Vision Transformer (ViT) employed in VideoMAE requires substantial computation during fine-tuning, MAE-DFER develops an efficient local-global interaction Transformer (LGI-Former) as the encoder. Moreover, in addition to the standalone appearance content reconstruction in VideoMAE, MAE-DFER also introduces explicit temporal facial motion modeling to encourage LGI-Former to excavate both static appearance and dynamic motion information. Extensive experiments on six datasets show that MAE-DFER consistently outperforms state-of-the-art supervised methods by significant margins (e.g., +6.30\% UAR on DFEW and +8.34\% UAR on MAFW), verifying that it can learn powerful dynamic facial representations via large-scale self-supervised pre-training. Besides, it has comparable or even better performance than VideoMAE, while largely reducing the computational cost (about 38\% FLOPs). We believe MAE-DFER has paved a new way for the advancement of DFER and can inspire more relevant research in this field and even other related tasks. Codes and models are publicly available at https://github.com/sunlicai/MAE-DFER.
研究の動機と目的
- 教師あり DFER におけるデータ不足問題を、大規模なラベルなし顔映像データを活用することで解決すること。
- DFER における微調整の際の、素朴な Vision Transformer の高い計算コストを克服すること。
- 外見再構成に加えて、時間的顔貌運動を明示的にモデリングすることで表現学習を向上させること。
- DFER 専用の事前学習に適した、VideoMAE よりもより効率的で効果的な代替手法を開発すること。
- 最小限の教師信号で、屋外環境およびラボ環境の両方のデータセットにおいて強力な性能を発揮できるようにすること。
提案手法
- ViT のグローバル自己注意の二次的 FLOP コストを低減するため、効率的な局所-グローバル相互作用 Transformer(LGI-Former)を提案する。
- 高いマスキング比(75–90%)を用いたマスク化自己符号化目的関数を採用し、視覚的外見と時間的運動特徴の両方を再構成する。
- フレーム差分マップの再構成により、顔貌運動を明示的にモデリングすることで、動的表現学習を強化する。
- マスクされた動画トークンから外見コンテンツと運動パターンを同時に再構成するための二重ストリーム再構成ヘッドを導入する。
- 下流の DFER データセットでの微調整の前に、大規模なラベルなし顔映像データ(例:VoxCeleb2)を用いてモデルを事前学習する。
- 軽量なデコーダーを備えた対称的なエンコーダ-デコーダー構造を採用し、マスクされた動画パッチを効率的に再構成する。
実験結果
リサーチクエスチョン
- RQ1大規模なラベルなし顔映像データを用いた自己教師あり事前学習は、教師あり手法と比較して DFER の性能を顕著に向上させることができるか?
- RQ2事前学習段階で時間的顔貌運動を明示的にモデリングすることで、外見のみ再構成する手法と比較して、より優れた動的表情表現が得られるか?
- RQ3より効率的な Transformer アーキテクチャは、VideoMAE と同等またはそれ以上の性能を維持しつつ、微調整段階の計算コストを低減できるか?
- RQ4MAE-DFER は、屋外環境およびラボ環境の両方を含む多様な DFER データセットにどのように一般化するか?
- RQ5MAE-DFER が学習する表現空間は、教師ありおよび自己教師ありベースラインと比較して、分類の分離性とコンパクト性がどの程度向上しているか?
主な発見
- DFEW では、最も優れた教師あり手法よりも +6.30% の UAR を達成し、MAFW では +8.34% の UAR を記録し、優れた一般化性能を示した。
- DFEW では 82.45% の UAR と 80.12% の WAR を達成し、CREMA-D では教師あり手法よりも UAR で 12% 以上も向上した。
- すべてのデータセットで VideoMAE と同等またはそれ以上の性能を維持しながら、推論時の FLOPs を約 38% 削減した。
- t-SNE 視覚化により、MAE-DFER が教師ありおよび VideoMAE ベースラインと比較して、よりコンパクトで分離性の高い顔貌表情埋め込みを学習していることが確認された。
- 3 つの屋外環境データセット(DFEW, FERV39k, MAFW)で最先端の性能を達成し、CREMA-D および RAVDESS ではマルチモーダル手法をも凌駆した。
- 再構成結果から、MAE-DFER は 75–90% の高いマスキング比下でも顔貌表情および運動パターンを効果的に回復できることを示し、優れた空間時間的推論能力を有していることがわかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。