[論文レビュー] Spatial and Temporal Networks for Facial Expression Recognition in the Wild Videos
本論文では、空間的および時間的モデリングを用いて、屋外環境における顔の感情認識を向上させるために、ResNet50、CNN-RNN、CNN-Transformerアーキテクチャを組み合わせたアンサンブルモデルを提案する。VGGFace2で事前学習することで、屋外環境の変動に強い性能が得られ、アンサンブルはABAW 2021の検証セットでF1スコア0.4133、正解率0.6216、最終評価指標0.4821を達成した。
The paper describes our proposed methodology for the seven basic expression classification track of Affective Behavior Analysis in-the-wild (ABAW) Competition 2021. In this task, facial expression recognition (FER) methods aim to classify the correct expression category from a diverse background, but there are several challenges. First, to adapt the model to in-the-wild scenarios, we use the knowledge from pre-trained large-scale face recognition data. Second, we propose an ensemble model with a convolution neural network (CNN), a CNN-recurrent neural network (CNN-RNN), and a CNN-Transformer (CNN-Transformer), to incorporate both spatial and temporal information. Our ensemble model achieved F1 as 0.4133, accuracy as 0.6216 and final metric as 0.4821 on the validation set.
研究の動機と目的
- 多様な背景や照明条件を伴う制約のない実世界の動画環境における顔の感情認識の課題に対処する。
- VGGFace2のような大規模な顔認識データセットからの事前学習重みを活用することで、モデルの一般化性能を向上させる。
- 動画データの連続フレームにおける空間的特徴と時間的ダイナミクスを効果的に捉える。
- ABAW 2021の顔の感情認識ベンチマークにおける性能向上を図る、多様なアーキテクチャを統合した頑健なアンサンブルフレームワークを開発する。
提案手法
- VGGFace2データセットからの重みで初期化された事前学習済みResNet50モデルを用い、制約のない環境下での特徴抽出を改善する。
- ResNet50が各フレームから空間的特徴を抽出し、2層のGRUがフレーム列を処理して時間的依存性をモデル化するCNN-RNNアーキテクチャを実装する。
- RNNの代わりにマルチヘッド自己注意機構を用いることで、長距離時間的関係をより効率的に捉えるCNN-Transformerモジュールを統合する。
- Transformerにおける正弦波位置エンコーディングを適用し、フレーム順序情報を保持する。
- 3つのモデル(ResNet50、CNN-RNN、CNN-Transformer)の予測結果を重み付き平均により統合し、最終アンサンブル出力を得る。
- 4枚のGPUを用いた10エポックにわたる学習でSGDを適用し、複数段階の学習率スケジューリングを実装。学習では9フレームのシーケンスを用い、many-to-manyモードで学習し、推論ではmany-to-oneモードを採用。
実験結果
リサーチクエスチョン
- RQ1大規模な顔認識データで事前学習することで、制約のない顔の感情認識における性能がどの程度向上するか?
- RQ2RNNベースとTransformerベースの時間的モデリングアプローチは、顔の感情動画における逐次的ダイナミクスをどの程度異なって捉えているか?
- RQ3CNN、CNN-RNN、CNN-Transformerという多様なアーキテクチャのアンサンブルは、ABAW 2021の顔の感情認識ベンチマークで個々のモデルを上回る性能を発揮できるか?
- RQ4空間的および時間的モデリングコンponentsの統合は、最終的なF1スコアおよび統合評価指標にどのように影響を与えるか?
主な発見
- アンサンブルモデルは最終評価指標0.4821を達成し、ベースラインのVGG-Faceモデル(0.36)に対して顕著な向上を示した。
- VGGFace2でResNet50を事前学習することで、F1スコアは0.3763から0.4124に、正解率は0.5713から0.6216に向上し、大規模事前学習の有効性が裏付けられた。
- CNN-RNNおよびCNN-Transformerモジュールは、それぞれF1スコア0.4126および0.4127を達成し、時間的モデリングにおいて優れた性能を示した。
- 3つのモデルを統合した完全なアンサンブルは、最高のF1スコア(0.4133)、正解率(0.6216)、最終評価指標(0.4821)を達成し、モデルアンサンブルの有効性を確認した。
- 事前学習済みResNet50はAU検出タスクでも強力な性能を示し、最終指標0.6734を達成し、学習済み特徴の転移可能性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。