Skip to main content
QUICK REVIEW

[論文レビュー] An Ensemble Approach for Facial Expression Analysis in Video

Hong-Hai Nguyen, Van Thong Huynh|arXiv (Cornell University)|Mar 24, 2022
Emotion and Mood Recognition被引用数 10
ひとこと要約

本稿では、RegNet、GRU、Transformerの融合によるマルチモーダル特徴を用いた、連続的価値・覚醒度推定のためのアンサンブル深層学習手法を提案する。局所的アテンションを組み込んだ手法は、Aff-Wild2検証セットで平均CCC 0.507を達成し、先行手法およびベースラインを約2倍上回る性能を発揮した。

ABSTRACT

Human emotions recognization contributes to the development of human-computer interaction. The machines understanding human emotions in the real world will significantly contribute to life in the future. This paper will introduce the Affective Behavior Analysis in-the-wild (ABAW3) 2022 challenge. The paper focuses on solving the problem of the valence-arousal estimation and action unit detection. For valence-arousal estimation, we conducted two stages: creating new features from multimodel and temporal learning to predict valence-arousal. First, we make new features; the Gated Recurrent Unit (GRU) and Transformer are combined using a Regular Networks (RegNet) feature, which is extracted from the image. The next step is the GRU combined with Local Attention to predict valence-arousal. The Concordance Correlation Coefficient (CCC) was used to evaluate the model.

研究の動機と目的

  • 制御のない現実世界の動画環境における連続的価値・覚醒度推定を改善すること。
  • 深層学習を用いた感情行動分析における時系列モデリングと特徴表現の課題に取り組むこと。
  • マルチモーダル特徴の統合とアンサンブル学習により、訓練効率と予測精度を向上させること。
  • 局所的アテンションがGRUベースの時系列モデリングの性能向上に与える有効性を検証すること。
  • ABAW3 2022 価値・覚醒度推定サブチャレンジで最先端の性能を達成すること。

提案手法

  • 視覚的特徴は、ImageNetで事前学習済みの微調整済みRegNetバックボーンを用いて抽出される。
  • 顔面特徴の時系列的表現にGRUおよびTransformerエンコーダーを適用し、その表現を連結することでマルチモーダル特徴が生成される。
  • 二段階のフレームワークが採用される:第一段階ではマルチモーダル統合により強化された特徴が得られ、第二段階ではGRUに局所的アテンションを組み合わせた時系列ダイナミクスがモデル化される。
  • 個々のモデルの訓練には5分割交差検証(K=5)が用いられ、その予測結果をアンサンブルすることで耐性を高める。
  • 最適化にはAdamオプティマイザが用いられ、ベース学習率は0.001、訓練エポック数は25回である。
  • 損失は、GRU、Transformer、最終出力ヘッドからの個別損失の重み付き組み合わせにより計算され、CCCが主な評価指標として用いられる。

実験結果

リサーチクエスチョン

  • RQ1GRUとTransformerのマルチモーダル統合は、動画における価値・覚醒度推定のための特徴表現を向上させることができるか?
  • RQ2GRU層に局所的アテンションを統合することで、連続的感情認識における時系列モデリング性能が向上するか?
  • RQ3K分割交差検証に基づくアンサンブルモデルは、単一モデルベースラインと比較して一般化性能および耐性に優れているか?
  • RQ4従来のバックボーン(例:ResNet)と比較して、RegNetベースの特徴は訓練速度および精度にどの程度寄与するか?
  • RQ5提案手法は、Aff-Wild2ベンチマークにおける価値・覚醒度推定で、既存の最先端手法を上回ることができるか?

主な発見

  • 提案手法は、Aff-Wild2検証セットで平均CCC 0.507を達成し、ベースライン手法(0.24)を顕著に上回った。
  • K分割交差検証のアンサンブルモデルは平均CCC 0.465を示し、個々のフォールドと比較して安定性および一般化性能が向上した。
  • 局所的アテンションを組み込んだGRUはCCC 0.507を達成し、単体のGRU(0.504)と比較してわずかだが一貫した改善が確認された。
  • RegNet特徴を用いたGRUとTransformerのマルチモーダル統合はCCC 0.478を達成し、効果的な特徴表現学習が可能であることを示した。
  • 同ベンチマークにおいて、Dengら(0.494)およびZhangら(0.495)の先行最先端手法を上回った。
  • アクションユニット検出において、本手法はRegNet特徴を用いてF1スコア0.533を達成し、ベースライン(0.39)を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。