Skip to main content
QUICK REVIEW

[論文レビュー] Multi-modal Affect Analysis using standardized data within subjects in the Wild

Sachihiro Youoku, Takahisa Yamamoto|arXiv (Cornell University)|Jul 7, 2021
Color perception and design参考文献 24被引用数 5
ひとこと要約

本論文は、被験者内での標準化された特徴を用いた、複数モodalで時系列を扱うフレームワークを提案し、野生環境下での顔の感情認識を実現する。画像、AUs、ヘッドポーズ、視線の複数モダリティを統合したGRUネットワークを用い、共通の深層特徴と被験者固有のzスコア正規化特徴を組み合わせることで、ABAW 2021の検証セットにおいて0.546という最先端の表情分類スコアを達成し、ベースラインモデルを著しく上回った。

ABSTRACT

Human affective recognition is an important factor in human-computer interaction. However, the method development with in-the-wild data is not yet accurate enough for practical usage. In this paper, we introduce the affective recognition method focusing on facial expression (EXP) and valence-arousal calculation that was submitted to the Affective Behavior Analysis in-the-wild (ABAW) 2021 Contest. When annotating facial expressions from a video, we thought that it would be judged not only from the features common to all people, but also from the relative changes in the time series of individuals. Therefore, after learning the common features for each frame, we constructed a facial expression estimation model and valence-arousal model using time-series data after combining the common features and the standardized features for each video. Furthermore, the above features were learned using multi-modal data such as image features, AU, Head pose, and Gaze. In the validation set, our model achieved a facial expression score of 0.546. These verification results reveal that our proposed framework can improve estimation accuracy and robustness effectively.

研究の動機と目的

  • 照明、ポーズ、個人差による性能低下が顕著な非制約的、野生環境下の動画設定における感情認識の精度向上を目的とする。
  • 静的フレームベースのモデルの限界を克服し、被験者ごとの顔の表情の時間的ダイナミクスと相対的変化を組み込むこと。
  • 画像、AUs、ヘッドポーズ、視線の複数モダリティ入力を統合し、特徴の被験者固有の標準化を組み合わせることで、耐障害性と精度の向上を図ること。
  • 人間の顔の表情の判断が絶対値ではなく、個々の被験者内での相対的変化に依存するという仮説を検証すること。
  • 顔の表情分類および感情の強さ・覚醒度推定の分野で、ABAW 2021コンテストにおいて最先端の性能を達成すること。

提案手法

  • MTCNNを用いて動画フレームを事前処理し、被験者の顔を分離し、その後HSV色補正を適用して照明のばらつきを補正する。
  • 事前学習済みモデルを用いて複数モダリティの特徴を抽出する:画像特徴にはResNet50、深層埋め込み特徴にはOpenFace 2.2.0を用い、顔のランドマークからAUs、ヘッドポーズ、視線を検出する。
  • 時系列特徴に対して被験者単位の標準化(zスコア化)を適用し、個々の被験者内での相対的変化を強調し、被験者間のばらつきを低減する。
  • 共通の深層特徴と標準化された特徴を統合し、その出力をGRUベースの再帰的ネットワークに供給し、2〜3秒の時間窓内で時間的ダイナミクスをモデル化する。
  • 顔が覆われたり検出不能になったフレームに対しては、線形補間を用いてフレーム欠損補間を行い、シーケンスの連続性を維持する。
  • N=2または3秒の時間系列入力シーケンスをL=6フレームごとにサンプリングし、データバランスと偽ラベル付けを用いて一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1被験者固有の特徴の標準化を組み込むことで、非制約的動画環境下での顔の表情認識精度が向上するか?
  • RQ2画像、AUs、ヘッドポーズ、視線の複数モダリティ統合により、単一モダリティアプローチを上回る感情推定性能が得られるか?
  • RQ3GRUネットワークによる時間的ダイナミクスのモデル化は、フレームレベルのベースラインと比較してどの程度性能を向上させるか?
  • RQ4時系列特徴の次元削減は、過学習の抑制とモデルの一般化性能向上にどの程度寄与するか?
  • RQ5提案されたフレームワークは、ABAW 2021コンテストのベンチマークで最先端の性能を達成できるか?

主な発見

  • 提案手法は、ABAW 2021の検証セットにおいて、0.546の表情分類スコアを達成し、ベースラインを上回り、昨年のコンテストの最良スコアと同等となった。
  • 複数モダリティ入力と被験者標準化特徴を併用したモデル(Multi-modal-std4)が、F1スコア0.488および正答率0.663という最高値を記録した。
  • 被験者単位の標準化が性能向上に顕著に寄与した。これは、人間の感情認識が絶対値ではなく、個々の被験者内での相対的変化に依存するという仮説を支持する。
  • 入力特徴次元を512から300に削減することで、一般化性能が向上し、過学習が軽減され、表情スコアが0.534から0.546に向上した。
  • 検証セットにおける感情の強さ(valence)と覚醒度(arousal)の推定スコアは、それぞれ0.245と0.442であり、連続的感情次元の推定において中程度の性能を示した。
  • フレーム欠損補間により、一時的な顔の覆い隠しや不安定な動画に対する耐性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。