Skip to main content
QUICK REVIEW

[論文レビュー] A Multi-term and Multi-task Analyzing Framework for Affective Analysis in-the-wild

Sachihiro Youoku, Yuushi Toyoda|arXiv (Cornell University)|Sep 29, 2020
Emotion and Mood Recognition参考文献 20被引用数 4
ひとこと要約

本論文は、Aff-Wild2データセットからの動画データを用いて、屋外環境(in-the-wild)における感情分析のためのマルチターム・マルチタスクフレームワークを提案する。短時間、中時間、長時間の時間窓にわたり、マルチモodal特徴(アクションユニット、ヘッドポーズ、視線、ポーズ、ディープ特徴)を抽出し、各時間窓ごとにモデルをアンサンブルし、マルチタスク学習により価値・覚醒度と顔の表情予測タスクを統合する。その結果、価値・覚醒度予測で0.498、表情予測で0.471の検証スコアを達成した。

ABSTRACT

Human affective recognition is an important factor in human-computer interaction. However, the method development with in-the-wild data is not yet accurate enough for practical usage. In this paper, we introduce the affective recognition method focusing on valence-arousal (VA) and expression (EXP) that was submitted to the Affective Behavior Analysis in-the-wild (ABAW) 2020 Contest. Since we considered that affective behaviors have many observable features that have their own time frames, we introduced multiple optimized time windows (short-term, middle-term, and long-term) into our analyzing framework for extracting feature parameters from video data. Moreover, multiple modality data are used, including action units, head poses, gaze, posture, and ResNet 50 or Efficient NET features, and are optimized during the extraction of these features. Then, we generated affective recognition models for each time window and ensembled these models together. Also, we fussed the valence, arousal, and expression models together to enable the multi-task learning, considering the fact that the basic psychological states behind facial expressions are closely related to each another. In the validation set, our model achieved a valence-arousal score of 0.498 and a facial expression score of 0.471. These verification results reveal that our proposed framework can improve estimation accuracy and robustness effectively.

研究の動機と目的

  • 屋外環境の動画データにおいて、照明、ポーズ、表情のばらつきが感情認識を困難にするため、感情分析の精度を向上させること。
  • 感情的表現には異なる時間的ダイナミクスが存在するため、最適な特徴抽出のための複数時間スケール分析の必要性に対処すること。
  • 価値・覚醒度と顔の表情予測の両タスクを統合したマルチタスク学習により、モデルのロバスト性と性能を向上させること。
  • OpenFace、ResNet50、EfficientNet、OpenPoseなどのモダリティごとに、次元削減と重要度に基づく選択を用いて特徴抽出を最適化すること。
  • データバランス、時間窓の拡張(3秒窓を含む)、特徴選択の有効性を検証し、モデルの汎化性能を向上させること。

提案手法

  • 事前学習済みモデルを用いて動画フレームからマルチモーダル特徴を抽出:OpenFace(49次元:AUs、ヘッドポーズ、視線)、ResNet50/EfficientNet(2048次元 → PCAを用いて200次元/300次元に圧縮)、OpenPose(75次元のポーズ特徴)。
  • 短時間(1秒)、中時間(6秒)、長時間(12秒)の複数の時間窓を設定し、0.2秒のシフトを適用することで、動的な感情的側面を捉えるマルチターム特徴を生成した。
  • 価値・覚醒度予測(回帰、カスタム評価指標:2×CCC − MSE)と表情分類(多クラス、7クラス、評価指標:式3)のそれぞれに対して、独立したLightGBMモデルを学習した。
  • 時間窓ごとのモデルをアンサンブルし、エアリー・ストッピングとハイパーパramータチューニング(学習率、num_leaves、max_depth、min_child_samplesのグリッドサーチ)を適用した。
  • 価値・覚醒度と表情予測のモデルをマルチタスク学習により統合し、共有表現を活用して汎化性能を向上させた。
  • データバランス、3秒窓の導入、LightGBMの特徴重要度に基づく特徴選択を用いて、モデル性能を最適化した。

実験結果

リサーチクエスチョン

  • RQ1複数の時間スケール(短時間、中時間、長時間)で感情状態をモデル化することで、屋外動画における価値・覚醒度と表情推定の精度が向上するか?
  • RQ2価値・覚醒度と表情認識の複数タスクを統合することで、単一タスクモデルよりも性能が向上するか?
  • RQ3特徴抽出戦略(例:ResNet50対EfficientNet、PCA圧縮、特徴選択)が、モデルのロバスト性と精度に与える影響は何か?
  • RQ4データバランス処理と長時間窓(例:3秒)の導入が、現実世界の感情動画データにおけるモデルの汎化性能にどの程度寄与するか?
  • RQ5マルチタームモデリングは、驚き(短時間)や混乱(長時間)といった感情的表現の時間的ダイナミクスを効果的に捉えることができるか?

主な発見

  • マルチタームモデルは単一タームモデルを上回り、検証セットで価値・覚醒度スコアが0.480に上昇した(中時間ベースラインでは0.396)。
  • マルチタスクモデルは、価値・覚醒度スコア0.482、表情スコア0.432を達成し、ベースライン(0.190および0.360)を著しく上回った。
  • 3秒窓の導入と特徴選択により性能が向上し、最良の提出(submit.4)では価値・覚醒度スコア0.479、表情スコア0.495を達成した。
  • 最終モデル(EfficientNet、データバランス処理、3秒窓、特徴抽出を統合)は、検証セットで価値・覚醒度スコア0.498、表情スコア0.471を達成した。
  • アブレーションスタディにより、データバランス処理と特徴選択が多様な屋外環境下でのロバスト性と汎化性能の向上に寄与することが確認された。
  • 結果から、マルチタスク学習とマルチタームモデリングが、時間的ダイナミクスと共有される感情表現を同時に捉えることで、性能向上に寄与することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。