Skip to main content
QUICK REVIEW

[論文レビュー] Spatio-Temporal AU Relational Graph Representation Learning For Facial Action Units Detection

Zihan Wang, Siyang Song|arXiv (Cornell University)|Mar 19, 2023
Emotion and Mood Recognition被引用数 5
ひとこと要約

本論文は、顔の行動単位(AU)検出のための空間的・時系列的グラフ学習フレームワークを提案する。このフレームワークは、マスクされた自己符号化器(MAE)で事前学習された顔の表現エンコーダ、AUに特化した特徴生成器、空間的および時系列的関係をモデル化するための空間的・時系列的グラフ学習モジュールを活用する。本手法は、テストセットで平均51.3%のF1スコアを達成し、第5回 ABAW 競技会で4位となった。

ABSTRACT

This paper presents our Facial Action Units (AUs) detection submission to the fifth Affective Behavior Analysis in-the-wild Competition (ABAW). Our approach consists of three main modules: (i) a pre-trained facial representation encoder which produce a strong facial representation from each input face image in the input sequence; (ii) an AU-specific feature generator that specifically learns a set of AU features from each facial representation; and (iii) a spatio-temporal graph learning module that constructs a spatio-temporal graph representation. This graph representation describes AUs contained in all frames and predicts the occurrence of each AU based on both the modeled spatial information within the corresponding face and the learned temporal dynamics among frames. The experimental results show that our approach outperformed the baseline and the spatio-temporal graph representation learning allows our model to generate the best results among all ablated systems. Our model ranks at the 4th place in the AU recognition track at the 5th ABAW Competition. Our code is publicly available at https://github.com/wzh125/ABAW-5.

研究の動機と目的

  • 実世界の動画における微細なAU検出の課題、すなわちデータの不均衡と複雑な空間的・時系列的依存関係に対処すること。
  • 異なるAU間の空間的関係と連続する動画フレーム間の時系列的ダイナミクスを同時にモデル化することで、AU認識の向上を図ること。
  • Aff-Wild2データセットにおけるAUアノテーションの不均衡が引き起こすモデルバイアスを、事前学習された顔の表現エンコーダにより軽減すること。
  • AU間の関係性と顔の時系列的変化を明示的にモデル化するグラフベースの表現学習フレームワークを開発すること。
  • 顔の行動分析のための野生環境下(in-the-wild)の第5回 Affective Behavior Analysis in-the-wild (ABAW) 競技会におけるAU検出で最先端の性能を達成すること。

提案手法

  • 人間の顔データベースで事前学習されたマスクされた自己符号化器(MAE)を用いて、入力された顔画像から強力で一般化可能な顔の表現を抽出する。
  • AUに特化した特徴生成器が顔の表現からタスク固有の特徴を抽出し、空間的・時系列的グラフのノード特徴として機能する。
  • 空間的・時系列的グラフ学習(STGL)モジュールは、ノードがフレームごとのAUを表すグラフを構築し、エッジがAU間の空間的関係とフレーム間の時系列的依存関係を符号化する。
  • STGLモジュールは、同じフレーム内の空間的近傍(ノード)と、同じAUシーケンスにおける時系列的近傍(フレーム間)の両方を用いて、各AUノードを更新することで、空間的および時系列的ダイナミクスの共同モデリングを可能にする。
  • 空間的および時系列的グラフ接続を定義するためにK近傍法(K=4)を採用し、グラフ全体にわたる特徴の集約にメッセージパッシングを適用する。
  • 学習にはAdamW(重み減衰5e-4)、コサインスケジューリングの学習率スケーラー、および短いクリップに対して空白フレームをパディングするランダム16フレームクリップ抽出によるデータオーグメンテーションを用いる。

実験結果

リサーチクエスチョン

  • RQ1事前学習されたマスクされた自己符号化器は、データ不均衡な状況下におけるAU検出のための顔の表現学習を改善できるか?
  • RQ2空間的・時系列的グラフ学習モジュールは、AU間の空間的関係とフレーム間の時系列的依存関係をどれほど効果的にモデル化できるか?
  • RQ3空間的および時系列的グラフ構造を併用してモデリングすることで、それぞれを別々にモデル化する場合と比較して、AU検出性能がどの程度向上するか?
  • RQ4MAEの事前学習にハイブリッド顔データセットを用いることで、ImageNetベースの事前学習を上回る性能が得られるか?
  • RQ5本手法は、実世界のAU検出ベンチマークにおいて、最先端の手法と比較してどの程度優れているか?

主な発見

  • 提案手法はテストセットで平均51.3%のF1スコアを達成し、第5回 ABAW 競技会で4位となり、ベースライン(36.5%)およびME-Graph手法(51.0%)を上回った。
  • アブレーションスタディの結果、空間的グラフ学習と時系列的グラフ学習の両方が性能向上に顕著な寄与をしていることが確認され、完全なモデルはバリデーションセットで54.3%のF1スコアを達成した。
  • ハイブリッド顔データセットで事前学習することで、ImageNetベースの事前学習(52.6% F1)と比較して性能が向上(54.3% F1)し、汎用的学習によるドメインのズレの問題が示された。
  • わずかな全体スコアの差異にもかかわらず、稀なAU検出において第1位チーム(Netease Fuxi)を上回る性能を示し、本手法の強靭性を裏付けた。
  • 空間的および時系列的グラフ学習の両方を組み込むことで、最も大きな性能向上が得られ、両方の関係性をモデル化することが重要であることが強調された。
  • バリデーションセットでは、ベースライン(39.0%から54.3%)で平均F1スコアが15.3ポイント向上し、提案フレームワークの有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。