[論文レビュー] Multi-modal Facial Action Unit Detection with Large Pre-trained Models for the 5th Competition on Affective Behavior Analysis in-the-wild
本稿では、大規模事前学習モデル(Swin Transformer、GH-Feat、HuBERT、RoBERTa)から抽出された視覚的、音声的、語彙的特徴を用いたマルチモーダルな顔の行動単位(AU)検出フレームワークを提示する。超解像と顔のアライメントを用いて視覚的特徴の品質を向上させ、Aff-Wild2の検証セットで52.3%のF1スコアを達成し、リアルワールド環境における頑健なAU検出のためのマルチモーダル統合とデータ前処理の有効性を示している。
Facial action unit detection has emerged as an important task within facial expression analysis, aimed at detecting specific pre-defined, objective facial expressions, such as lip tightening and cheek raising. This paper presents our submission to the Affective Behavior Analysis in-the-wild (ABAW) 2023 Competition for AU detection. We propose a multi-modal method for facial action unit detection with visual, acoustic, and lexical features extracted from the large pre-trained models. To provide high-quality details for visual feature extraction, we apply super-resolution and face alignment to the training data and show potential performance gain. Our approach achieves the F1 score of 52.3% on the official validation set of the 5th ABAW Challenge.
研究の動機と目的
- 異なるリアルワールド条件下でのAU検出の頑健性が、マルチモーダル信号によって向上するかどうかを調査すること。
- 超解像と顔のアライメントが、AU検出のための視覚的特徴品質を向上させる有効性を評価すること。
- 大規模事前学習モデルが、制約のない環境におけるAU検出に一般化可能で判別力のある特徴を生成するかどうかを評価すること。
- 音声およびテキストモダリティ特徴がAU検出性能に果たす貢献を調査すること。
提案手法
- 視覚的特徴はSwin TransformerおよびGH-Featエンコーダーを用いて抽出され、トレーニングデータに対して超解像と顔のアライメントが適用され、事前学習分布からのドメインシフトを低減する。
- 音声的特徴はHuBERTを用いて抽出され、語彙的特徴はRoBERTaによって得られ、両者ともに高レベルの意味的およびプロソディック表現を提供する。
- マルチモーダル特徴はパイプラインの初期段階で統合され、その後GRUを用いた時系列モデリングと線形投影が行われ、順序パターンを捉える。
- 連結・処理された特徴からAUラベルを予測するため、多層パーセプトロン(MLP)が訓練される。
- モデルは、マイニングされたペアワイズAU相関を活用して予測確率の平均化を行うことで検出性能を向上させるAUcorrという手法を採用する。
- 各モダリティおよびコンポonent(視覚、音声、テキスト、時系列特徴)の寄与度を評価するためのアブレーションスタディが実施される。
![Figure 1 : Multi-modal method for facial action unit detection. The inputs from different modalities are passed through different large pre-trained models to extract high-level representations, in this case, Swin Transformer [ 23 ] and GH-Feat encoder [ 31 ] for vision, HuBERT [ 8 ] for audio, and R](https://ar5iv.labs.arxiv.org/html/2303.10590/assets/x1.png)
実験結果
リサーチクエスチョン
- RQ1異なるリアルワールド条件下で、マルチモーダル信号が事前学習モデルのAU検出の頑健性を向上させるか?
- RQ2超解像と顔のアライメントは、低品質な動画フレームに起因する性能低下を低減するのに有効か?
- RQ3大規模スケールの事前学習モデルが、制約のない設定におけるAU検出に信頼性があり一般化可能な特徴表現を生成するか?
- RQ4音声およびテキスト特徴はAU検出性能にどの程度貢献するか?
- RQ5マイニングされたAU相関は、後処理または特徴統合を通じて検出性能を向上させることができるか?
主な発見
- 提案されたマルチモーダルフレームワークは、公式のAff-Wild2検証セットで52.3%のF1スコアを達成し、ベースラインモデルを上回った。
- 超解像と顔のアライメントは視覚的特徴品質を顕著に向上させ、検証セットでそれらを除外するとF1スコアが2.5%低下した。
- 音声モダリティはテストセットの性能向上に最も顕著に寄与し、除外するとF1スコアが2.1%低下した。これは音声が一般化性能に寄与していることを示唆している。
- GRUによる時系列モデリングはテストセットで0.7%の性能向上をもたらし、AU検出における順序的文脈の価値を確認した。
- AUcorrは検証セットでAU24に対して13%、AU26に対して5.2%の性能向上をもたらし、相関に基づく後処理の有効性を示した。
- テキストモダリティはやや低いが一貫した貢献を示し、テストセットでF1スコアを0.8%向上させた。視覚的および音声的特徴とは相補的な情報を提供していると考えられる。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。