[論文レビュー] Multi Modal Facial Expression Recognition with Transformer-Based Fusion Networks and Dynamic Sampling
本論文では、時間的ダイナミクスとクラス不均衡を扱うために、共注意力メカニズムと動的サンプリングを備えたモダリティ統合モジュール(MFM)を用いた、トランスフォーマーに基づくマルチモーダル統合ネットワークを提案する。音声と画像特徴を統合することで、顔の感情認識の性能を向上させた。本手法は、ABAW 2023の検証セットで27.77のF1スコアを達成し、単一モダリティベースラインを上回った。
Facial expression recognition is an essential task for various applications, including emotion detection, mental health analysis, and human-machine interactions. In this paper, we propose a multi-modal facial expression recognition method that exploits audio information along with facial images to provide a crucial clue to differentiate some ambiguous facial expressions. Specifically, we introduce a Modal Fusion Module (MFM) to fuse audio-visual information, where image and audio features are extracted from Swin Transformer. Additionally, we tackle the imbalance problem in the dataset by employing dynamic data resampling. Our model has been evaluated in the Affective Behavior in-the-wild (ABAW) challenge of CVPR 2023.
研究の動機と目的
- 画像のみのアプローチを超えて、音声と視覚モダリティを統合することで、顔の感情認識の精度を向上させること。
- Aff-Wild2データセットにおけるクラス不均衡を、動的データリサンプリングと多数クラスのサブサンプリングによって解消すること。
- 各フレームを中心に複数の動的音声ウィンドウサイズを用いることで、顔の感情の時間的ダイナミクスをモデル化すること。
- 音声と画像モダリティの重要度を特徴統合中に適応的に重みづけする学習可能な統合メカニズムを開発すること。
- Swin Transformerベースのアーキテクチャを用いて、ABAW 2023 AffectNet in-the-wildチャレンジで最先端の性能を達成すること。
提案手法
- 両モダリティに同じTiny Swin Transformerを用いて、音声と画像特徴を別々に抽出する。
- モダリティ統合モジュール(MFM)は、相互注意メカニズムを用いる:音声特徴が画像特徴をクエリし、逆に画像特徴が音声特徴をクエリすることで、モダリティに依存した統合を実現する。
- 相互注意による統合出力(Y_IA と Y_AI)を連結し、さらに2つのトランスフォーマー層を通過させて Y_T を得る。
- 3つの異なる時間的ウィンドウサイズ(小:31フレーム、中:47フレーム、大:63フレーム)を用い、各フレーム周辺の顔の感情変化を捉える。
- 動的サンプリングでは、中心フレームのラベルと80%未満、65%未満、50%未満のフレームが一致するウィンドウを除外することで、ラベルの一貫性を確保する。
- クラス不均衡の是正には、多数クラス(例:「Happiness」)をサブサンプリングし、少数クラスのサンプルはすべて保持する方法を採用する。
実験結果
リサーチクエスチョン
- RQ1学習可能な注目メカニズムを用いた音声・視覚統合は、画像のみのモデルを上回る顔の感情認識性能を実現できるか?
- RQ2音声データの動的ウィンドウサイズ設定は、時間的に変動する顔の感情認識性能にどのように影響するか?
- RQ3動的リサンプリングおよびサブサンプリング戦略は、実世界のデータセットにおける不均衡クラスへの過学習をどの程度軽減できるか?
- RQ4相互注意を用いた提案されたMFMは、単純な早期統合や後期統合を上回るマルチモーダルFER性能を達成できるか?
- RQ5クラス不均衡の状況下で、各モダリティ(画像、音声、統合)が最終予測に果たす寄与度はどの程度か?
主な発見
- 提案モデルは検証F1スコア27.77を達成し、画像のみのベースライン(23.00)および音声のみのモデル(14.12)を顕著に上回った。
- 統合表現(Y_T)単体でもF1スコア25.09を達成し、MFMがマルチモーダルな手がかりを効果的に統合できることを示した。
- 画像、音声、統合特徴のアンサンブルが最高の性能を示し、モダリティ間の補完的特徴が存在することを示した。
- しきい値を設定したウィンドウの一貫性に基づく動的サンプリングの導入により、野生環境データにおける訓練安定性とモデル一般化性能が向上した。
- 多数クラス(「Happiness」)のサブサンプリングにより、過学習が軽減され、少数クラスの性能向上が達成されたが、全体の精度は損なわれなかった。
- ログメルスペクトログ램と224×224の入力解像度を用いたSwin-Tinyバックボーンは、モダリティ固有の特徴抽出および統合の両方において有効であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。