[論文レビュー] Mutilmodal Feature Extraction and Attention-based Fusion for Emotion Estimation in Videos
本論文は、長さが異なる動画から視覚的・音声的・ポーズ特徴を統合する、注目メカニズムに基づくマルチモーダル融合フレームワークを提案する。時間的特徴にクロスアテンションを適用し、注意された表現を連結することで、ABAW 2023ベンチマークで検証F1スコア0.361を達成し、初期融合および単一モodalベースラインを上回った。
The continuous improvement of human-computer interaction technology makes it possible to compute emotions. In this paper, we introduce our submission to the CVPR 2023 Competition on Affective Behavior Analysis in-the-wild (ABAW). Sentiment analysis in human-computer interaction should, as far as possible Start with multiple dimensions, fill in the single imperfect emotion channel, and finally determine the emotion tendency by fitting multiple results. Therefore, We exploited multimodal features extracted from video of different lengths from the competition dataset, including audio, pose and images. Well-informed emotion representations drive us to propose a Attention-based multimodal framework for emotion estimation. Our system achieves the performance of 0.361 on the validation dataset. The code is available at [https://github.com/xkwangcn/ABAW-5th-RT-IAI].
研究の動機と目的
- 複数のモーダルティ(視覚的・音声的・ポーズ)を活用することで、野生環境下における感情行動分析の性能を向上させ、より強固な感情推定を実現すること。
- 異なるデータストリームからの補完的情報を統合することで、単一モーダルアプローチの限界を克服すること。
- 注目メカニズムを用いて、複数モーダルの間で関連する文脈的特徴を重みづけすることで、感情ダイナミクスの時間的モデリングを強化すること。
- ABAW 2023 感情行動分析 in-the-wild チャレンジで最先端の性能を達成すること。
提案手法
- AffectNetで事前学習したFAN(顔アライメントネットワーク)を用いて顔特徴を抽出し、Aff-Wild2で微調整することで顔表現学習を向上させた。
- 1秒のウィンドウと500msのホップサイズを用いたDenseNet121を用いて音声特徴を抽出し、1024次元の埋め込みを生成した。
- 0.5秒間隔でOpenPoseを用いて2次元ポーズ座標を抽出し、動的ポーズシーケンスを生成した。
- 2層のRNNを用いて、顔・音声・ポーズ特徴シーケンスの時間的依存性を個別にモデリングした。
- 現在のフレームの顔特徴をクエリとして用い、各モーダルの時間的コンテキストに注目するクロスアテンションモジュールを実装した。
- 3つの注目された特徴表現と現在の顔特徴を連結し、全結合層を通過させて表情予測を行った。
実験結果
リサーチクエスチョン
- RQ1視覚的・音声的・ポーズ特徴の注目ベース統合は、初期融合や遅延融合と比較して感情推定性能を向上させるか?
- RQ2複数モーダルからの長距離時間的コンテキスト統合は、制約のない動画環境下での感情認識のロバストネスをどのように向上させるか?
- RQ3推論時に他のモーダルからの関連する文脈的情報を動的に重みづけるためにクロスアテンションメカニズムを用いることで、どのような影響が生じるか?
- RQ4提案フレームワークは異なるデータ分割に一般化可能であり、ABAW 2023検証セットでも高い性能を維持するか?
主な発見
- 注目ベース統合モデルは検証F1スコア0.361を達成し、初期融合(0.318)および単一モーダルベースラインを上回った。
- 5番目の分割で最高の平均F1スコア(35.5%)を達成し、公式分割では全体で最高の性能(33.7%)を示した。
- 注目統合戦略により、「怒り」(32% F1)や「驚き」(28% F1)といった難易度の高いクラスの性能が顕著に向上し、しばしば予測不足となる傾向に改善が見られた。
- クロスアテンションの使用により、音声・ポーズ・視覚的シーケンスからの関連する時間的コンテキストを動的に注目できるようになり、特徴表現の質が向上した。
- 5つのランダムなデータ分割にわたって優れた一般化性能を示し、F1スコアは30.0%から35.5%の範囲で変動した。
- FANをAff-Wild2で微調整することで顔特徴の品質が向上し、全体の性能向上に寄与した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。