[論文レビュー] Interpretable Multimodal Emotion Recognition using Facial Features and Physiological Signals
本稿では、ビデオ入力からのrPPG信号と顔面特徴を、エアリー融合およびレイト融合戦略を用いて統合する解釈可能なマルチモーダル感情認識フレームワークを提案する。順列特徴重要度(PFI)を適用することで、モダリティの寄与度を定量化し、IEMOCAPデータセットで54.61%の精度を達成した。視覚的特徴が分類性能に62.33%、rPPGが37.67%の寄与を示した。
This paper aims to demonstrate the importance and feasibility of fusing multimodal information for emotion recognition. It introduces a multimodal framework for emotion understanding by fusing the information from visual facial features and rPPG signals extracted from the input videos. An interpretability technique based on permutation feature importance analysis has also been implemented to compute the contributions of rPPG and visual modalities toward classifying a given input video into a particular emotion class. The experiments on IEMOCAP dataset demonstrate that the emotion classification performance improves by combining the complementary information from multiple modalities.
研究の動機と目的
- 非侵襲的生理的(rPPG)および視覚的(顔面)信号を統合することで、感情分類を向上させるマルチモーダル感情認識システムの開発。
- マルチモーダルAIモデルにおける解釈不能性の問題に対処するため、各モダリティの寄与度を定量化するPFIベースの手法を導入。
- 動的rPPGと静的顔面特徴を統合する際のエアリー融合およびレイト融合戦略の有効性を評価。
- 特に微細な感情状態を捉える上で、マルチモーダル統合が単一モダリティアプローチを上回ることを実証。
- 感情計算アプリケーションにおける実世界での展開を想定し、透明性と解釈可能性を備えたAI出力を提供。
提案手法
- rPPG信号は、顔領域検出にハールカスケードを用い、顔領域内(ROI)のRGB平均強度を計算することで、式(1)で定義されるようにビデオフレームから抽出される。
- 顔面特徴は、Face Scrubデータセットで訓練されたDlibの68点顔ランドマーク検出器を用いて抽出され、空間的顔面配置を捉える。
- 2つの独立したディープラーニングモデルを訓練する:rPPG信号にはReLU活性化関数を備えたCNNを、顔面特徴にはResNet-34ベースのアーキテクチャを用いる。
- エアリー融合は、分類の前にrPPGと顔面特徴の埋め込みを直接統合するのに対し、レイト融合は各モダリティを独立して処理し、予測結果を統合する。
- 順列特徴重要度(PFI)を適用して、特徴値をランダムにシャッフルした際のモデル性能の低下を測定することで、モダリティ寄与度を推定する。
- 各モダリティのPFIスコアは、元の特徴集合とシャッフル済み特徴集合における期待モデルスコアの差として定式化され、式(5)で明示されている。

実験結果
リサーチクエスチョン
- RQ1rPPGと顔面特徴のエアリー統合とレイト統合は、感情認識精度においてどのように比較されるか?
- RQ2rPPG信号と顔面特徴の間で、最終的な感情分類意思決定に寄与する相対的な割合はどの程度か?
- RQ3順列特徴重要度は、感情認識におけるマルチモーダル入力の解釈可能性を効果的に定量化できるか?
- RQ4マルチモーダル統合は、IEMOCAPデータセットにおいて単一モダリティモデルよりも顕著に性能を向上させるか?
- RQ5本稿で提案するフレームワークは、実世界の多様な感情表現を含む動画データに適用した場合、どの程度の頑健性を示すか?
主な発見
- エアリー融合モデルは、IEMOCAPデータセットで最高の感情分類精度54.61%を達成し、個々のモダリティモデルを上回った。
- 順列特徴重要度による測定結果、rPPGモダリティが最終分類性能に37.67%、顔面特徴が62.33%の寄与を示した。
- 個々のrPPGモデルは37.45%の精度、顔面特徴モデルは46.42%の精度を達成し、視覚的特徴の優れた識別力が示された。
- レイト統合は41.17%の精度にとどまり、エアリー統合より低い性能を示した。これは、エアリー統合がより優れたクロスマodal表現学習を可能にしていることを示唆する。
- エアリー融合モデルのF1スコアは0.57であり、感情クラス間で精度と再現率のバランスの取れた妥当なトレードオフが実現された。
- 結果から、補完的モダリティを統合することで、マルチモーダル感情認識システムの耐障害性と精度が向上することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。