Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Stress Detection Using Facial Landmarks and Biometric Signals

Majid Hosseini, Morteza Bodaghi|arXiv (Cornell University)|Nov 6, 2023
Emotion and Mood Recognition被引用数 4
ひとこと要約

本論文は、顔の特徴点(2D-CNN)と生体信号(1D-CNN)を組み合わせる早期統合と後期統合の戦略を用いて、マルチモーダルなストレス検出フレームワークを提案する。早期統合では98.38%の正確性を達成し、後期統合(94.39%)や単モodalモデルを上回り、多様な生理的および視覚的手がかりからの統合的ディープラーニングが、ストレス検出の信頼性と一般化性能を向上させることを示している。

ABSTRACT

The development of various sensing technologies is improving measurements of stress and the well-being of individuals. Although progress has been made with single signal modalities like wearables and facial emotion recognition, integrating multiple modalities provides a more comprehensive understanding of stress, given that stress manifests differently across different people. Multi-modal learning aims to capitalize on the strength of each modality rather than relying on a single signal. Given the complexity of processing and integrating high-dimensional data from limited subjects, more research is needed. Numerous research efforts have been focused on fusing stress and emotion signals at an early stage, e.g., feature-level fusion using basic machine learning methods and 1D-CNN Methods. This paper proposes a multi-modal learning approach for stress detection that integrates facial landmarks and biometric signals. We test this multi-modal integration with various early-fusion and late-fusion techniques to integrate the 1D-CNN model from biometric signals and 2-D CNN using facial landmarks. We evaluate these architectures using a rigorous test of models' generalizability using the leave-one-subject-out mechanism, i.e., all samples related to a single subject are left out to train the model. Our findings show that late-fusion achieved 94.39\% accuracy, and early-fusion surpassed it with a 98.38\% accuracy rate. This research contributes valuable insights into enhancing stress detection through a multi-modal approach. The proposed research offers important knowledge in improving stress detection using a multi-modal approach.

研究の動機と目的

  • 心拍数、EDA、皮膚温などの生体信号と顔の特徴点分析を統合することで、ストレス検出の正確性を向上させること。
  • 異種モダリティ(2D-CNNによる顔の特徴点、1D-CNNによる生体信号)を統合するための早期統合と後期統合手法の有効性を評価すること。
  • 実世界のデータセットを用いた厳密な1人飛ばし交差検証プロトコルにより、モデルの一般化性能を評価すること。
  • 特徴選択手法およびEDAのトニック・フラッシング成分の影響をモデル性能に与える影響を分析すること。
  • モデルの複雑さ、トレーニング時間、推論効率のトレードオフを比較し、計算コストの違いを評価すること。

提案手法

  • 顔の表情の空間的・時間的ダイナミクスをモデル化するため、ビデオデータから2D-CNNを用いて顔の特徴点を抽出した。
  • 心拍数(HR)、皮膚電気反応(EDA)、皮膚温(ST)の生体信号を1D-CNNを用いて処理し、生理的反応の時間的パターンを捉えた。
  • 最終的な全結合DNN層の前に1D-CNNと2D-CNNの特徴を連結することで、早期統合を実装した。
  • 各モダリティを独立して処理し、決定層で要素ごとの平均を用いて予測を統合することで、後期統合を実装した。
  • 入力特徴を最適化するために、複数の特徴選択手法(ランダムフォレストの重要度、再帰的特徴削除、分散しきい値)を適用した。
  • モデルの一般化性能を確保するため、1人飛ばし交差検証戦略を用いてトレーニングおよび評価を実施した。
Figure 1: Illustration of the 68 facial landmarks
Figure 1: Illustration of the 68 facial landmarks

実験結果

リサーチクエスチョン

  • RQ11D-CNN(生体信号)と2D-CNN(顔の特徴点)の早期統合が、マルチモーダルなストレス検出において後期統合を上回るか?
  • RQ2異なる特徴選択手法が、マルチモーダルなストレス検出モデルの性能に与える影響は何か?
  • RQ3EDAのトニック成分とフラッシング成分を含めることで、モデルの正確性と信頼性にどのような影響があるか?
  • RQ4早期統合と後期統合アーキテクチャ間で、計算コスト(トレーニング時間、パラメータ数、推論時間)はどのように変化するか?
  • RQ5マルチモーダル統合は、特に重要な応用分野において、誤って陰性を検出する割合(偽陰性率)を低減できるか?

主な発見

  • 1D-CNN(生体信号)と2D-CNN(顔の特徴点)の早期統合が98.38%の最高正確性を達成し、後期統合(94.39%)を顕著に上回った。
  • EDAのトニックおよびフラッシング成分を含めることで、正確性が3.57%、精度が9.23%、再現率が10.47%、F1スコアが10.71%向上した。
  • ランダムフォレストに基づく特徴選択は96.94%の正確性を達成したが、分散しきい値法では性能が92.76%に低下し、知的特徴削除の重要性が示された。
  • 1D-CNNモデルは23,931個のトレーニング可能なパラメータを有し、最も高い数であったが、トレーニング時間は最短の2,590秒であった。これは、複雑さと速度のトレードオフを示している。
  • 後期統合モデルは、モダリティ固有のネットワークを独立してトレーニングする必要があるため、2,220~2,930秒の長いトレーニング時間を要したが、パラメータ数は少なくてもよかった。
  • 顔の特徴点のみを対象とした2D-CNNモデルは、空間的および時間的顔面ダイナミクスを捉える能力のおかげで、生体信号のみの単モダリティ1D-CNNを上回る優れた性能を示した。
Figure 2: Phasic and Tonic components of raw EDA signal
Figure 2: Phasic and Tonic components of raw EDA signal

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。