Skip to main content
QUICK REVIEW

[論文レビュー] ForDigitStress: A multi-modal stress dataset employing a digital job interview scenario

Alexander Heimerl, Pooja Prajod|arXiv (Cornell University)|Mar 14, 2023
Emotion and Mood Recognition被引用数 5
ひとこと要約

本論文では、40名の参加者が模擬デジタル面接を受ける状況で収集された、音声、映像(顔面のランドマーク、モーショングラフ、眼動追跡)、生理的信号(PPG、EDA)を含む、多モodalなストレスデータセット「ForDigitStress」を紹介する。このデータセットには、連続的なストレスおよび感情のアノテーションが付随しており、評価者間の整合性が高く(Cohenのκ > 0.7)、ニューラルネットワークを用いたモダリティ統合に早期PCAを適用した最良のモデルでは、二値ストレス分類で88.3%の正解率と87.5%のF1スコアを達成した。

ABSTRACT

We present a multi-modal stress dataset that uses digital job interviews to induce stress. The dataset provides multi-modal data of 40 participants including audio, video (motion capturing, facial recognition, eye tracking) as well as physiological information (photoplethysmography, electrodermal activity). In addition to that, the dataset contains time-continuous annotations for stress and occurred emotions (e.g. shame, anger, anxiety, surprise). In order to establish a baseline, five different machine learning classifiers (Support Vector Machine, K-Nearest Neighbors, Random Forest, Long-Short-Term Memory Network) have been trained and evaluated on the proposed dataset for a binary stress classification task. The best-performing classifier achieved an accuracy of 88.3% and an F1-score of 87.5%.

研究の動機と目的

  • デジタル面接を用いた、実用的で検証済みのストレス誘発プロトコルの開発を目的とし、人間のストレス反応を研究する。
  • 制御されたが生態的妥当性のある環境下で、参加者から音声、映像、生理的信号の多モーダルデータを収集・同期する。
  • 自己報告および専門家によるアノテーションを備えた、高品質で時間連続的なデータセットを構築し、機械学習応用のためのものとする。
  • 特に眼動追跡および瞳孔特徴量が、自動ストレス認識にどの程度有効であるかを評価する。
  • 唾液コルチゾールレベルの測定により、ストレス誘発の生物学的妥当性を検証する。

提案手法

  • 参加者たちは、ストレス誘発を目的としたリモートでのデジタル面接を受験し、Social Signal Interpretation(SSI)フレームワークを用いて複数センサーを同期して記録した。
  • 多モーダルデータには、音声(GEMAPS特徴量)、映像(OpenPoseのボディキーポイント、顔面ランドマーク、アクションユニット)、眼動追跡(瞳孔径、自己符号化器で学習した潜在特徴量)、生理的信号(HRVのためのPPG、EDA)が含まれる。
  • ストレスおよび感情のアノテーションは、自己報告と2名の経験豊富な心理学者によるフレーム単位のラベル付けにより作成され、評価者間整合性はCohenのkappa係数で評価された。
  • ストレス誘発の生物学的妥当性を検証するため、面接前後における唾液コルチゾールレベルを測定した。
  • HRV、EDA、顔面アクションユニット、音声特徴量、瞳孔ダイナミクスを含む包括的な特徴量セットを構築し、早期および後期のPCAを用いた次元削減を実施した。
  • SVM、KNN、ランダムフォレスト、フィードフォワードNN、LSTMの5種類の機械学習分類器を、二値ストレス分類タスクに適用し、個々のモダリティおよび統合戦略のアブレーションスタディを実施した。

実験結果

リサーチクエスチョン

  • RQ1デジタル面接は、参加者の主観的ストレスと生物学的ストレスを信頼性高く誘発できるか?
  • RQ2特に瞳孔ダイナミクスとHRVといった多モーダル特徴量は、リアルタイムでのストレス認識にどの程度効果的か?
  • RQ3顔の表情、EDA、HRVといった個々のモダリティが、ストレス認識性能に果たす相対的寄与度は何か?
  • RQ4離散的ラベルと比較して、連続的でフレーム単位のストレスアノテーションは、動的ストレス認識にどの程度向上効果をもたらすか?
  • RQ5クローズアップの眼動画特徴量(瞳孔サイズや潜在表現を含む)は、ストレスの信頼できる指標として機能するか?

主な発見

  • デジタル模擬面接のシナリオは、生物学的ストレスを有意に誘発した。コルチゾール値は面接後5分でピークに達し、有効な生理的ストレス反応が確認された。
  • 主観的ストレスは面接直後に最も高くなり、ホルモンストレス反応の典型的な遅延を反映していた。
  • ストレスおよび感情アノテーションの評価者間整合性は、すべてのラベルで中程度からほぼ完璧な水準(Cohenのκ > 0.7)を示した。
  • 最良のモデルは、すべての統合モダリティに早期PCAを適用したニューラルネットワークを用い、88.3%の正解率と87.5%のF1スコアを達成した。
  • HRV特徴量単体で最も高い単一モダリティ性能(79.7%の正解率)を示し、ストレスに非常に感受的であることが示された。
  • 瞳孔関連特徴量(自己符号化器で学習した潜在表現や直径)は、顕著な予測力を持ち、非侵襲的ストレス検出への可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。