Skip to main content
QUICK REVIEW

[论文解读] ForDigitStress: A multi-modal stress dataset employing a digital job interview scenario

Alexander Heimerl, Pooja Prajod|arXiv (Cornell University)|Mar 14, 2023
Emotion and Mood Recognition被引用 5
一句话总结

本论文介绍了ForDigitStress,这是一个新颖的多模态压力数据集,从40名参与者在模拟数字求职面试中收集,涵盖音频、视频(面部关键点、动作捕捉、眼动追踪)以及生理信号(PPG、EDA)。该数据集包含连续的压力与情绪标注,且评分者间一致性较高(Cohen’s κ > 0.7),最佳模型在使用早期PCA融合多模态特征的神经网络上,实现了88.3%的准确率和87.5%的F1分数,用于二元压力分类。

ABSTRACT

We present a multi-modal stress dataset that uses digital job interviews to induce stress. The dataset provides multi-modal data of 40 participants including audio, video (motion capturing, facial recognition, eye tracking) as well as physiological information (photoplethysmography, electrodermal activity). In addition to that, the dataset contains time-continuous annotations for stress and occurred emotions (e.g. shame, anger, anxiety, surprise). In order to establish a baseline, five different machine learning classifiers (Support Vector Machine, K-Nearest Neighbors, Random Forest, Long-Short-Term Memory Network) have been trained and evaluated on the proposed dataset for a binary stress classification task. The best-performing classifier achieved an accuracy of 88.3% and an F1-score of 87.5%.

研究动机与目标

  • 通过数字求职面试开发一种真实且经过验证的压力诱导协议,以研究人类压力反应。
  • 在受控但生态有效的情境下,收集并同步参与者的声音、视频和生理信号等多模态数据。
  • 创建高质量、时间连续的数据集,包含自报和专家标注的压力与情绪标签,用于机器学习应用。
  • 评估各种模态(尤其是眼动追踪和瞳孔特征)在自动压力识别中的有效性。
  • 通过测量唾液皮质醇水平,验证压力诱导的生物学相关性。

提出的方法

  • 参与者接受了远程数字求职面试,旨在诱导压力,数据通过Social Signal Interpretation(SSI)框架实现多传感器同步记录。
  • 多模态数据包括音频(GEMAPS特征)、视频(OpenPose身体关节点、面部关键点、动作单元)、眼动追踪(瞳孔直径、自编码器学习的潜在特征)以及生理信号(PPG用于HRV,EDA)。
  • 通过自报和两名经验丰富的心理学家逐帧标注压力与情绪,使用Cohen’s kappa评估评分者间一致性。
  • 在面试前后测量唾液皮质醇水平,以验证生物性压力反应。
  • 构建了全面的特征集,包括HRV、EDA、面部动作单元、声学特征和瞳孔动力学特征,随后通过早期和晚期PCA进行降维。
  • 训练并评估了五种机器学习分类器(SVM、KNN、随机森林、前馈神经网络、LSTM)用于二元压力分类,并进行了单个模态与融合策略的消融研究。

实验结果

研究问题

  • RQ1数字求职面试能否可靠地诱导参与者的主观压力与生物性压力?
  • RQ2多模态特征(尤其是瞳孔动力学与HRV)在实时压力识别中的有效性如何?
  • RQ3各模态(如面部表情、EDA、HRV)对压力识别性能的相对贡献是什么?
  • RQ4与离散标签相比,连续的逐帧压力标注在动态压力识别中的提升程度如何?
  • RQ5近距离眼动视频特征(包括瞳孔大小和潜在表征)能否作为可靠的压力指标?

主要发现

  • 数字模拟求职面试场景成功诱导了显著的生物性压力反应,唾液皮质醇水平在面试后5分钟达到峰值,证实了有效的生理应激反应。
  • 主观压力在面试后立即达到最高,反映了激素应激反应的典型延迟。
  • 所有标签的压力与情绪标注评分者间一致性达到中等到近乎完美(Cohen’s κ > 0.7)。
  • 最佳模型在使用早期PCA融合所有模态特征的神经网络上,实现了88.3%的准确率和87.5%的F1分数。
  • HRV特征单独使用时表现最佳(79.7%准确率),表明其对压力具有高度敏感性。
  • 与瞳孔相关的特征(包括自编码器学习的潜在表征和直径)表现出显著的预测能力,凸显其在非侵入性压力检测中的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。