Skip to main content
QUICK REVIEW

[论文解读] Multi-scale Transformer-based Network for Emotion Recognition from Multi Physiological Signals

Tu Vu, Van Thong Huynh|arXiv (Cornell University)|May 1, 2023
Emotion and Mood RecognitionPsychology参考文献 31被引用 3
一句话总结

本文提出了一种基于多尺度Transformer的深度学习模型,用于从多模态生理信号中进行连续情绪识别,通过多尺度特征提取和高斯变换增强表征学习。该模型在EPiC 2023竞赛基准上实现了1.45的RMSE,展现出在多种评估场景下的优异性能,尤其在跨被试设置中表现突出。

ABSTRACT

This paper presents an efficient Multi-scale Transformer-based approach for the task of Emotion recognition from Physiological data, which has gained widespread attention in the research community due to the vast amount of information that can be extracted from these signals using modern sensors and machine learning techniques. Our approach involves applying a Multi-modal technique combined with scaling data to establish the relationship between internal body signals and human emotions. Additionally, we utilize Transformer and Gaussian Transformation techniques to improve signal encoding effectiveness and overall performance. Our model achieves decent results on the CASE dataset of the EPiC competition, with an RMSE score of 1.45.

研究动机与目标

  • 开发一种端到端的深度学习架构,有效捕捉多模态生理信号中的时序与多尺度模式,用于连续情绪识别。
  • 通过整合多尺度特征提取与鲁棒的信号编码技术,解决噪声大且非平稳的生理信号带来的挑战。
  • 通过注意力机制与可扩展的特征学习,提升模型在不同被试与情绪刺激下的泛化能力。
  • 在EPiC 2023竞赛数据集上评估模型性能,该数据集提供了基于实时生理数据的逐时情绪唤醒与效价标注。
  • 探究不同数据划分策略(跨时间、跨被试、跨诱发物、跨版本)对模型鲁棒性与泛化能力的影响。

提出的方法

  • 模型采用包含四个注意力头和1024隐藏维度的多尺度Transformer编码器,从生理信号中提取分层表征。
  • 应用多尺度特征提取技术,以捕捉8种生理信号(ECG、BVP、EMG_CORU、EMG_TRAP、EMG_ZYGO、GSR、RSP和SKT)中的局部与全局时序模式。
  • 对输入信号应用高斯变换,以改善信号编码并增强模型对噪声与非平稳性的鲁棒性。
  • 使用AdamW优化器配合余弦退火学习率重启策略,在10个周期内端到端训练模型,最小化均方误差(MSE)损失。
  • 序列长度固定为2048,模型在四种不同场景下进行评估:跨时间、跨被试、跨诱发物与跨版本。
  • 该架构使用TensorFlow实现,并在单张GTX 3090 GPU上训练,实现了对高分辨率生理序列的高效处理。
Figure 1: An overview of our proposed architecture.
Figure 1: An overview of our proposed architecture.

实验结果

研究问题

  • RQ1与现有方法相比,基于多尺度Transformer的架构在从多模态生理信号中建模连续效价与唤醒度方面表现如何?
  • RQ2多尺度特征提取与高斯变换对在噪声生理数据中情绪识别的鲁棒性与准确性有何影响?
  • RQ3该模型在不同评估场景下的泛化能力如何,特别是在跨被试与未见情绪刺激下?
  • RQ4模型能否有效学习到在视频观看过程中实时采集的生理信号中情绪变化的时序动态?
  • RQ5注意力机制与多头自注意力在捕捉生理信号序列中复杂非线性关系方面有何贡献?

主要发现

  • 所提模型在EPiC 2023竞赛测试集上实现了总体RMSE为1.45,表明其在连续情绪回归任务中表现优异。
  • 在跨被试场景中表现最佳,唤醒度RMSE为1.336,效价RMSE为1.345,表明对未见个体具有强大的泛化能力。
  • 在跨被试场景中,标准差较低(唤醒度为0.2276,效价为0.0576),表明结果具有一致性与可靠性。
  • 在跨诱发物场景中性能下降,唤醒度RMSE为1.509,效价RMSE为1.514,表明对未见情绪刺激的泛化能力有限。
  • 在跨版本场景中,RMSE为1.369(唤醒度)与1.352(效价),表明在测试同一情绪刺激的不同版本时表现中等。
  • 在跨时间场景中,RMSE为1.503(唤醒度)与1.639(效价),表明模型难以基于早期数据预测后期情绪状态,凸显了时序泛化挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。