[论文解读] Utilizing Deep Learning Towards Multi-modal Bio-sensing and Vision-based Affective Computing
该论文提出了一种深度学习框架,利用预训练的卷积神经网络从多模态生物传感(EEG、ECG、GSR、PPG)和视频数据中提取判别性特征,用于情感计算。该方法在DEAP和MAHNOB-HCI数据集上达到最先进性能,优于先前工作在愉悦度/唤醒度/喜好度分类上的表现,并提出了一种新颖的卷积-反卷积网络,用于定位与情感状态相关联的显著大脑区域。
In recent years, the use of bio-sensing signals such as electroencephalogram (EEG), electrocardiogram (ECG), etc. have garnered interest towards applications in affective computing. The parallel trend of deep-learning has led to a huge leap in performance towards solving various vision-based research problems such as object detection. Yet, these advances in deep-learning have not adequately translated into bio-sensing research. This work applies novel deep-learning-based methods to various bio-sensing and video data of four publicly available multi-modal emotion datasets. For each dataset, we first individually evaluate the emotion-classification performance obtained by each modality. We then evaluate the performance obtained by fusing the features from these modalities. We show that our algorithms outperform the results reported by other studies for emotion/valence/arousal/liking classification on DEAP and MAHNOB-HCI datasets and set up benchmarks for the newer AMIGOS and DREAMER datasets. We also evaluate the performance of our algorithms by combining the datasets and by using transfer learning to show that the proposed method overcomes the inconsistencies between the datasets. Hence, we do a thorough analysis of multi-modal affective data from more than 120 subjects and 2,800 trials. Finally, utilizing a convolution-deconvolution network, we propose a new technique towards identifying salient brain regions corresponding to various affective states.
研究动机与目标
- 解决由于数据稀缺性和数据集间不一致性导致的深度学习在基于生物传感的情感计算中应用有限的问题。
- 通过深度学习融合来自多种模态(EEG、ECG、GSR、PPG、视频)的特征,提升情感分类性能。
- 通过迁移学习和跨数据集训练克服数据集间的不一致性,提升模型泛化能力。
- 设计一种新颖的卷积-反卷积网络,利用EEG功率谱密度(PSD)图像识别对情感状态最敏感的大脑区域。
- 为AMIGOS和DREAMER数据集建立新基准,这些数据集此前在深度学习框架中研究不足。
提出的方法
- 利用预训练的VGG网络从视频数据和EEG-PSD图像中提取深度特征,将其作为迁移学习流程的输入。
- 采用晚期融合策略对各模态特异性特征(EEG、ECG、GSR、PPG、视频)进行融合,以提升分类准确率。
- 采用长短期记忆(LSTM)网络建模每个试验内特征随时间的动态变化,相比简单平均化方法性能更优。
- 设计了一个双分支卷积-反卷积网络:静态分支用于检测单个EEG-PSD图像中的显著性,动态分支用于捕捉连续秒级时间内的变化。
- 将来自10-20个EEG电极位置的EEG-PSD图的RGB合成图像作为显著性网络的输入,像素值在0至1之间归一化。
- 对每种情感状态(如高/低愉悦度/唤醒度)的所有试验的显著性输出进行平均,生成指示对特定情绪最敏感的大脑区域的脑图。
实验结果
研究问题
- RQ1基于多模态生物传感和视频数据的深度学习特征提取是否能在情感状态分类中优于传统手工设计特征?
- RQ2在EEG、ECG、GSR、PPG和视频模态之间进行特征融合,如何提升愉悦度、唤醒度和喜好度维度的分类准确率?
- RQ3迁移学习和跨数据集训练在多大程度上可以缓解不同情感计算数据集(如DEAP、AMIGOS、DREAMER)之间的不一致性?
- RQ4哪些大脑区域对特定情感状态最敏感?基于深度学习的显著性网络能否在不同受试者和试验中可靠地定位这些区域?
- RQ5与静态特征聚合相比,通过LSTM建模时间动态是否能提升分类性能?
主要发现
- 所提方法在DEAP和MAHNOB-HCI数据集上达到最先进性能,优于先前报告的愉悦度、唤醒度和喜好度分类结果。
- 多模态特征融合显著提升了分类准确率,相比单模态模型,视频和EEG特征对性能提升贡献最大。
- 利用LSTM建模时间动态相比简单特征平均化方法,显著提高了分类准确率。
- 跨数据集的迁移学习(如在DEAP上训练并在AMIGOS或DREAMER上测试)表现出强鲁棒性和泛化能力,有效克服了数据集特异性不一致性。
- 卷积-反卷积显著性网络将大脑活动主要定位在额叶和中央区(如FC3、FCz、Cz、FC4),与情绪处理的已知神经解剖学一致。
- 高唤醒与低唤醒条件下的差异图像揭示了更广泛的显著大脑区域分布,表明唤醒处理涉及更广泛的大脑神经活动。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。