[论文解读] Multi-modal Approach for Affective Computing
该论文提出了一种多模态情感计算框架,通过引入一种新颖的生理基线补偿方法,提升了EEG、ECG、GSR和前向视频数据在情绪分类中的准确性。通过使用极限学习机(ELM)和深度特征(如基于VGG的特征)融合这些模态的特征——尤其是EEG与视频——该方法实现了最先进性能,四分类情绪分类准确率达到52.51%,显著优于先前工作,并在基线校正后,于唤醒度、愉悦度、喜好度和支配度预测中均表现出一致的提升。
Throughout the past decade, many studies have classified human emotions using only a single sensing modality such as face video, electroencephalogram (EEG), electrocardiogram (ECG), galvanic skin response (GSR), etc. The results of these studies are constrained by the limitations of these modalities such as the absence of physiological biomarkers in the face-video analysis, poor spatial resolution in EEG, poor temporal resolution of the GSR etc. Scant research has been conducted to compare the merits of these modalities and understand how to best use them individually and jointly. Using multi-modal AMIGOS dataset, this study compares the performance of human emotion classification using multiple computational approaches applied to face videos and various bio-sensing modalities. Using a novel method for compensating physiological baseline we show an increase in the classification accuracy of various approaches that we use. Finally, we present a multi-modal emotion-classification approach in the domain of affective computing research.
研究动机与目标
- 为解决单模态情感计算的局限性,通过整合EEG、ECG、GSR和视频等多种生理与视觉模态,提升情绪分类性能。
- 开发并验证一种新颖的生理基线补偿方法,以校正实验开始时的个体情绪基线,增强模型鲁棒性。
- 在情绪分类背景下,比较并评估不同特征提取技术(尤其是基于深度学习的特征)在不同模态中的性能表现。
- 证明多模态融合,特别是EEG + 前向视频,相较于单一模态,能实现更高的分类准确率。
- 建立一个整合视觉与生物信号的综合性跨模态框架,克服孤立模态研究的局限性。
提出的方法
- 本研究采用AMIGOS数据集,其中包含40名受试者在640次视频试验中同步采集的EEG(14个通道,128 Hz)、ECG(2个通道,128 Hz)、GSR(1个通道,128 Hz)和前向视频(25 fps)数据。
- 针对每种模态,应用不同的特征提取方法:EEG采用条件熵和功率谱密度,ECG与GSR采用时域和频域特征,视频采用CNN-VGG-based特征。
- 提出一种新颖的基线补偿方法,通过建模实验前自我报告的愉悦度与唤醒度评分,对个体情绪基线进行调整,从而实现对生理反应的归一化。
- 分类采用具有S型激活函数的极限学习机(ELM),使用10折交叉验证,对愉悦度、唤醒度、喜好度和支配度(高低)进行二分类,同时基于Russell的环形模型对四分类和八分类情绪进行分类。
- 通过拼接不同模态中最具信息量的特征(如EEG + 视频、GSR + ECG)实现多模态融合,并在组合特征空间上重新训练ELM分类器。
- 通过多种响应类型和情绪类别配置下的分类准确率评估性能,结果在有无基线补偿条件下均进行报告。
实验结果
研究问题
- RQ1对个体情绪基线进行补偿,如何提升多传感模态下情感计算模型的准确性?
- RQ2哪种特征提取技术组合——尤其是基于深度学习的特征——在多模态情绪分类中表现最佳?
- RQ3在愉悦度、唤醒度、喜好度和支配度的分类准确率方面,多模态融合(如EEG + 视频、GSR + ECG)相较于单一模态表现如何?
- RQ4生理信号(EEG、ECG、GSR)和基于视频的面部分析在四分类和八分类情绪分类中的贡献程度如何?
- RQ5与未进行此类校正的模型相比,包含基线校正后生理数据的模型是否显著提升了分类性能?
主要发现
- 基线补偿显著提升了所有模态的分类准确率,其中EEG和基于视频的方法提升最为明显。
- EEG与前向视频特征的融合实现了52.51%的四分类情绪分类准确率,优于单一模态,且显著超越先前最先进结果。
- EEG在所有生物信号模态中单独表现最佳,经基线补偿后常与基于视频的方法持平或更优。
- 对EEG和视频数据均采用CNN-VGG-based特征显著提升了分类性能,尤其在基线校正后,表明其在捕捉生理变异方面的有效性。
- 喜好度和支配度的分类准确率高于愉悦度和唤醒度,表明这两者具有更强的生理相关性。
- 生物信号模态在八分类情绪分类中的性能略有下降,可能由于愉悦度与唤醒度值的1–9标度范围较窄,导致细粒度分类更具挑战性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。