[论文解读] AttX: Attentive Cross-Connections for Fusion of Wearable Signals in Emotion Recognition
本文提出 AttX,一种新颖的注意力交叉连接机制,通过在深度学习模型中动态融合可穿戴设备的多模态信号(如 ECG、EDA、BVP)实现情感识别。通过在多个网络阶段集成注意力加权的单向或双向信息共享,AttX 改进了表征学习,并在 WESAD 数据集上实现了最先进性能,准确率最高提升 6.3%。
We propose cross-modal attentive connections, a new dynamic and effective technique for multimodal representation learning from wearable data. Our solution can be integrated into any stage of the pipeline, i.e., after any convolutional layer or block, to create intermediate connections between individual streams responsible for processing each modality. Additionally, our method benefits from two properties. First, it can share information uni-directionally (from one modality to the other) or bi-directionally. Second, it can be integrated into multiple stages at the same time to further allow network gradients to be exchanged in several touch-points. We perform extensive experiments on three public multimodal wearable datasets, WESAD, SWELL-KW, and CASE, and demonstrate that our method can effectively regulate and share information between different modalities to learn better representations. Our experiments further demonstrate that once integrated into simple CNN-based multimodal solutions (2, 3, or 4 modalities), our method can result in superior or competitive performance to state-of-the-art and outperform a variety of baseline uni-modal and classical multimodal methods.
研究动机与目标
- 为解决可穿戴设备情感识别中多模态融合的挑战,其中不同生理信号携带互补但非均匀信息的特征。
- 开发一种动态可学习的融合机制,能够根据相关性自适应地在模态间共享信息,而非依赖固定的早期或晚期融合策略。
- 研究在深度神经网络架构的不同阶段集成交叉连接对表征质量与分类性能的影响。
- 证明所提出的注意力交叉连接机制可超越传统融合技术(特征级与分数级融合)及最先进方法,在多模态情感识别中表现更优。
提出的方法
- AttX 引入一种可学习的、基于注意力的前馈网络,可在深度神经网络的任意中间层计算模态特异性特征流之间的加权交叉连接。
- 该方法支持三种连接类型:I 类(从模态 A 到 B 的单向连接)、II 类(从 B 到 A)和 III 类(双向连接),实现灵活的信息流控制。
- 交叉连接被插入到网络的多个阶段(例如第 2 阶段或第 3 阶段),使梯度可通过多个触点流动,从而增强特征精炼。
- AttX 内部的注意力机制为共享特征计算动态权重,根据模态特异性上下文优先选择信息丰富的表征。
- 该框架被集成到多种 CNN 主干网络(VGG、ResNet)中,并在三个公开数据集(WESAD、SWELL-KW 和 CASE)上进行评估。
- 该方法支持端到端训练,并通过在卷积块后连接不同模态流的特征图,实现中级融合。

实验结果
研究问题
- RQ1在不同网络阶段集成注意力交叉连接如何影响多模态表征学习与情感识别性能?
- RQ2在 ECG 和 EDA 等模态之间,信息流的最优方向与类型(单向或双向)是什么?
- RQ3与传统特征级和分数级融合策略相比,AttX 的性能提升程度如何?
- RQ4AttX 是否仅使用简单的 CNN 模型即可实现最先进性能,而无需复杂架构或注意力机制?
主要发现
- 在 WESAD 数据集上,AttX 通过 ECG 与 EDA 融合实现 65.20% 的准确率和 62.25% 的 F1 值,比最先进方法高出约 6.3%。
- 在 WESAD 数据集上,AttX 相比特征级融合性能提升 4%,相比分数级融合提升 4.8%。
- 在 CASE 数据集上,AttX 通过 ECG 与 EDA 融合实现 66.72% 的准确率和 61.00% 的 F1 值,分别优于特征融合 3.7% 和分数融合 14%。
- 在 ECG 和 EDA 或 BVP 和 EDA 中增加皮肤温度(ST)后,性能进一步提升,在 CASE 数据集上达到 70.15% 的准确率和 67.84% 的 F1 值。
- 当 AttX 插入第 2 阶段(中层融合)时性能最佳,第 3 阶段紧随其后,表明这是跨模态信息交换的最优时机。
- II 类连接(从 EDA 到 ECG 或 BVP)始终带来最高的性能增益,表明 EDA 为其他模态提供了高度信息丰富的线索。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。