[论文解读] Multimodal Fusion with Deep Neural Networks for Audio-Video Emotion Recognition
一项新颖的深度神经网络,用于音频、视频和文本的端到端多模态融合以进行连续情绪预测,在 AVEC SEWA 数据上超过早期/晚期融合基线的 CCC。
This paper presents a novel deep neural network (DNN) for multimodal fusion of audio, video and text modalities for emotion recognition. The proposed DNN architecture has independent and shared layers which aim to learn the representation for each modality, as well as the best combined representation to achieve the best prediction. Experimental results on the AVEC Sentiment Analysis in the Wild dataset indicate that the proposed DNN can achieve a higher level of Concordance Correlation Coefficient (CCC) than other state-of-the-art systems that perform early fusion of modalities at feature-level (i.e., concatenation) and late fusion at score-level (i.e., weighted average) fusion. The proposed DNN has achieved CCCs of 0.606, 0.534, and 0.170 on the development partition of the dataset for predicting arousal, valence and liking, respectively.
研究动机与目标
- 在现实环境中使用多模态(音频、视频、文本)实现鲁棒情绪识别的动机。
- 设计一个 DNN,使其能够同时学习模态特定表征与联合融合表征。
- 在 AVEC SEWA/RECOLA 数据集上评估所提架构,并与早期融合(特征级)和晚期融合(分数级)基线进行比较。
提出的方法
- 提出一个具有独立模态特定层的 DNN,以学习判别性的表征。
- 使用基于拼接的融合层将模态表征融合,在其后接全连接层和回归层。
- 回归仅使用一个线性神经元,并使用一个缩放模块来对齐预测量纲与标签量级。
- 使用均方误差损失进行训练,并使用 Keras 检查点来选择最佳模型。
- 探索若干后处理缩放(最小-最大、标准差比、十进制缩放)以提升 CCC。
- 对唤醒度、价性和喜好度三个维度进行评估,每个维度有独立的架构。
实验结果
研究问题
- RQ1一个混合型 DNN 架构是否能够学习有效的模态特定表征并实现联合融合以进行连续情绪预测?
- RQ2端到端的多模态融合是否在现实条件下优于传统的特征级(早期)和分数级(晚期)融合?
- RQ3预处理和后处理步骤(延迟补偿、缩放)对唤醒度、价性和喜好度的 CCC 有何影响?
- RQ4所提架构在音频、视频和文本模态及其融合上分别以及总体的表现如何?
- RQ5是否需要时间建模(如循环组件)以在所提出的前馈融合基础上进一步提升准确性?
主要发现
- 所提 DNN 的 CCC 高于 AVEC SEWA 上的现有最优的早期与晚期融合基线。
- 在开发集上,CCC 达到高达 0.606(唤醒度和喜好度),以及 0.534(价性),均为所提融合架构的结果。
- 文本模态信息量很大,尤其在喜好度方面,融合多模态比依赖单一模态更具优势。
- 延迟补偿与后处理缩放对 CCC 影响显著,经过优化的延迟(唤醒度/价性 1.5s,喜好度 2.5s)可提升性能。
- 该架构实现对特征、分类器和融合函数的端到端优化,在开发数据上超越单模态及早期/晚期融合基线。
- 测试集结果显示存在一定下降,可能由于过拟合,表明需要进一步的时间建模或正则化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。