[论文解读] Deep Fusion: An Attention Guided Factorized Bilinear Pooling for Audio-video Emotion Recognition
该论文提出 Deep Fusion,一种基于注意力引导的分解双线性池化(FBP)方法,用于音视频情感识别,能够联合学习模态特异性特征及其跨模态交互。通过在 FBP 融合前对音频和视频流中的情感相关区域应用嵌入式注意力机制,该模型在 AFEW 数据集上实现了 62.48% 的准确率,超越了使用单一模型架构的先前最先进结果。
Automatic emotion recognition (AER) is a challenging task due to the abstract concept and multiple expressions of emotion. Although there is no consensus on a definition, human emotional states usually can be apperceived by auditory and visual systems. Inspired by this cognitive process in human beings, it's natural to simultaneously utilize audio and visual information in AER. However, most traditional fusion approaches only build a linear paradigm, such as feature concatenation and multi-system fusion, which hardly captures complex association between audio and video. In this paper, we introduce factorized bilinear pooling (FBP) to deeply integrate the features of audio and video. Specifically, the features are selected through the embedded attention mechanism from respective modalities to obtain the emotion-related regions. The whole pipeline can be completed in a neural network. Validated on the AFEW database of the audio-video sub-challenge in EmotiW2018, the proposed approach achieves an accuracy of 62.48%, outperforming the state-of-the-art result.
研究动机与目标
- 为解决自动情感识别(AER)中捕捉音视频模态之间复杂非线性交互的挑战。
- 通过建模高阶跨模态依赖关系,提升融合性能,超越线性方法(如特征拼接)。
- 通过统一神经网络端到端学习模态特异性表征及其联合集成。
- 通过引入注意力机制增强模型的鲁棒性与可解释性,突出显示情感相关的帧和特征。
提出的方法
- 该方法采用嵌入式注意力机制,在融合前选择性地聚焦于音频和视频流中的情感相关区域。
- 应用分解双线性池化(FBP)计算音频与视频特征之间的高阶跨模态交互,相比标准双线性池化降低了计算成本。
- FBP 操作采用秩为 k=4 的低秩分解,输出维度 o=128,以高效建模跨模态交互。
- 整个流程(包括注意力、特征提取和 FBP)可微分,并在单一神经网络中端到端训练。
- 训练过程中在 FBP 层应用 0.3 的 dropout 率,以防止过拟合。
- 模型在 AFEW 数据集上进行训练,结合验证集进行数据增强,提升了泛化能力。
实验结果
研究问题
- RQ1注意力引导的特征选择能否提升对音频和视频流中情感相关区域的识别?
- RQ2分解双线性池化是否比线性融合方法(如拼接)更有效地融合音频与视频特征?
- RQ3通过 FBP 和注意力机制联合端到端训练统一网络,能否在音视频情感识别任务上取得更优性能?
- RQ4注意力权重如何反映模型对情感显著帧的关注?其与音频线索是否一致?
主要发现
- 所提出的 Deep Fusion 模型在 AFEW 测试集上达到 62.48% 的准确率,超越了先前最先进结果 61.87%。
- 使用四个独立初始化的 FBP 模型并结合验证集数据进一步将性能提升至 62.48%,表明模型具有鲁棒性与泛化能力。
- 注意力机制有效突出了情感相关帧,注意力权重与音频中的情感语音段(如笑声)高度相关。
- 混淆矩阵显示,愤怒、快乐和中性等表达清晰的情感类别准确率更高,而厌恶和惊讶因表达细微或模糊仍具挑战。
- 与简单特征拼接相比,FBP 融合策略使性能提升 2.76%,表明其在建模复杂跨模态交互方面的有效性。
- 可视化结果证实,音频模态影响了视频的注意力权重,表明通过端到端训练实现了深层次的联合融合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。