[论文解读] Multi-modal Attention for Speech Emotion Recognition
本论文提出了一种用于语音情感识别的混合多模态注意力网络(MMAN),采用一种新颖的cLSTM-MMA机制,通过在语音、视觉和文本模态之间并行应用方向注意力而非早期融合中的拼接操作,实现多模态特征融合。该方法在IEMOCAP数据集上实现了73.94%的最先进准确率,且参数量显著少于先前模型。
Emotion represents an essential aspect of human speech that is manifested in speech prosody. Speech, visual, and textual cues are complementary in human communication. In this paper, we study a hybrid fusion method, referred to as multi-modal attention network (MMAN) to make use of visual and textual cues in speech emotion recognition. We propose a novel multi-modal attention mechanism, cLSTM-MMA, which facilitates the attention across three modalities and selectively fuse the information. cLSTM-MMA is fused with other uni-modal sub-networks in the late fusion. The experiments show that speech emotion recognition benefits significantly from visual and textual cues, and the proposed cLSTM-MMA alone is as competitive as other fusion methods in terms of accuracy, but with a much more compact network structure. The proposed hybrid network MMAN achieves state-of-the-art performance on IEMOCAP database for emotion recognition.
研究动机与目标
- 通过有效融合互补的视觉和文本线索与语音语调,提升语音情感识别性能。
- 通过可学习的注意力机制,解决传统早期融合方法的局限性(如特征错位、参数效率低下)。
- 首次探索三模态交叉注意力机制,实现语音、视觉与文本之间相互作用的联合建模。
- 通过结合早期融合与晚期融合,实现紧凑网络架构下的最先进性能。
提出的方法
- 提出cLSTM-MMA,一种多模态注意力子网络,利用三个并行的方向注意力模块,计算语音、视觉与文本特征之间的跨模态注意力。
- 每个注意力模块从一个模态中计算查询、键和值表示,并使用基于余弦相似度的注意力分数关注其他两个模态。
- 该注意力机制实现了选择性、动态的多模态特征融合,替代早期融合中的简单拼接操作。
- cLSTM-MMA被集成到混合晚期融合框架(MMAN)中,其中先独立处理单模态cLSTM子网络(语音、视觉、文本),再通过全连接层和Softmax层融合其预测结果。
- 在注意力计算前对单模态嵌入进行标准化处理,以稳定训练过程。
- 该架构被设计为高效建模模态特异性表征与跨模态交互。
实验结果
研究问题
- RQ1多模态注意力机制是否能在语音情感识别中超越基于拼接的早期融合方法?
- RQ2三模态交叉注意力(同时关注语音、视觉与文本)是否相比成对注意力或晚期融合能提升性能?
- RQ3具有注意力机制的紧凑早期融合网络能否实现与更大规模晚期融合模型相当的性能?
- RQ4视觉与文本线索如何缓解仅基于语音的情感识别中的模糊性?
主要发现
- cLSTM-MMA模型在IEMOCAP数据集上达到71.66%的准确率,相比早期融合基线(cLSTM-EF)高出2%,且仅使用127万个参数,比cLSTM-EF少40%。
- 所提出的混合MMAN网络在IEMOCAP数据集上实现了73.94%的最先进准确率,超越所有先前方法,包括那些可访问未来上下文的BLSTM模型。
- 混淆矩阵分析表明,cLSTM-MMA显著提升了中性与愤怒情绪的召回率,而仅基于语音的基线模型(cLSTM-Speech)对中性情绪识别效果差(召回率低)。
- 在二元情感分类任务中,cLSTM-MMA在'高兴'类别上达到92.68%的准确率,在'愤怒'类别上达到93.32%,优于MulT及其他成对注意力模型。
- MMAN模型在仅使用439万个参数的情况下,性能与大型cLSTM-LF晚期融合模型(71.78%准确率)相当,而cLSTM-LF需使用473万个参数。
- 结果表明,多模态注意力相比拼接方式能实现更有效、更高效的特征融合,且模态特异性表征与跨模态交互对高性能情感识别均至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。