[论文解读] Attention Driven Fusion For Multi-Modal Emotion Recognition
该论文提出了一种基于注意力机制的多模态融合模型,用于语音情感识别,通过SincNet层直接处理原始音频,并采用双分支文本处理与交叉注意力机制。在特征融合前后均应用自注意力机制,该模型在IEMOCAP数据集上实现了79.22%的加权准确率,比先前的最先进方法高出3.5%。
Deep learning has emerged as a powerful alternative to hand-crafted methods for emotion recognition on combined acoustic and text modalities. Baseline systems model emotion information in text and acoustic modes independently using Deep Convolutional Neural Networks (DCNN) and Recurrent Neural Networks (RNN), followed by applying attention, fusion, and classification. In this paper, we present a deep learning-based approach to exploit and fuse text and acoustic data for emotion classification. We utilize a SincNet layer, based on parameterized sinc functions with band-pass filters, to extract acoustic features from raw audio followed by a DCNN. This approach learns filter banks tuned for emotion recognition and provides more effective features compared to directly applying convolutions over the raw speech signal. For text processing, we use two branches (a DCNN and a Bi-direction RNN followed by a DCNN) in parallel where cross attention is introduced to infer the N-gram level correlations on hidden representations received from the Bi-RNN. Following existing state-of-the-art, we evaluate the performance of the proposed system on the IEMOCAP dataset. Experimental results indicate that the proposed system outperforms existing methods, achieving 3.5% improvement in weighted accuracy.
研究动机与目标
- 通过比现有方法更有效地融合声学与文本模态,提升语音情感识别性能。
- 用可学习的SincNet层替代手工设计的声学特征(如MFCCs),从原始波形中提取与情感相关的滤波器组。
- 通过在Bi-LSTM与并行的DCNN分支之间引入交叉注意力机制,增强文本表征,以建模n-gram级别的相关性。
- 在特征拼接前和拼接后分别应用自注意力机制,以提升融合性能。
- 通过端到端学习与注意力机制,在IEMOCAP数据集上实现最先进性能。
提出的方法
- 在原始音频上直接应用具有可学习带通滤波器的SincNet层,以提取与情感相关的特征,替代传统在原始波形上使用的卷积层。
- SincNet滤波器响应定义为 g[n, f1, f2] = 2f2·sinc(2πf2n) − 2f1·sinc(2πf1n),其中f1和f2为可学习的截止频率。
- 对于文本,采用双分支架构处理序列:一个分支使用Bi-LSTM后接DCNN,另一个分支使用原始GloVe-300d嵌入的DCNN。
- 在Bi-LSTM的隐藏状态与DCNN的n-gram特征之间应用交叉注意力机制,以建模n-gram级别的上下文相关性。
- 在融合前(F-I、F-II)和融合后(F-III)分别对声学与文本分支的最终特征向量应用独立的自注意力机制。
- 评估三种融合策略(F-I、F-II、F-III):早期融合(自注意力后拼接)、晚期融合(自注意力后拼接)以及融合后加入自注意力的晚期融合。
实验结果
研究问题
- RQ1基于SincNet的声学特征提取器是否能在情感识别任务中超越传统手工设计的特征(如MFCCs)?
- RQ2在n-gram特征与基于RNN的文本表征之间引入交叉注意力,是否能提升对情感相关词汇上下文的建模能力?
- RQ3在特征融合前与融合后应用自注意力机制,对多模态情感识别性能有何影响?
- RQ4与基于特征工程的基线方法相比,使用原始音频与文本进行端到端学习是否能提升识别准确率?
- RQ5在注意力机制融合下,声学与文本模态的相对贡献如何?
主要发现
- 所提模型在IEMOCAP数据集上实现了79.22%的加权准确率,较先前最先进模型MHA-2高出3.5个百分点。
- 仅使用声学模态的模型达到69.8%的加权准确率,较MHA-2的声学分支(65.2%)高出4.6个百分点。
- 仅使用文本模态的模型达到66.7%的加权准确率,较MHA-2的文本分支(70.3%)高出3.6个百分点。
- 在拼接前与拼接后均应用自注意力机制的融合策略(F-III)性能最高,较F-II高出0.5%,较F-I高出1.37%。
- 混淆矩阵显示,融合显著降低了各类情感的误分类率,尤其在“frustrated”和“excited”类别上改善明显。
- 模型展现出模态间的鲁棒性与互补性,通过注意力机制融合,各模态均能提升对方的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。