Skip to main content
QUICK REVIEW

[论文解读] Key-Sparse Transformer for Multimodal Speech Emotion Recognition

Weidong Chen, Xiaofeng Xing|arXiv (Cornell University)|Jun 22, 2021
Emotion and Mood Recognition参考文献 32被引用 4
一句话总结

本文提出了一种关键稀疏的Transformer(KS-Transformer),用于多模态语音情感识别,能够动态识别并聚焦于与情感相关的语音帧和词语,同时抑制无关的、噪声干扰的标记。通过在注意力权重中应用可学习的稀疏机制,该模型在IEMOCAP和LSSED数据集上实现了性能提升,取得了SOTA结果:在IEMOCAP上达到75.3%的未加权准确率,在LSSED上达到55.7%,证明了其在多模态情感识别中具有更优的鲁棒性和效率。

ABSTRACT

Speech emotion recognition is a challenging research topic that plays a critical role in human-computer interaction. Multimodal inputs further improve the performance as more emotional information is used. However, existing studies learn all the information in the sample while only a small portion of it is about emotion. The redundant information will become noises and limit the system performance. In this paper, a key-sparse Transformer is proposed for efficient emotion recognition by focusing more on emotion related information. The proposed method is evaluated on the IEMOCAP and LSSED. Experimental results show that the proposed method achieves better performance than the state-of-the-art approaches.

研究动机与目标

  • 解决音频和文本输入中冗余的、非情感信息导致语音情感识别性能下降的问题。
  • 通过实现对音频和文本模态中情感相关特征的选择性关注,提升多模态融合效率。
  • 开发一种稀疏注意力机制,自动识别并优先处理情感显著的帧和词语。
  • 通过改进模态间交互与特征聚焦,在IEMOCAP和LSSED等基准数据集上实现SOTA性能。

提出的方法

  • 提出一种关键稀疏注意力机制,先计算注意力权重,再根据可学习阈值将最小的权重重置为零,实现在注意力头上的稀疏化。
  • 引入级联交叉注意力模块(CCAB),在关键稀疏处理后,实现音频与文本模态之间的深度、多阶段交互。
  • 使用预训练的wav2vec和RoBERTa模型分别提取音频和文本嵌入,以获得鲁棒的初始特征表示。
  • 采用可微分的稀疏策略,选择k=0.5(即50%的注意力权重被重置为零)作为信息保留与噪声抑制之间的最佳平衡。
  • 在KS-Transformer中采用多头注意力机制,并在每个头中应用稀疏化,以保持注意力的多样性。
  • 将KS-Transformer集成到三模块架构中:特征提取、模态交互(通过CCAB)以及深度融合以实现最终分类。

实验结果

研究问题

  • RQ1可学习的关键稀疏注意力机制是否能通过过滤音频和文本中的非情感、噪声标记,提升语音情感识别性能?
  • RQ2级联交叉注意力模块(CCAB)的数量如何影响模态间交互及多模态情感识别的整体性能?
  • RQ3所提出的KS-Transformer是否在IEMOCAP和LSSED等基准数据集上优于标准Transformer及现有SOTA模型?
  • RQ4在信息保留与噪声抑制之间实现最佳平衡时,稀疏度的最优水平(由超参数k控制)是多少?
  • RQ5在类别不平衡情况下,特别是在大规模LSSED数据集上,模型表现如何?

主要发现

  • 所提出的KS-Transformer在IEMOCAP上实现了75.3%的未加权准确率,优于所有先前的SOTA方法,包括CMA(72.8%)、STSER(72.1%)和GBAN(70.1%)。
  • 在LSSED数据集上,模型达到55.7%的未加权准确率,为所有对比方法中的最高值,包括PyResNet(42.9%)和STSER(51.2%)。
  • 最优稀疏度水平为k=0.5,即50%的注意力权重被重置为零,该设置在两个数据集上均实现了性能与噪声抑制的最优平衡。
  • 使用三个级联交叉注意力模块(CCABs)时性能最佳,表明多轮模态交互对有效融合至关重要。
  • 可视化结果表明,KS-Transformer减少了对非情感词语(如“it”、“a”、“look”)的关注,同时增强了对情感显著词语(如“beautiful”和“arguing”)的聚焦。
  • 该模型在IEMOCAP上表现出更强的抗过拟合能力,且在LSSED上当k超过0.5时性能下降更小,证实了稀疏性在处理大规模、类别不平衡数据中的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。