Skip to main content
QUICK REVIEW

[论文解读] Learning Alignment for Multimodal Emotion Recognition from Speech

Haiyang Xu, Hui Zhang|arXiv (Cornell University)|Sep 6, 2019
Emotion and Mood Recognition参考文献 27被引用 6
一句话总结

本文提出一种基于注意力的对齐机制,用于融合语音与ASR生成的文本,以实现多模态情感识别,通过建模细粒度的时间对应关系来提升特征表示。该方法在IEMOCAP数据集上取得了最先进性能,使用识别文本时加权准确率达到70.4%,未加权准确率达到69.5%,优于单模态和基于拼接的多模态基线模型。

ABSTRACT

Speech emotion recognition is a challenging problem because human convey emotions in subtle and complex ways. For emotion recognition on human speech, one can either extract emotion related features from audio signals or employ speech recognition techniques to generate text from speech and then apply natural language processing to analyze the sentiment. Further, emotion recognition will be beneficial from using audio-textual multimodal information, it is not trivial to build a system to learn from multimodality. One can build models for two input sources separately and combine them in a decision level, but this method ignores the interaction between speech and text in the temporal domain. In this paper, we propose to use an attention mechanism to learn the alignment between speech frames and text words, aiming to produce more accurate multimodal feature representations. The aligned multimodal features are fed into a sequential model for emotion recognition. We evaluate the approach on the IEMOCAP dataset and the experimental results show the proposed approach achieves the state-of-the-art performance on the dataset.

研究动机与目标

  • 通过利用语音与文本之间的时间对齐,提升多模态情感识别性能。
  • 通过在时间域中建模语音与文本之间的交互,解决决策级融合的局限性。
  • 端到端地学习语音帧与文本词之间的对齐关系,用于情感识别,无需依赖ASR系统提供的对齐信息。
  • 证明为情感识别优化的注意力对齐方法优于真实硬对齐。
  • 仅使用语音和识别文本,在IEMOCAP数据集上实现最先进性能。

提出的方法

  • 使用注意力机制学习语音帧与文本词之间的对齐关系,实现多模态特征的动态融合。
  • 语音特征通过卷积神经网络(CNN)或时延神经网络(TDNN)提取,随后通过长短期记忆网络(LSTM)进行序列建模。
  • 文本特征通过带有注意力机制的LSTM处理,注意力权重用于为每个词关注相关的语音帧。
  • 通过在词级别将关注的语音特征与文本隐藏状态拼接,形成对齐的多模态特征。
  • 最终的LSTM对融合的多模态序列进行处理,以实现情感分类。
  • 模型通过交叉熵损失端到端训练,不依赖于预存在的ASR对齐信息。

实验结果

研究问题

  • RQ1在语音与文本之间端到端学习的注意力对齐是否能提升多模态情感识别性能?
  • RQ2为情感识别专门学习的对齐是否优于使用预存在的ASR对齐?
  • RQ3所提出方法在IEMOCAP数据集上与单模态和基于拼接的多模态基线相比表现如何?
  • RQ4当使用真实转录本和真实词级别对齐而非ASR生成的文本时,性能提升如何?
  • RQ5该模型是否能在不依赖视觉信息或真实文本的情况下,仅使用语音和识别文本实现最先进性能?

主要发现

  • 所提方法在IEMOCAP数据集上使用ASR生成的文本时,取得了70.4%的加权准确率和69.5%的未加权准确率,优于所有基线模型。
  • 当使用真实转录本和真实对齐时,模型达到72.5%的加权准确率和70.9%的未加权准确率,表明在ASR性能更优时仍有进一步提升空间。
  • 基于注意力的对齐方法优于硬对齐基线(71.5% WA vs. 70.4% WA),表明为情感识别优化的对齐比为语音识别优化的对齐更有效。
  • 采用端到端学习对齐的多模态方法显著优于单模态模型(如仅语音模型的63.4% WA)和基于拼接的方法(68.1% WA)。
  • 结果表明,为情感识别学习对齐比依赖ASR系统对齐更有效,尤其是在ASR为黑箱时更为显著。
  • 该模型在IEMOCAP数据集上实现了最先进性能,验证了端到端学习多模态对齐的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。