Skip to main content
QUICK REVIEW

[论文解读] Deep neural networks for emotion recognition combining audio and transcripts

Jaejin Cho, Raghavendra Pappagari|arXiv (Cornell University)|Nov 1, 2019
Emotion and Mood Recognition参考文献 15被引用 9
一句话总结

本文提出了一种多模态深度学习方法,通过融合LSTM(声学特征)和多分辨率CNN(文本转录)实现更优的基于语音的情绪识别。该方法在IEMOCAP数据集上实现了24%的相对准确率提升,在电话数据上实现了3.4%的提升,通过充分利用两种模态的互补信息,并引入验证损失以增强嵌入的分离效果。

ABSTRACT

In this paper, we propose to improve emotion recognition by combining acoustic information and conversation transcripts. On the one hand, an LSTM network was used to detect emotion from acoustic features like f0, shimmer, jitter, MFCC, etc. On the other hand, a multi-resolution CNN was used to detect emotion from word sequences. This CNN consists of several parallel convolutions with different kernel sizes to exploit contextual information at different levels. A temporal pooling layer aggregates the hidden representations of different words into a unique sequence level embedding, from which we computed the emotion posteriors. We optimized a weighted sum of classification and verification losses. The verification loss tries to bring embeddings from the same emotions closer while separating embeddings from different emotions. We also compared our CNN with state-of-the-art text-based hand-crafted features (e-vector). We evaluated our approach on the USC-IEMOCAP dataset as well as the dataset consisting of US English telephone speech. In the former, we used human-annotated transcripts while in the latter, we used ASR transcripts. The results showed fusing audio and transcript information improved unweighted accuracy by relative 24% for IEMOCAP and relative 3.4% for the telephone data compared to a single acoustic system.

研究动机与目标

  • 通过结合声学与文本模态,提升语音情绪识别性能。
  • 开发一种多分辨率CNN,以捕捉转录文本中不同范围的上下文信息,用于情绪分类。
  • 在人工标注与ASR生成的转录文本上,评估声学与转录文本系统融合的效果。
  • 通过使用真实世界电话对话数据(转录文本质量较差)验证融合系统的鲁棒性。
  • 验证验证损失在对齐相同情绪嵌入与分离不同情绪嵌入方面的有效性。

提出的方法

  • LSTM网络处理声学特征(f0、shimmer、jitter、MFCC),通过全局时间平均池化生成话语级表征。
  • 多分辨率CNN使用并行卷积层,采用不同卷积核大小,从词序列中提取多时间尺度的上下文信息。
  • 时间池化层将词级隐藏表征聚合为单一序列级嵌入,用于情绪分类。
  • 优化分类损失与验证损失的加权和,其中验证损失促使相同情绪的嵌入聚类更紧密,不同情绪的嵌入分离更明显。
  • 系统在IEMOCAP数据集(人工标注转录)和美国英语电话语音数据集(ASR生成转录)上进行训练与评估。
  • 融合策略结合声学LSTM与基于转录的MCNN的预测结果,以提升整体性能。

实验结果

研究问题

  • RQ1结合声学与文本信息是否能超越单模态系统,提升语音情绪识别性能?
  • RQ2与传统手工设计的文本特征(如e-vectors)相比,多分辨率CNN在从转录中识别情绪方面表现如何?
  • RQ3在使用ASR生成转录的真实世界数据中,声学与转录文本系统融合能在多大程度上提升性能?
  • RQ4使用验证损失是否能增强基于转录的系统中学习到的嵌入的判别能力?
  • RQ5当使用噪声较大的ASR生成转录时,声学与文本特征的互补性是否依然保持?

主要发现

  • 在IEMOCAP数据集上,多分辨率CNN相比e-vector基线模型,未加权准确率提升了4%。
  • 在IEMOCAP上,声学LSTM与MCNN系统融合后,相比单一声学系统,未加权准确率相对提升了18%。
  • 在电话对话数据集上,尽管使用ASR生成的转录,声学与转录系统融合后,未加权准确率相比单一声学系统相对提升了3.4%。
  • 融合LSTM、MCNN与e-vector三个系统在IEMOCAP上实现了65.9%的最高未加权准确率,证实了模态间的互补性。
  • 当融合两个基于文本的系统(e-vector与MCNN)时,未观察到性能增益,表明声学模态提供了独特且非冗余的信息。
  • 验证损失有助于提升嵌入质量,融合系统在IEMOCAP上对愤怒与悲伤情绪的预测性能优于单个系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。