Skip to main content
QUICK REVIEW

[论文解读] Emotion Recognition in Audio and Video Using Deep Neural Networks

Mandeep Singh, Yuan Fang|arXiv (Cornell University)|Jun 15, 2020
Emotion and Mood Recognition参考文献 11被引用 14
一句话总结

本文提出一种多模态深度学习方法,结合音频频谱图与视频帧,采用CNN+RNN处理音频、3D-CNN处理视频,利用IEMOCAP数据集在3种情绪上达到71.75%的准确率,在4种情绪上达到54.0%。融合模型通过利用互补的音频与面部表情特征提升了情绪识别性能,但受限于类别不平衡及次优的空间裁剪策略。

ABSTRACT

Humans are able to comprehend information from multiple domains for e.g. speech, text and visual. With advancement of deep learning technology there has been significant improvement of speech recognition. Recognizing emotion from speech is important aspect and with deep learning technology emotion recognition has improved in accuracy and latency. There are still many challenges to improve accuracy. In this work, we attempt to explore different neural networks to improve accuracy of emotion recognition. With different architectures explored, we find (CNN+RNN) + 3DCNN multi-model architecture which processes audio spectrograms and corresponding video frames giving emotion prediction accuracy of 54.0% among 4 emotions and 71.75% among 3 emotions using IEMOCAP[2] dataset.

研究动机与目标

  • 通过利用深度神经网络提升音频与视频中的情绪识别准确率。
  • 研究音频与视频特征多模态融合在情绪识别中的有效性。
  • 识别现有架构与数据预处理中限制性能的瓶颈。
  • 探索数据增强、噪声去除与空间裁剪对模型准确率的影响。
  • 评估不同深度学习架构(包括CNN、RNN、LSTM与3D-CNN)在IEMOCAP数据集上的性能。

提出的方法

  • 音频流以频谱图为输入,通过CNN、CNN+RNN或CNN+LSTM架构提取时频特征。
  • 视频流使用3D-CNN从视频帧中提取时空特征,重点关注面部表情。
  • 最终预测通过拼接音频与视频子网络的最后层,再接全连接层完成。
  • 模型使用IEMOCAP数据集进行训练与评估,该数据集包含10名说话人、9种情绪的12小时音视频录制。
  • 作者以总体准确率为首要指标比较模型,并对数据增强、噪声去除与裁剪技术进行消融研究。
  • 探索了人脸检测与自动裁剪作为潜在改进方法,以聚焦面部区域并减少背景噪声。

实验结果

研究问题

  • RQ1与单模态模型相比,通过多模态深度学习架构融合音频与视频特征是否能提升情绪识别准确率?
  • RQ2不同神经网络架构(如CNN、RNN、LSTM与3D-CNN)对音频与视频情绪识别性能有何影响?
  • RQ3类别不平衡(尤其是‘happiness’类别)对模型预测准确率有何影响?
  • RQ4数据增强技术能否提升模型泛化能力,还是因扭曲情绪相关特征而降低性能?
  • RQ5与经噪声去除的频谱图相比,音频预处理中缺乏噪声去除是否会影响模型性能?

主要发现

  • CNN+RNN+3DCNN多模态架构在IEMOCAP数据集上对3种情绪实现71.75%的准确率,对4种情绪实现54.0%的准确率。
  • 多模态模型在3种情绪上优于单模态音频模型,表明视频帧提供了互补的情绪线索。
  • ‘happiness’预测表现最弱,数据量少且模型性能差,表明类别不平衡是主要瓶颈。
  • 通过裁剪与旋转进行的数据增强略微降低了性能,可能因扭曲了情绪识别关键的时间与频率特征。
  • 直接数据增强未提升模型性能,可能因此类方法改变了情绪相关的声学与视觉特征。
  • 预计在面部区域进行自动裁剪可显著提升准确率,因当前较大的裁剪窗口包含无关或噪声区域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。