[论文解读] Audio-video Emotion Recognition in the Wild using Deep Hybrid Networks
本文提出一种用于野外音频-视觉情感识别的深度混合神经网络,结合基于面部图像的VGG-LSTM模型、基于音频特征的SVM与LSTM模型,以及基于音频衍生图像图的Inception(v2)-LSTM模型。该方法在验证集上达到55.61%的准确率,在测试集上达到51.15%,显著优于EmotiW 2017基线的38.81%。
This paper presents an audiovisual-based emotion recognition hybrid network. While most of the previous work focuses either on using deep models or hand-engineered features extracted from images, we explore multiple deep models built on both images and audio signals. Specifically, in addition to convolutional neural networks (CNN) and recurrent neutral networks (RNN) trained on facial images, the hybrid network also contains one SVM classifier trained on holistic acoustic feature vectors, one long short-term memory network (LSTM) trained on short-term feature sequences extracted from segmented audio clips, and one Inception(v2)-LSTM network trained on image-like maps, which are built based on short-term acoustic feature sequences. Experimental results show that the proposed hybrid network outperforms the baseline method by a large margin.
研究动机与目标
- 解决在噪声大、条件多变且不受控的真实世界视频环境中进行情感识别的挑战。
- 通过充分挖掘音频通道信息,克服先前方法主要依赖视觉特征的局限性。
- 通过融合多模态深度学习模型与后期融合策略,提升在EmotiW 2017音频-视频情感识别子挑战中的性能。
- 证明结合音频与视觉模型,尤其是通过序列建模和特征图表示,可提升识别准确率。
提出的方法
- 在以8帧间隔提取的对齐面部图像上训练基于VGG-16的CNN-LSTM网络,以建模面部表情的时间动态。
- 采用双流VGG-LSTM架构:一个在通过自定义方法检测到的面部图像上训练,另一个在挑战组织方提供的面部图像上训练,以提升鲁棒性。
- 使用openSmile提取的整体音频特征向量训练SVM分类器,用于基于音频的情感识别。
- 在短期音频特征序列上实现LSTM网络,以建模音频模态中的时间动态。
- 将堆叠的短期音频特征转换为类似图像的图,并训练Inception(v2)-LSTM网络,以学习音频表示中的时空模式。
- 通过网格搜索优化的决策级融合策略,融合所有五个模型(两个VGG-LSTM、一个SVM、一个LSTM、一个Inception(v2)-LSTM)的预测结果,以最大化验证集准确率。
实验结果
研究问题
- RQ1结合视觉与音频模态的混合深度学习架构是否能显著提升在非受限视频环境中的情感识别准确率?
- RQ2基于短期音频特征生成的图像图与原始音频序列相比,在建模情感动态方面表现如何?
- RQ3在存在帧间隔的面部图像上端到端训练CNN-LSTM,是否优于先提取特征再单独训练RNN的方法?
- RQ4当与视觉模型融合时,基于音频的模型(尤其是使用LSTM和SVM处理音频特征的模型)对整体性能的贡献程度如何?
- RQ5对音频与视频的不同表示形式分别训练多个深度模型,并进行后期融合,是否能在EmotiW 2017基准上实现更优性能?
主要发现
- 所提出的混合网络在验证集上达到55.61%的准确率,显著优于EmotiW 2017音频-视频情感识别子挑战基线的38.81%。
- 在对齐面部图像上表现最佳的VGG-LSTM模型达到49.61%的准确率,优于2016年子挑战赛冠军的45.43%准确率。
- 两个VGG-LSTM模型(在不同人脸检测方法上训练)的组合在验证集上达到51.02%的准确率,表明多源人脸检测具有优势。
- 基于音频的模型,特别是基于音频图的Inception(v2)-LSTM模型,达到26.63%的验证集准确率,并在愤怒类别上表现突出,为整体融合性能提升做出贡献。
- 最终的混合网络在测试集上达到51.15%的准确率,各类别加权平均准确率为41.21%,表明在不同情感类别上具有良好的泛化能力。
- 测试集上的混淆矩阵显示,该模型在快乐(63.89%召回率)和中性(50.78%召回率)类别上表现最佳,而在惊讶类别上表现最差(0%召回率),表明存在类别特定的挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。