Skip to main content
QUICK REVIEW

[论文解读] Feature-level and Model-level Audiovisual Fusion for Emotion Recognition in the Wild

Jie Cai, Zibo Meng|arXiv (Cornell University)|Jun 6, 2019
Emotion and Mood Recognition参考文献 53被引用 8
一句话总结

本论文提出了两种音视频融合策略——特征级融合与模型级融合,用于在真实场景中进行情绪识别,采用音频特征(OpenSmile)与视觉特征(LBP-TOP、CNN集成模型及CNN-BLSTM)。在EmotiW2018 AFEW数据集上,两种方法均显著优于单模态基线模型,其中特征级融合达到56.81%的测试准确率,而模型级融合在某一模态失效时表现出更强的鲁棒性。

ABSTRACT

Emotion recognition plays an important role in human-computer interaction (HCI) and has been extensively studied for decades. Although tremendous improvements have been achieved for posed expressions, recognizing human emotions in "close-to-real-world" environments remains a challenge. In this paper, we proposed two strategies to fuse information extracted from different modalities, i.e., audio and visual. Specifically, we utilized LBP-TOP, an ensemble of CNNs, and a bi-directional LSTM (BLSTM) to extract features from the visual channel, and the OpenSmile toolkit to extract features from the audio channel. Two kinds of fusion methods, i,e., feature-level fusion and model-level fusion, were developed to utilize the information extracted from the two channels. Experimental results on the EmotiW2018 AFEW dataset have shown that the proposed fusion methods outperform the baseline methods significantly and achieve better or at least comparable performance compared with the state-of-the-art methods, where the model-level fusion performs better when one of the channels totally fails.

研究动机与目标

  • 解决在非受限、真实环境中,由于视觉与音频模态存在可变性,导致情绪识别困难的问题。
  • 通过有效融合来自多种深度学习与人工设计特征表示的音频与视觉特征,提升情绪识别性能。
  • 设计对模态失效具有鲁棒性的融合策略,以应对音频与视频信号之间的时序错位与尺度差异。
  • 在EmotiW2018 AFEW数据集上,将所提融合方法与当前最先进方法进行对比,以验证其优越性与鲁棒性。

提出的方法

  • 从面部序列中提取视觉特征,采用LBP-TOP、CNN集成模型以及双向LSTM(CNN-BLSTM)方法。
  • 使用OpenSmile工具包提取音频特征,重点关注基频、能量以及梅尔频率倒谱系数(MFCC)等语音与频谱特征。
  • 通过将音频特征与三种类型的视觉特征拼接,形成单一联合特征向量,实现特征级融合,用于分类任务。
  • 采用贝叶斯网络实现模型级融合,对单模态识别结果进行概率性整合,以考虑测量不确定性与时序错位问题。
  • 通过随机裁剪、旋转(-5°至5°)以及水平翻转等数据增强方法,提升模型在面部图像上的泛化能力。
  • 在EmotiW2018 AFEW数据集上使用标准的验证集与测试集进行模型训练与评估,性能以七类情绪的平均准确率衡量。

实验结果

研究问题

  • RQ1与单模态基线相比,音频与多样化视觉特征的特征级融合是否能提升在非受限环境中的情绪识别准确率?
  • RQ2采用贝叶斯网络等概率框架的模型级融合,是否能在某一模态失效或表现不佳时增强整体系统的鲁棒性?
  • RQ3在EmotiW2018 AFEW数据集上,所提融合方法在平均准确率与各类别准确率方面,相较于当前最先进方法表现如何?
  • RQ4这些融合策略在识别难以捕捉的情绪(如厌恶、恐惧与惊讶)方面改善程度如何,这些情绪在单模态特征中表现较差?

主要发现

  • 特征级融合实现了56.81%的最高测试准确率,显著优于所有单模态基线模型及多数最先进方法。
  • 模型级融合达到54.06%的测试准确率,在验证集上表现出更强的鲁棒性,尤其在识别厌恶、恐惧与惊讶等困难情绪时表现更优。
  • CNN-BLSTM视觉特征提取器在验证集上达到49.09%的准确率,优于LBP-TOP与独立CNN模型,表明时序建模具有显著优势。
  • 两种融合方法均显著提升了平均识别性能,其中特征级融合在测试集上相较单模态基线的提升幅度最大。
  • 模型级融合在识别挑战性情绪方面优于特征级融合,因其通过概率集成方式有效处理不确定性与模态特异性误差。
  • 尽管性能有所提升,厌恶、恐惧与惊讶情绪的识别仍具挑战,所有单模态基线准确率均低于50%,表明这些类别仍需更优的特征表示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。