Skip to main content
QUICK REVIEW

[论文解读] Interpretable Multimodal Emotion Recognition using Facial Features and Physiological Signals

Puneet Kumar, Xiaobai Li|arXiv (Cornell University)|Jun 5, 2023
Emotion and Mood Recognition被引用 5
一句话总结

本文提出了一种可解释的多模态情感识别框架,通过早期和晚期融合策略将视频输入中的rPPG信号与面部特征进行融合。利用排列特征重要性(PFI)方法量化各模态的贡献,最终在IEMOCAP数据集上达到54.61%的准确率,其中视觉特征贡献62.33%,rPPG贡献37.67%。

ABSTRACT

This paper aims to demonstrate the importance and feasibility of fusing multimodal information for emotion recognition. It introduces a multimodal framework for emotion understanding by fusing the information from visual facial features and rPPG signals extracted from the input videos. An interpretability technique based on permutation feature importance analysis has also been implemented to compute the contributions of rPPG and visual modalities toward classifying a given input video into a particular emotion class. The experiments on IEMOCAP dataset demonstrate that the emotion classification performance improves by combining the complementary information from multiple modalities.

研究动机与目标

  • 开发一种多模态情感识别系统,整合非侵入性生理信号(rPPG)与视觉信号(面部),以提升情感分类性能。
  • 通过引入基于PFI的方法,量化各模态的贡献,解决多模态AI模型可解释性不足的问题。
  • 评估早期与晚期融合策略在结合动态rPPG与静态面部特征进行情感识别时的有效性。
  • 证明多模态融合相较于单模态方法能显著提升性能,尤其在捕捉细微情感状态方面。
  • 为实际情感计算应用中的真实场景部署,提供透明且可解释的AI输出。

提出的方法

  • 使用Haar级联算法进行人脸检测,并在面部感兴趣区域(ROI)上计算RGB均值强度,依据公式(1)提取rPPG信号。
  • 利用在Face Scrub数据集上预训练的Dlib 68点关键点检测器提取面部特征,以捕捉空间面部结构。
  • 训练两个独立的深度学习模型:一个用于rPPG信号,采用带有ReLU激活函数的CNN;另一个用于面部特征,基于ResNet-34架构。
  • 早期融合在分类前将原始rPPG与面部特征嵌入向量进行拼接,而晚期融合则分别独立处理各模态,再合并预测结果。
  • 应用排列特征重要性(PFI)方法,通过随机打乱特征值并测量模型性能下降程度,来估计各模态的贡献。
  • 各模态的PFI分数按公式(5)计算,即原始特征集与打乱特征集之间期望模型得分的差值。
Figure 1: Schematic illustration of the proposed framework.
Figure 1: Schematic illustration of the proposed framework.

实验结果

研究问题

  • RQ1在情感识别准确率方面,rPPG与面部特征的早期融合与晚期融合相比表现如何?
  • RQ2rPPG信号与面部特征对最终情感分类决策的相对贡献是什么?
  • RQ3排列特征重要性是否能有效量化多模态输入在情感识别中的可解释性?
  • RQ4与单模态模型相比,多模态融合在IEMOCAP数据集上是否显著提升性能?
  • RQ5当应用于真实世界中多样化的情感表达视频数据时,所提出的框架具有多强的鲁棒性?

主要发现

  • 早期融合模型在IEMOCAP数据集上实现了54.61%的最高情感分类准确率,优于单一模态模型。
  • 通过排列特征重要性测量,rPPG模态对最终分类性能的贡献为37.67%,而面部特征贡献62.33%。
  • 单独的rPPG模型准确率为37.45%,而面部特征模型达到46.42%,表明视觉线索具有更强的判别能力。
  • 晚期融合的性能(准确率41.17%)低于早期融合,表明早期融合更有利于跨模态表征学习。
  • 早期融合模型的F1得分为0.57,反映出各类情感之间精确率与召回率的平衡表现。
  • 结果证实,融合互补模态可显著提升多模态情感识别系统的鲁棒性与准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。