Skip to main content
QUICK REVIEW

[论文解读] Multimodal Emotion Recognition for One-Minute-Gradual Emotion Challenge

Ziqi Zheng, Chenjie Cao|arXiv (Cornell University)|May 3, 2018
Emotion and Mood Recognition参考文献 26被引用 22
一句话总结

本文提出了一种多模态方法,用于从一分钟长的视频片段中预测连续的唤醒度和效价,通过使用专用模型提取的音频、视觉和文本特征,随后进行基于支持向量机(SVM)的融合。该方法在验证集上实现了最先进的性能,唤醒度的组内相关系数(CCC)为0.397,效价的CCC为0.520,显著优于基线系统。

ABSTRACT

The continuous dimensional emotion modelled by arousal and valence can depict complex changes of emotions. In this paper, we present our works on arousal and valence predictions for One-Minute-Gradual (OMG) Emotion Challenge. Multimodal representations are first extracted from videos using a variety of acoustic, video and textual models and support vector machine (SVM) is then used for fusion of multimodal signals to make final predictions. Our solution achieves Concordant Correlation Coefficient (CCC) scores of 0.397 and 0.520 on arousal and valence respectively for the validation dataset, which outperforms the baseline systems with the best CCC scores of 0.15 and 0.23 on arousal and valence by a large margin.

研究动机与目标

  • 解决在一分钟长的视频片段中使用连续维度情感空间建模渐进情感变化的挑战。
  • 通过利用多模态数据,改进基线系统在唤醒度和效价预测方面的表现。
  • 开发一种稳健的融合策略,整合多种模态以提升情感识别性能。

提出的方法

  • 使用专用的音频、视频和文本模型从视频中提取多模态表征。
  • 使用支持向量机(SVM)对多模态信号进行早期融合,以预测连续的唤醒度和效价。
  • 应用基于唤醒度和效价维度的连续维度情感模型,以捕捉动态情感变化。
  • 在One-Minute-Gradual(OMG)情感挑战数据集上进行模型训练与验证。
  • 优化融合过程,以在验证数据上最大化组内相关系数(CCC)。
  • 利用多种预训练模型进行特征提取,以确保各模态间丰富的表征。

实验结果

研究问题

  • RQ1音频、视频和文本特征的多模态融合是否能提升长时长视频片段中的连续情感预测性能?
  • RQ2基于SVM的多模态信号融合与基线模型相比,在唤醒度和效价预测方面表现如何?
  • RQ3连续维度模型在多大程度上能够捕捉一分钟视频序列中的渐进情感变化?

主要发现

  • 所提出方法在验证数据集上对唤醒度预测的组内相关系数(CCC)达到0.397。
  • 该模型在效价预测上的CCC达到0.520,显著优于基线系统。
  • 结果表明,与仅达到0.15和0.23的基线模型相比,性能有显著提升。
  • 多模态表征与基于SVM的融合策略带来了更准确且稳定的预测结果。
  • 该方法通过连续维度建模,有效捕捉了一分钟视频片段中的渐进情感转变。
  • 研究结果证实了在连续情感识别任务中,早期融合多样化模态的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。