Skip to main content
QUICK REVIEW

[论文解读] Multi-modal Emotion Estimation for in-the-wild Videos

Liyu Meng, Yuchen Liu|arXiv (Cornell University)|Mar 24, 2022
Emotion and Mood Recognition被引用 13
一句话总结

本文提出了一种用于野生视频中愉悦度-唤醒度估计的多模态深度学习方法,结合视觉与音频特征,并采用时间编码器(LSTM 和 Transformer)及后处理平滑技术。该方法在 Aff-Wild2 验证集上实现了愉悦度 65.55% 的 CCC 和唤醒度 70.88% 的 CCC,证明了多模态融合与模型集成在真实世界情感计算中的有效性。

ABSTRACT

In this paper, we briefly introduce our submission to the Valence-Arousal Estimation Challenge of the 3rd Affective Behavior Analysis in-the-wild (ABAW) competition. Our method utilizes the multi-modal information, i.e., the visual and audio information, and employs a temporal encoder to model the temporal context in the videos. Besides, a smooth processor is applied to get more reasonable predictions, and a model ensemble strategy is used to improve the performance of our proposed method. The experiment results show that our method achieves 65.55% ccc for valence and 70.88% ccc for arousal on the validation set of the Aff-Wild2 dataset, which prove the effectiveness of our proposed method.

研究动机与目标

  • 改进在非约束性、真实世界视频场景中愉悦度与唤醒度的估计,其中情感表达微妙且多变。
  • 通过融合视觉与音频模态,解决单模态方法的局限性,以捕捉互补的情感线索。
  • 利用循环与自注意力机制建模视频序列中的时间动态,以提升序列情感预测性能。
  • 通过后处理平滑与模型集成策略提升预测鲁棒性。

提出的方法

  • 该方法将视频处理为面部图像帧,并使用 IResNet100、DenseNet 和 FAU 模型提取视觉特征。
  • 音频特征通过 ComParE、VGGish、eGeMAPs 和 wav2vec 模型提取,以捕捉语调与频谱情感线索。
  • 将视觉与音频流的多模态特征拼接后,输入使用 LSTM 或 Transformer 架构的时间编码器,以建模序列上下文。
  • 通过两层全连接回归头,从编码表示中逐帧预测愉悦度与唤醒度分数。
  • 后处理采用时间平滑,愉悦度使用 20 帧窗口,唤醒度使用 50 帧窗口,以减少预测噪声。
  • 模型集成通过结合多种架构、超参数与特征集的模型预测,提升泛化能力与性能。

实验结果

研究问题

  • RQ1视觉与音频特征的多模态融合在提升非约束视频中愉悦度与唤醒度估计方面的有效性如何?
  • RQ2不同视觉与音频特征提取器对情感识别性能的相对贡献是什么?
  • RQ3LSTM 与基于 Transformer 的时间编码器在建模视频数据中序列情感动态方面表现如何比较?
  • RQ4后处理平滑与模型集成在多大程度上提升了预测的稳定性与准确性?
  • RQ5哪种特征与架构的组合在 Aff-Wild2 基准上表现最佳?

主要发现

  • 所提方法在 Aff-Wild2 验证集上实现了愉悦度 65.55% 的一致性 concordance 相关系数(CCC)与唤醒度 70.88% 的 CCC,表现强劲。
  • TRM-v2 基于 Transformer 的模型在唤醒度预测中表现最佳(0.7088 CCC),而 TRM-v1 在特定特征组合下对愉悦度表现最佳(0.6089 CCC)。
  • 模型集成策略显著提升了性能,唤醒度的 CCC 从最佳单模型的 0.6628 提升至 0.7088,愉悦度从 0.6113 提升至 0.6555。
  • ComParE 和 wav2vec 的音频特征对愉悦度预测贡献最大,而 VGGish 和 wav2vec 对唤醒度预测最具影响力。
  • DenseNet 和 FAU 的视觉特征在愉悦度预测中优于 IResNet100,且 FAU 与 DenseNet 的组合性能优于单一模型。
  • 采用优化窗口大小(愉悦度 20 帧,唤醒度 50 帧)的时间平滑显著提升了预测曲线的稳定性和真实性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。