Skip to main content
QUICK REVIEW

[论文解读] $M^3$T: Multi-Modal Continuous Valence-Arousal Estimation in the Wild

Yuanhang Zhang, Rulin Huang|arXiv (Cornell University)|Feb 7, 2020
Speech and Audio Processing参考文献 23被引用 6
一句话总结

本文提出 $M^{3}$T,一种用于在真实场景中通过视频和音频信号进行连续愉悦度-唤醒度估计的多模态多任务框架。它利用3D卷积神经网络提取时空视觉特征,使用双向RNN进行序列建模,并将情绪识别和面部动作单元检测作为辅助任务,最终在 ABAW 2020 验证集上实现了 0.44 的平均一致性相关系数(CCC),显著优于先前方法。

ABSTRACT

This report describes a multi-modal multi-task ($M^3$T) approach underlying our submission to the valence-arousal estimation track of the Affective Behavior Analysis in-the-wild (ABAW) Challenge, held in conjunction with the IEEE International Conference on Automatic Face and Gesture Recognition (FG) 2020. In the proposed $M^3$T framework, we fuse both visual features from videos and acoustic features from the audio tracks to estimate the valence and arousal. The spatio-temporal visual features are extracted with a 3D convolutional network and a bidirectional recurrent neural network. Considering the correlations between valence / arousal, emotions, and facial actions, we also explores mechanisms to benefit from other tasks. We evaluated the $M^3$T framework on the validation set provided by ABAW and it significantly outperforms the baseline method.

研究动机与目标

  • 通过多模态和多任务学习,提升在非受限、真实场景视频设置下的连续愉悦度-唤醒度估计性能。
  • 探究辅助任务(如分类情绪识别和面部动作单元检测)如何提升愉悦度和唤醒度估计的性能。
  • 探索通过晚期融合和注意力机制实现视觉与音频特征早期融合的有效性。
  • 评估在大规模视频数据集(如 VoxCeleb2)上预训练3D卷积神经网络主干网络对端到端情感识别性能的影响。
  • 基于 Aff-Wild2 数据集,建立一个多模态连续情感估计的强基线模型。

提出的方法

  • 该框架采用类似 VGG 的3D主干网络,从视频片段中提取时空视觉特征,并为愉悦度和唤醒度分别设置独立分支。
  • 通过拼接来自预训练模型的2D静态特征(用于情绪识别和面部动作单元检测)来增强视觉特征。
  • 使用双向GRU对提取的视觉特征中的长程时间依赖性进行建模。
  • 音频特征通过独立的声学子网络提取,结合GRU和全连接层完成回归任务。
  • 通过拼接或注意力机制在最终预测前对视觉与音频特征进行晚期融合。
  • 模型采用多任务损失函数进行训练:愉悦度和唤醒度使用均方误差,情绪识别使用交叉熵损失。

实验结果

研究问题

  • RQ1辅助任务(如分类情绪识别和面部动作单元检测)是否能提升连续愉悦度-唤醒度估计的性能?
  • RQ2视觉与音频模态特征的融合在提升真实场景下情感估计性能方面有多有效?
  • RQ3在大规模视频数据集(如 VoxCeleb2)上预训练3D卷积神经网络主干网络是否能提升在 Aff-Wild2 基准上的性能?
  • RQ4基于注意力的融合是否优于简单的拼接方式?
  • RQ5不同特征融合策略(如拼接与注意力机制)对愉悦度和唤醒度预测最终性能有何影响?

主要发现

  • 所提出的 $M^{3}$T 框架在 ABAW 2020 验证集上实现了 0.44 的平均一致性相关系数(CCC),显著优于基线方法。
  • 该模型在唤醒度估计上达到 CCC 0.55,表明在该维度上表现优异,可能归因于3D卷积对时间动态的有效建模。
  • 在 VoxCeleb2 上预训练3D主干网络可提升性能,预训练方法的平均 CCC 为 0.42,而从零开始训练的模型为 0.40。
  • 通过拼接实现的音视频融合性能更优(CCC = 0.44),优于基于注意力的融合(CCC = 0.42),可能由于训练时间不足。
  • 在唤醒度分支中使用 SENet-101 特征而非动作单元特征表现更佳,表明其与唤醒度的相关性更强。
  • 实验结果表明,结合音频与视频信号能显著提升唤醒度估计性能,但对愉悦度估计无明显改善,与先前研究结果一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。