Skip to main content
QUICK REVIEW

[论文解读] An Audio-Video Deep and Transfer Learning Framework for Multimodal Emotion Recognition in the wild

Denis Dresvyanskiy, Elena Ryumina|arXiv (Cornell University)|Oct 7, 2020
Speech and Audio Processing被引用 9
一句话总结

该论文提出了一种用于在真实场景中使用音频和视频模态进行情绪识别的多模态深度迁移学习框架。该方法采用VGGFace2和VGG-FER模型进行视频的迁移学习,并通过Spleeter实现音频分离,利用加权融合策略融合单模态预测结果,在ABAW面部表情子挑战赛中取得了42.10%的测试集表现成绩。

ABSTRACT

In this paper, we present our contribution to ABAW facial expression challenge. We report the proposed system and the official challenge results adhering to the challenge protocol. Using end-to-end deep learning and benefiting from transfer learning approaches, we reached a test set challenge performance measure of 42.10%.

研究动机与目标

  • 在非受控的真实环境(真实场景)中,通过深度学习提升多模态情绪识别性能。
  • 探究在视频和音频模态中使用迁移学习在情绪识别中的有效性。
  • 评估不同融合策略以结合单模态预测结果,从而提升整体性能。
  • 分析音频模态在多模态情绪识别系统中的贡献。
  • 通过在ABAW面部表情挑战数据集上使用加权融合技术优化模型性能。

提出的方法

  • 使用迁移学习在面部表情数据上微调VGGFace2和VGG-FER模型,用于基于视频的情绪识别。
  • 通过2D卷积神经网络(CNN)与支持向量机(SVM)结合的时间建模方法,对4秒时长的视频片段(窗口)进行处理,利用深层特征的均值和标准差进行表征。
  • 使用Spleeter对音频进行语音成分分离,以减少背景噪声的干扰。
  • 采用1D卷积神经网络(CNN)与长短期记忆网络(LSTM)以及PANN模型进行音频表征学习。
  • 通过两种策略融合单模态预测结果:简单加权融合(SWF)和基于模型与类别加权融合(MCWF)。
  • 应用对数类权重和数据增强技术(旋转、翻转、亮度调整)以缓解类别不平衡问题并提升模型鲁棒性。

实验结果

研究问题

  • RQ1在真实场景中的基于视频的情绪识别任务中,使用VGGFace2和VGG-FER进行迁移学习的效果如何?
  • RQ2尽管存在噪声或静音录音,基于音频的模型是否仍能提升多模态情绪识别性能?
  • RQ3在多模态情绪识别中,哪种融合策略——SWF还是MCWF——表现更优?
  • RQ4用于捕捉视频序列中动态面部表情的最优时间窗口大小是多少?
  • RQ5不同的音频预处理与建模技术如何影响最终的识别准确率?

主要发现

  • 所提出的多模态融合系统在测试集上的挑战赛表现达到42.10%,为所有提交结果中的最高分。
  • 基于VGGFace2的CNN + SVM模型在验证集上达到55.66%,在测试集上达到42.00%,优于独立的音频模型。
  • 通过MCWF策略融合VGGFace2 + SVM与1D CNN + LSTM模型,在测试集上达到42.10%的性能,为最佳配置。
  • 基于音频的模型(1D CNN + LSTM 和 PANN)对性能贡献较小,可能由于数据质量问题,如背景噪声和静音。
  • MCWF融合策略在结合多样化视频模型时,性能优于简单平均法,表现更优。
  • 基于VGG-FER的CNN + KELM模型性能低于VGGFace2 + SVM方法,表明领域特定的微调至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。