[论文解读] Multi-modal Expression Recognition with Ensemble Method
本论文针对 ABAW 2023 挑战赛提出了一种基于集成的多模态表情识别系统,通过结合多样化的预训练视觉与音频特征,并利用时间编码器(LSTM 与 Transformer)提升情绪识别性能。该方法通过策略性特征融合与模型集成策略,在验证集上实现了 0.45774 的平均 F1 分数。
This paper presents our submission to the Expression Classification Challenge of the fifth Affective Behavior Analysis in-the-wild (ABAW) Competition. In our method, multimodal feature combinations extracted by several different pre-trained models are applied to capture more effective emotional information. For these combinations of visual and audio modal features, we utilize two temporal encoders to explore the temporal contextual information in the data. In addition, we employ several ensemble strategies for different experimental settings to obtain the most accurate expression recognition results. Our system achieves the average F1 Score of 0.45774 on the validation set.
研究动机与目标
- 通过利用多模态数据(视觉与音频)提升野外情境下的情感行为分析能力,实现更鲁棒的表情识别。
- 通过融合互补的视觉与音频特征,解决单模态模型的局限性,提升模型的泛化能力与鲁棒性。
- 探索来自视觉与音频模态的多个预训练模型之间的有效特征组合方式。
- 通过同时使用 LSTM 与 Transformer 架构,优化序列情感动态的时间建模。
- 通过结构化的模型集成策略,提升最终预测性能,涵盖多种架构与特征集合。
提出的方法
- 通过人脸检测器提取并对齐面部图像,对缺失帧进行时间插补,预处理视频数据。
- 使用一系列预训练模型提取多模态特征:视觉特征采用 DenseNet、IResNet100、MobileNet、MAE;音频特征采用 eGeMAPS、ComParE 2016、VGGish、Wav2Vec 2.0、ECAPA-TDNN 与 HuBERT。
- 通过拼接来自不同预训练模型的多样化视觉与音频特征嵌入,构建多模态特征表示。
- 在拼接后的多模态特征上应用两种时间编码器——LSTM 与 Transformer,以建模序列上下文与时间依赖性。
- 使用 Adam 优化器进行训练,采用 25 个周期的学习率调度策略,调整超参数如 dropout(0.3)、注意力头数(4)与序列长度(128)。
- 采用集成策略,包括在不同架构与特征组合的模型之间进行投票,以提升最终预测准确率。
实验结果
研究问题
- RQ1不同组合的预训练视觉与音频特征对表情识别性能有何影响?
- RQ2LSTM 与 Transformer 架构在建模面部与音频表情时间动态方面的相对有效性如何?
- RQ3模型集成在多模态表情识别中在多大程度上提升了鲁棒性与准确率?
- RQ4在表情识别背景下,自监督视觉特征(如 MAE)与监督模型(如 IResNet100)相比表现如何?
- RQ5手工设计特征与基于深度神经网络的音频特征在多模态情感识别中的贡献分别是什么?
主要发现
- 采用多种架构与特征组合的模型集成,实现了最高的验证集 F1 分数 0.45774。
- 表现最佳的单个模型(LSTM 搭配 densenet、mae、ires100、ecapatdnn、hubert)的 F1 分数为 0.41410。
- 基于 Transformer 的模型(使用 mae、ires100、densenet、ecapatdnn、hubert 特征)的 F1 分数为 0.39380。
- 消融实验表明,将 MAE、IResNet100 与 DenseNet 视觉特征,结合 ecapatdnn 与 hubert 音频特征,可获得最高 F1 分数(0.39380)。
- 在某些配置中,引入手工设计特征(如 ecapatdnn、fbank)可提升性能,优于仅使用深度学习音频特征的情况。
- 模型集成策略显著优于单个模型,证明了模型架构与特征选择多样性在性能提升中的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。