[论文解读] Mutilmodal Feature Extraction and Attention-based Fusion for Emotion Estimation in Videos
该论文提出了一种基于注意力机制的多模态融合框架,用于基于视频的情感估计,整合了来自不同长度视频的视觉、音频和姿态特征。通过在时序特征上应用交叉注意力机制并连接注意力表示,该模型在 ABAW 2023 基准测试中实现了 0.361 的验证 F1 分数,优于早期融合和单模态基线模型。
The continuous improvement of human-computer interaction technology makes it possible to compute emotions. In this paper, we introduce our submission to the CVPR 2023 Competition on Affective Behavior Analysis in-the-wild (ABAW). Sentiment analysis in human-computer interaction should, as far as possible Start with multiple dimensions, fill in the single imperfect emotion channel, and finally determine the emotion tendency by fitting multiple results. Therefore, We exploited multimodal features extracted from video of different lengths from the competition dataset, including audio, pose and images. Well-informed emotion representations drive us to propose a Attention-based multimodal framework for emotion estimation. Our system achieves the performance of 0.361 on the validation dataset. The code is available at [https://github.com/xkwangcn/ABAW-5th-RT-IAI].
研究动机与目标
- 通过利用视觉、音频和姿态等多种模态,提升开放环境下的情感行为分析能力,实现更鲁棒的情感估计。
- 通过融合来自不同数据流的互补信息,解决单模态方法的局限性。
- 通过注意力机制增强情感动态的时序建模,以加权关注跨模态的相关上下文特征。
- 在 ABAW 2023 开放环境情感行为分析挑战赛中达到最先进性能。
提出的方法
- 在 AffectNet 上使用预训练的 FAN(人脸对齐网络)提取面部特征,随后在 Aff-Wild2 上进行微调,以提升面部表征学习能力。
- 使用 DenseNet121 提取音频特征,采用 1 秒窗口和 500ms 步长,生成 1024 维嵌入向量。
- 以 0.5 秒间隔使用 OpenPose 提取 2D 姿态坐标,生成动态姿态序列。
- 对人脸、音频和姿态特征序列分别应用两层 RNN 以建模时序依赖性。
- 实现交叉注意力模块,以当前帧的面部特征作为查询,关注来自各模态的时序上下文。
- 将三个注意力特征表示与当前面部特征拼接,并通过全连接层进行表情预测。
实验结果
研究问题
- RQ1与早期融合或晚期融合相比,基于注意力机制的多模态特征(视觉、音频、姿态)融合是否能提升情感估计性能?
- RQ2通过整合来自多个模态的长程时序上下文,能否增强在非约束视频设置下的情感识别鲁棒性?
- RQ3在推理过程中,使用交叉注意力机制动态加权其他模态的相关上下文信息,其影响如何?
- RQ4所提出的框架是否能在不同数据划分上泛化,并在 ABAW 2023 验证集上保持高性能?
主要发现
- 基于注意力的融合模型在验证集上实现了 0.361 的 F1 分数,优于早期融合(0.318)和单模态基线模型。
- 该模型在第 5 个数据划分上取得了最高的平均 F1 分数(35.5%),并在官方划分上实现了最佳整体性能(33.7%)。
- 注意力融合策略显著提升了对“愤怒”(32% F1)和“惊讶”(28% F1)等困难类别的性能,这些类别通常被低估。
- 使用交叉注意力使模型能够动态关注来自音频、姿态和视觉序列的相关时序上下文,从而提升特征表示质量。
- 该模型在五个随机数据划分上表现出强大的泛化能力,F1 分数范围为 30.0% 至 35.5%。
- 在 Aff-Wild2 上微调 FAN 显著提升了面部特征质量,从而贡献于整体性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。