[论文解读] Multi-modal Affect Analysis using standardized data within subjects in the Wild
该论文提出了一种用于真实场景下面部情感识别的多模态时序建模框架,采用受试者内标准化特征。通过将通用深度特征与来自视频序列的受试者特定z-score归一化特征相结合——在融合模态(图像、面部动作单元、头部姿态、视线)上使用GRU网络——该方法在ABAW 2021验证集上实现了0.546的最先进表情分类得分,显著优于基线模型。
Human affective recognition is an important factor in human-computer interaction. However, the method development with in-the-wild data is not yet accurate enough for practical usage. In this paper, we introduce the affective recognition method focusing on facial expression (EXP) and valence-arousal calculation that was submitted to the Affective Behavior Analysis in-the-wild (ABAW) 2021 Contest. When annotating facial expressions from a video, we thought that it would be judged not only from the features common to all people, but also from the relative changes in the time series of individuals. Therefore, after learning the common features for each frame, we constructed a facial expression estimation model and valence-arousal model using time-series data after combining the common features and the standardized features for each video. Furthermore, the above features were learned using multi-modal data such as image features, AU, Head pose, and Gaze. In the validation set, our model achieved a facial expression score of 0.546. These verification results reveal that our proposed framework can improve estimation accuracy and robustness effectively.
研究动机与目标
- 提升在非约束、真实场景视频设置下的情感识别准确率,其中光照、姿态和个体差异会降低性能。
- 通过引入时序动态和个体内部的面部表情相对变化,解决静态帧基模型的局限性。
- 通过结合多模态输入(图像、AU、头部姿态、视线)与受试者特定的特征标准化,增强模型的鲁棒性与准确性。
- 验证人类对表情的判断依赖于个体内部的相对变化而非绝对值的假设。
- 在ABAW 2021面部表情分类与愉悦度-唤醒度估计挑战赛中实现最先进性能。
提出的方法
- 使用MTCNN对视频帧进行预处理,以分离主要受试者的面部,随后通过HSV色彩校正来归一化光照差异。
- 使用预训练模型提取多模态特征:ResNet50用于图像特征,OpenFace 2.2.0用于深度嵌入特征,并从面部关键点检测AU、头部姿态和视线。
- 对时序特征应用受试者内标准化(z-score),以强调个体内部的相对变化,减少受试者间差异。
- 将通用深度特征与标准化特征融合,并输入到基于GRU的循环网络中,以建模2–3秒窗口内的时序动态。
- 对因遮挡或未检测到面部而缺失的帧,使用线性插值进行填补,以保持序列连续性。
- 使用长度为N=2或3秒的时间序列输入序列进行GRU模型训练,采样间隔L=6帧,通过数据平衡和伪标签法提升泛化能力。
实验结果
研究问题
- RQ1在非约束视频设置中,引入受试者特定的面部特征标准化是否能提升面部表情识别的准确率?
- RQ2图像、AU、头部姿态和视线等多模态特征的融合是否能超越单模态方法,提升情感估计性能?
- RQ3与帧级基线相比,通过GRU网络建模时序动态能在多大程度上提升性能?
- RQ4对时序特征进行降维在情感识别中如何影响过拟合与模型泛化?
- RQ5所提出的框架能否在ABAW 2021挑战赛基准上实现最先进性能?
主要发现
- 所提方法在ABAW 2021验证集上实现了0.546的面部表情分类得分,超过基线模型,并与去年竞赛的最高分持平。
- 同时使用多模态输入与受试者标准化特征的模型(Multi-modal-std4)取得了最高的F1得分0.488与准确率0.663。
- 受试者内标准化显著提升了性能,支持了人类情感感知依赖于个体内部相对面部变化的假设。
- 将输入特征维度从512降低至300后,泛化能力提升,过拟合减少,表情得分从0.534提升至0.546。
- 在验证集上的愉悦度与唤醒度估计得分分别为0.245与0.442,表明在连续情感维度上表现中等。
- 帧缺失插值方法提升了在存在临时面部遮挡或不稳定的视频中的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。