[论文解读] Efficient Facial Expression Analysis For Dimensional Affect Recognition Using Geometric Features
本文提出了一种计算效率高的面部表情分析系统,用于基于几何特征和偏最小二乘法(PLS)回归的维度情感识别。该系统联合估计唤醒度(Arousal)、效价(Valence)和强度(Intensity),利用2D面部关键点实现,性能与深度学习模型相当,但计算成本显著降低,并且所学特征具有直观可解释性。
Despite their continued popularity, categorical approaches to affect recognition have limitations, especially in real-life situations. Dimensional models of affect offer important advantages for the recognition of subtle expressions and more fine-grained analysis. We introduce a simple but effective facial expression analysis (FEA) system for dimensional affect, solely based on geometric features and Partial Least Squares (PLS) regression. The system jointly learns to estimate Arousal and Valence ratings from a set of facial images. The proposed approach is robust, efficient, and exhibits comparable performance to contemporary deep learning models, while requiring a fraction of the computational resources.
研究动机与目标
- 通过采用维度情感模型,解决分类法面部表情识别在真实世界低强度场景下的局限性。
- 开发一种轻量化、高效的FEA系统,使其在非约束(‘真实世界’)条件下仍能有效运行。
- 仅使用几何面部特征,实现唤醒度、效价和强度的联合估计。
- 通过利用面部关键点之间的距离作为输入特征,确保模型的可解释性。
- 在仅需深度学习模型所需计算资源一小部分的前提下,实现与之相当的性能。
提出的方法
- 使用监督下降法(SDM)从输入图像中检测2D面部关键点。
- 应用基于关键点的面部正交化方法,以规范化头部姿态变化,提升对非正面对视角的鲁棒性。
- 提取49个面部关键点之间的1176对距离作为几何特征,用于情感表征。
- 训练偏最小二乘法(PLS)回归模型,从几何特征中联合预测唤醒度、效价和强度。
- 利用MorphSet框架进行数据增强,将分类数据集转换为平衡的、带有AVI标注的维度数据集。
- 由于在多样化真实世界数据分布中表现出更优的泛化能力与稳定性,最终选择包含29个成分的PLS作为模型。
实验结果
研究问题
- RQ1基于几何特征的方法是否能在维度情感识别中实现与深度学习模型相当的性能?
- RQ2在光照和姿态多变的真实世界条件下,所提出系统的表现如何?
- RQ3所学习的几何特征在多大程度上与心理生理学观察到的面部形变模式一致?
- RQ4在分布外设置下,PLS回归是否比Ridge或PCR等其他回归方法具有更好的泛化能力?
- RQ5模型的预测结果能否从面部解剖学和情感意义角度进行有意义的解释?
主要发现
- 在测试集上,基于PLS的系统在唤醒度上的均方误差(MSE)为0.0314,效价为0.0388,强度为0.0281,性能与深度学习模型相当。
- 在所有测试的回归方法中,包含29个成分的PLS在实时网络摄像头画面的定性测试中表现出最稳定、最鲁棒的性能,表明其对未见数据分布具有更优的泛化能力。
- 对唤醒度贡献最高的几何特征是涉及眉毛内侧部分与眼睛之间距离的特征,与高唤醒度表情的心理生理学观察一致。
- 嘴角的离心度增加以及内侧眉毛上移与更高的效价显著相关,与真实微笑与假笑的研究发现一致。
- 强度的预测是唤醒度与效价相关特征的组合,特别是涉及内侧眉毛到眼睛的距离和嘴角离心度的特征,反映了面部形变的幅度。
- PLS模型的权重使得面部特征与情感预测之间的关联可直观解释,可视化中较粗、较深的线条表示对预测情感值的贡献更高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。