[论文解读] Deep Multi-Facial Patches Aggregation Network For Facial Expression Recognition
该论文提出了一种深度多面部区域聚合网络(MFP-CNN),用于面部表情识别(FER),通过专用子网络从七个关键面部区域(眼睛、眉毛、鼻子、嘴巴)提取深层特征,并利用全局卷积神经网络进行特征聚合,同时通过基于条件生成对抗网络(Conditional GANs)和图像变换的两种新型数据增强技术提升模型泛化能力。该方法在CK+数据集上实现了98.07%的准确率,优于现有的基于帧的SOTA方法,且在处理中性与轻蔑表情等类别相关性问题时表现良好。
In this paper, we propose an approach for Facial Expressions Recognition (FER) based on a deep multi-facial patches aggregation network. Deep features are learned from facial patches using deep sub-networks and aggregated within one deep architecture for expression classification . Several problems may affect the performance of deep-learning based FER approaches, in particular, the small size of existing FER datasets which might not be sufficient to train large deep learning networks. Moreover, it is extremely time-consuming to collect and annotate a large number of facial images. To account for this, we propose two data augmentation techniques for facial expression generation to expand FER labeled training datasets. We evaluate the proposed framework on three FER datasets. Results show that the proposed approach achieves state-of-art FER deep learning approaches performance when the model is trained and tested on images from the same dataset. Moreover, the proposed data augmentation techniques improve the expression recognition rate, and thus can be a solution for training deep learning FER models using small datasets. The accuracy degrades significantly when testing for dataset bias.
研究动机与目标
- 通过提出数据增强技术扩展训练数据,解决基于深度学习的FER中标签数据有限的挑战。
- 通过基于区域的特征学习聚焦于具有判别性的面部区域(眼睛、眉毛、鼻子、嘴巴),提升FER性能。
- 开发一种深层神经网络架构,聚合多面部区域表示以增强表情分类能力。
- 在不同条件的数据集(如受控实验室环境与真实场景)之间评估模型泛化能力,识别数据集偏差作为主要局限性。
- 在CK+数据集上比较基于帧的深度学习模型与基于序列的方法的有效性。
提出的方法
- MFP-CNN架构利用面部关键点检测,从七个关键表情相关区域提取局部面部区域:左眼、右眼、左眉、右眉、鼻子、嘴巴及整体面部。
- 每个面部区域由专用的深度卷积子网络处理,以学习该区域特有的分层空间特征。
- 七个子网络的输出通过拼接方式融合,并输入全局卷积网络,以学习用于表情分类的高层表示。
- 提出两种数据增强技术:(1) 基于条件生成对抗网络(Conditional GAN)的面部表情生成;(2) 一组图像变换函数(如颜色抖动、旋转、缩放),用于合成新的训练样本。
- 模型采用交叉熵损失进行端到端训练,并在三个基准数据集(CK+、JAFFE、SFEW)上进行评估。
- 在SFEW数据集上应用微调,以提升在非约束、真实场景下面部表情的性能。
实验结果
研究问题
- RQ1与整体图像方法相比,基于区域的深度学习架构通过聚合多个面部区域的特征,是否能提升FER性能?
- RQ2所提出的两种数据增强技术——条件生成对抗网络(Conditional GANs)与图像变换——在小样本面部表情数据集上,能在多大程度上提升模型泛化能力?
- RQ3当模型在受控数据集(CK+)上训练并在非约束、真实世界数据集(SFEW)上测试时,其性能表现如何?微调是否能缓解域偏移问题?
- RQ4为何模型在跨数据集评估中性能显著下降?数据集偏差在这一性能下降中扮演何种角色?
- RQ5尽管序列方法占主导地位,基于帧的深度学习模型是否仍能在CK+数据集上实现SOTA性能?
主要发现
- MFP-CNN在CK+数据集上达到98.07%的准确率,优于现有基于帧的方法,且在常被误分类的中性与轻蔑表情上表现优异。
- 在CK+上训练并在JAFFE数据集上测试时,模型准确率为61.97%,且厌恶与中性表情之间混淆严重,表明存在显著的域偏移。
- 在CK+上训练后直接在非约束的SFEW数据集上测试,准确率仅为32.7%,凸显模型在无适应条件下对真实世界条件的泛化能力差。
- 在SFEW数据集80%的样本上进行微调后,剩余20%的测试集准确率提升至86.36%,表明适应能显著减轻域偏移的影响。
- 所提出的两种数据增强技术——尤其是基于条件生成对抗网络的生成方法——提升了识别率,并有助于缓解小样本数据集上的过拟合问题。
- 模型对同一类别内面部表情的类内变化具有鲁棒性,尤其在使用局部区域特征时表现稳定,且在同数据集评估中保持高准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。