[论文解读] Probabilistic Attribute Tree in Convolutional Neural Networks for Facial Expression Recognition
该论文提出了一种新型深度学习框架——概率属性树卷积神经网络(PAT-CNN),通过分层树结构显式建模与身份相关的属性(如性别、种族和年龄),以减少面部表情识别中的类内差异。通过将样本概率性地分配至树节点,并在叶节点上采用半监督策略训练表情分类器,PAT-CNN 在无约束数据集(如 SFEW)上仅使用单一模型即实现了最先进性能,优于需数百个网络的集成方法。
In this paper, we proposed a novel Probabilistic Attribute Tree-CNN (PAT-CNN) to explicitly deal with the large intra-class variations caused by identity-related attributes, e.g., age, race, and gender. Specifically, a novel PAT module with an associated PAT loss was proposed to learn features in a hierarchical tree structure organized according to attributes, where the final features are less affected by the attributes. Then, expression-related features are extracted from leaf nodes. Samples are probabilistically assigned to tree nodes at different levels such that expression-related features can be learned from all samples weighted by probabilities. We further proposed a semi-supervised strategy to learn the PAT-CNN from limited attribute-annotated samples to make the best use of available data. Experimental results on five facial expression datasets have demonstrated that the proposed PAT-CNN outperforms the baseline models by explicitly modeling attributes. More impressively, the PAT-CNN using a single model achieves the best performance for faces in the wild on the SFEW dataset, compared with the state-of-the-art methods using an ensemble of hundreds of CNNs.
研究动机与目标
- 解决由年龄、种族和性别等身份相关属性引起的面部表情识别中较大的类内差异问题。
- 开发一种深度学习框架,通过分层聚类学习与表情相关的特征,同时最小化这些属性的影响。
- 通过利用表情标注样本和属性标注样本的半监督策略,实现在属性标注数据有限情况下的有效训练。
- 提升在高个体可变性导致传统 CNN 表现不佳的真实世界无约束面部表情数据集上的性能。
提出的方法
- 在卷积神经网络的最终池化层之后插入一种新型概率属性树(PAT)模块,根据身份属性将特征组织为分层树结构。
- 树中的每个节点基于其父节点的特征进行聚类,使用特定属性(如性别或种族),并通过一种新型 PAT 损失函数更新聚类中心。
- 根据样本特征与聚类中心的相似度,将样本概率性地分配至树中的所有节点,实现对多种属性状态的加权特征学习。
- 从树的叶节点提取与表情相关的特征,并通过加权求和方式组合在这些特征上训练的分类器,形成最终分类器。
- 采用半监督训练策略:PAT 损失仅使用属性标注样本以优化聚类中心,而表情损失则使用所有表情标注样本以训练最终分类器。
- PAT 损失函数通过在反向传播过程中最小化特征与其分配聚类中心之间的距离,确保形成语义上有意义的聚类。
实验结果
研究问题
- RQ1分层的、基于属性的聚类机制是否能有效降低身份相关差异对卷积神经网络中面部表情识别的影响?
- RQ2当仅一小部分数据被标注了身份属性时,深度学习模型如何有效学习与表情相关的特征?
- RQ3将样本概率性地分配至属性节点是否能提升在无约束面部表情数据集上的泛化能力与性能?
- RQ4单一模型的 PAT-CNN 是否能在真实世界面部表情基准(如 SFEW)上超越基于集成的最先进方法?
主要发现
- 在 SFEW 数据集上,PAT-VGG 搭载性别与种族属性的模型在测试集上达到 62.90% 的准确率,超过最佳集成方法(61.6%)和所有单一模型基线。
- PAT-ResNet 使用相同属性在测试集上达到 62.10% 的准确率,优于基线 ResNet(56.72%)及其他单一模型方法。
- PAT-CNN 仅使用单一模型即在 SFEW 数据集上实现了最先进性能,而次优方法则需要数百个网络的集成。
- 在 RAF-DB 和 BU-3DFE 数据集上,PAT-CNN 超过了基线 VGG 与 ResNet 模型,表明在多种有姿态和自发表情数据集上均表现出一致的性能提升。
- 半监督训练策略有效利用了有限的属性标注数据,在无需对所有样本进行完整属性标注的情况下提升了性能。
- PAT 损失函数成功引导形成了语义上有意义的聚类,表现为特征解耦程度与识别准确率的提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。