Skip to main content
QUICK REVIEW

[论文解读] Pose-adaptive Hierarchical Attention Network for Facial Expression Recognition

Yuanyuan Liu, Jiyao Peng|arXiv (Cornell University)|May 24, 2019
Emotion and Mood Recognition参考文献 35被引用 19
一句话总结

本文提出PhaNet,一种姿态自适应的分层注意力网络,可在非约束、多视角设置下联合识别面部表情与头部姿态。通过利用分层像素与尺度注意力机制,该方法自适应地选择姿态不变、表情判别性强的区域,并采用动态加权多任务学习优化端到端训练,实现SOTA性能:在多视角数据集上平均准确率达84.92%,在真实场景SFEW数据集上达31.25%。

ABSTRACT

Multi-view facial expression recognition (FER) is a challenging task because the appearance of an expression varies in poses. To alleviate the influences of poses, recent methods either perform pose normalization or learn separate FER classifiers for each pose. However, these methods usually have two stages and rely on good performance of pose estimators. Different from existing methods, we propose a pose-adaptive hierarchical attention network (PhaNet) that can jointly recognize the facial expressions and poses in unconstrained environment. Specifically, PhaNet discovers the most relevant regions to the facial expression by an attention mechanism in hierarchical scales, and the most informative scales are then selected to learn the pose-invariant and expression-discriminative representations. PhaNet is end-to-end trainable by minimizing the hierarchical attention losses, the FER loss and pose loss with dynamically learned loss weights. We validate the effectiveness of the proposed PhaNet on three multi-view datasets (BU-3DFE, Multi-pie, and KDEF) and two in-the-wild FER datasets (AffectNet and SFEW). Extensive experiments demonstrate that our framework outperforms the state-of-the-arts under both within-dataset and cross-dataset settings, achieving the average accuracies of 84.92\%, 93.53\%, 88.5\%, 54.82\% and 31.25\% respectively.

研究动机与目标

  • 解决非约束环境下多视角面部表情识别(FER)中姿态变化带来的性能下降问题。
  • 通过提出端到端可训练的框架,克服依赖姿态估计算法的两阶段方法的局限性。
  • 通过分层注意力联合学习表情与姿态表征,提升模型鲁棒性与泛化能力。
  • 实现在无微调情况下有效进行跨数据集FER,尤其在具有高领域差异的野外数据集上表现优异。
  • 设计一种动态多任务学习方案,通过可学习损失权重自适应平衡表情与姿态学习。

提出的方法

  • 引入分层像素注意力学习(HPAL),采用两个级联的弱监督像素注意力网络,在多尺度下检测与表情相关的关键区域。
  • 采用联合尺度注意力学习(SAL),根据其对姿态不变与表情判别性表征学习的贡献,选择最具信息量的尺度。
  • 应用动态约束多任务学习(DCML)框架,通过自适应对称损失权重最小化分层注意力损失、FER损失与姿态损失。
  • 在损失加权机制中引入约束因子,防止梯度消失并稳定训练,尤其对表情任务具有显著稳定作用。
  • 使用多损失目标端到端训练整个网络,结合注意力、表情与姿态监督。
  • 借鉴人类视觉系统直觉——当全局特征被遮挡或形变时聚焦于局部特征——通过建模分层特征抽象实现该机制。

实验结果

研究问题

  • RQ1单一深度网络能否在无需姿态归一化或每种姿态单独分类器的情况下,联合学习姿态不变与表情判别性表征?
  • RQ2在姿态变化下,分层注意力在识别对表情识别最相关的面部区域方面效果如何?
  • RQ3与固定或未加权损失组合相比,动态加权多任务学习是否能提升收敛速度与性能?
  • RQ4在无领域自适应情况下,于约束多视角数据集上训练的模型在野外、非约束数据集上的泛化能力有多强?
  • RQ5所提出的注意力机制能否在保持高FER准确率的同时,降低对精确姿态估计算法的依赖?

主要发现

  • PhaNet在BU-3DFE、Multi-Pie与KDEF多视角数据集上实现84.92%的平均准确率,在同数据集与跨数据集设置下均优于SOTA方法。
  • 在野外SFEW数据集上,PhaNet无需任何微调即实现31.25%的准确率,超越基于GAN(26.58%)与DenseNet(26.16%)的方法。
  • 消融实验表明,将分层注意力损失与姿态及表情损失结合可获得最高性能(BU-3DFE上达84.92%),证实多损失设计的有效性。
  • 动态损失加权中引入约束因子可防止梯度消失,尤其稳定表情任务的训练,否则该任务易出现梯度消失。
  • 动态损失权重在训练过程中演化:表情损失权重从低初始值上升至约0.6,姿态损失权重下降至约0.4,反映任务特定贡献并提升收敛性。
  • 在BU-3DFE上姿态估计准确率达100%,证明联合学习框架在复杂条件下仍能稳健识别头部姿态。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。