Skip to main content
QUICK REVIEW

[论文解读] AU-Guided Unsupervised Domain Adaptive Facial Expression Recognition

Kai Wang, Yuxin Gu|arXiv (Cornell University)|Dec 18, 2020
Emotion and Mood Recognition参考文献 52被引用 4
一句话总结

本文提出AdaFER,一种基于动作单元(AUs)引导的无监督域自适应框架,用于面部表情识别,通过利用面部动作单元(AUs)减少数据集之间的标注偏差。通过采用基于AUs的软标签分配和AUs引导的三元组损失,AdaFER在多个基准测试中达到最先进性能,包括在CK+数据集上达到81.40%的准确率,在ExpW数据集上达到70.86%。

ABSTRACT

The domain diversities including inconsistent annotation and varied image collection conditions inevitably exist among different facial expression recognition (FER) datasets, which pose an evident challenge for adapting the FER model trained on one dataset to another one. Recent works mainly focus on domain-invariant deep feature learning with adversarial learning mechanism, ignoring the sibling facial action unit (AU) detection task which has obtained great progress. Considering AUs objectively determine facial expressions, this paper proposes an AU-guided unsupervised Domain Adaptive FER (AdaFER) framework to relieve the annotation bias between different FER datasets. In AdaFER, we first leverage an advanced model for AU detection on both source and target domain. Then, we compare the AU results to perform AU-guided annotating, i.e., target faces that own the same AUs with source faces would inherit the labels from source domain. Meanwhile, to achieve domain-invariant compact features, we utilize an AU-guided triplet training which randomly collects anchor-positive-negative triplets on both domains with AUs. We conduct extensive experiments on several popular benchmarks and show that AdaFER achieves state-of-the-art results on all these benchmarks.

研究动机与目标

  • 解决因数据集间标注不一致及图像采集条件差异导致的面部表情识别中的域偏移问题。
  • 通过利用面部动作单元(AUs)客观且低偏差的特性,减少源域与目标域FER数据集之间的标注偏差。
  • 通过在训练过程中整合基于AUs的监督信号,提升无监督域自适应中的特征紧凑性与域不变性。
  • 在不增加推理成本的前提下,实现在多个跨数据集FER基准上的最先进性能。

提出的方法

  • 使用预训练的AUs检测模型,从源域和目标域图像中提取动作单元编码。
  • 通过检索与目标域图像具有匹配AUs编码的源域图像,实现基于AUs的标注,为目标域图像分配软标签。
  • 通过将源域图像(锚点)与具有相同或不同AUs编码的目标域图像(正/负样本)配对,构建AUs引导的三元组样本。
  • 使用三元组损失进行模型训练,基于AUs相似性最小化类内距离并最大化类间距离,以促进特征的紧凑性和域不变性。
  • 使用伪软标签和AUs引导的三元组损失,在目标域上微调预训练的源域FER模型。
  • 优化三元组采样阈值以平衡样本难度与训练稳定性,消融实验表明在0.5时性能最优。

实验结果

研究问题

  • RQ1面部动作单元(AUs)能否作为可靠的辅助信号,缓解跨域面部表情识别中的标注偏差?
  • RQ2在目标域无真实标签的情况下,AUs引导的软标签分配在提升泛化能力方面有多有效?
  • RQ3AUs引导的三元组训练在多大程度上增强了无监督域自适应中的特征紧凑性与域不变性?
  • RQ4整合基于AUs的监督信号是否能在多样化的FER基准上实现最先进性能?

主要发现

  • AdaFER在跨数据集面部表情识别任务中,于CK+数据集上实现了81.40%的新最先进准确率。
  • 在ExpW基准上,AdaFER达到70.86%的准确率,显著优于先前方法,创下新SOTA记录。
  • 当以RAF-DB作为源数据集时,该方法在所有目标数据集上的平均准确率较基线提升8.94%。
  • 通过T-SNE进行的特征可视化证实,与基线相比,AdaFER学习到的特征更具紧凑性且类别间分离更清晰,尤其在中性表情上表现更优。
  • 消融实验表明,将三元组挖掘阈值设为0.5时性能最优,能有效平衡样本难度与训练稳定性。
  • AdaFER在不增加推理成本的前提下实现性能提升,而无需像其他方法那样在推理阶段进行复杂的特征融合或节点初始化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。