Skip to main content
QUICK REVIEW

[论文解读] Learning Disentangled Expression Representations from Facial Images

Marah Halawa, Manuel Wöllhaf|arXiv (Cornell University)|Aug 16, 2020
Face recognition and analysis参考文献 26被引用 6
一句话总结

本文提出一种基于编码器的对抗性方法,通过将与表情相关的特征与其他因素(如身份和姿态)分离,从野外图像中学习解耦的面部表情表征。采用共享编码器与双分支结构,并结合对抗性训练,模型在 AffectNet 上达到 60.53% 的准确率,优于先前的 SOTA 方法,且无需额外数据或注意力机制。

ABSTRACT

Face images are subject to many different factors of variation, especially in unconstrained in-the-wild scenarios. For most tasks involving such images, e.g. expression recognition from video streams, having enough labeled data is prohibitively expensive. One common strategy to tackle such a problem is to learn disentangled representations for the different factors of variation of the observed data using adversarial learning. In this paper, we use a formulation of the adversarial loss to learn disentangled representations for face images. The used model facilitates learning on single-task datasets and improves the state-of-the-art in expression recognition with an accuracy of60.53%on the AffectNetdataset, without using any additional data.

研究动机与目标

  • 解决在无约束、野外场景中面部表情识别的挑战,其中标注数据稀缺。
  • 通过将表情表征与身份、姿态和面部属性等混淆因素解耦,提升模型泛化能力。
  • 开发一种方法,在不依赖额外数据集或注意力机制的前提下实现最先进性能。
  • 通过对抗性损失抑制非表情表征中的表情信息,确保解耦的鲁棒性。
  • 在未见数据集(如 CASIA)上验证所学表征的零样本迁移性能。

提出的方法

  • 采用共享编码器(En_base),后接两个专用分支:一个用于表情特征(B_exp),一个用于非表情特征(B_non-exp)。
  • 使用交叉熵损失和表情标签,以监督方式训练 B_exp 分支,学习具有判别性的表情表征。
  • 在 B_non-exp 分支上应用对抗性损失(L_adv),使用判别器(C_adv_exp)尝试从非表情编码中分类表情。
  • 优化非表情分支以欺骗判别器,确保其学习到的表征不包含表情信息。
  • 使用重建损失(L_r)确保组合编码向量(code_exp ⊕ code_non-exp)能重建原始输入图像。
  • 通过超参数 β1 控制重建损失的影响,消融实验表明其对解耦有负面影响。

实验结果

研究问题

  • RQ1对抗性训练能否有效从无约束面部图像中其他变化因素里解耦出面部表情表征?
  • RQ2移除重建损失是否能提升解耦性能和下游表情识别准确率?
  • RQ3通过学习解耦表征,模型能否在未见数据集上实现泛化,从而在不同身份间保持表情相似性?
  • RQ4与使用注意力机制或多数据集预训练的最先进方法相比,所提方法表现如何?
  • RQ5采用对称对抗性损失策略,身份与表情表征在多大程度上可实现有效解耦?

主要发现

  • 所提方法在 AffectNet 数据集上达到 60.53% 的测试准确率,优于此前 SOTA 的 58.78%,且未使用额外数据或注意力机制。
  • 消融研究显示,重建损失(β1 > 0)损害了解耦效果,表现为 C_adv_exp 准确率升高(β1=0.001 时达 53%),且在分离表情特征方面性能下降。
  • 当 β1 = 0 时,模型实现最佳解耦,C_adv_exp 准确率降至 16%,表明非表情编码能有效隐藏表情信息。
  • 在 CASIA 数据集上的余弦相似性分析表明,相同表情的图像无论身份如何,其表征都更相似,验证了表征解耦质量。
  • 在 CK+ 上的定性结果表明,通过表征交换可成功生成图像:交换表情或身份表征后,生成图像在身份或表情上均保持一致。
  • 该方法表明,解耦可在无需解码器网络的情况下实现,与 D2AE 等先前方法不同,从而简化了网络结构,同时保持性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。