Skip to main content
QUICK REVIEW

[论文解读] Using Self-Supervised Auxiliary Tasks to Improve Fine-Grained Facial Representation

Mahdi Pourmirzaei, Gholam Ali Montazer|arXiv (Cornell University)|May 13, 2021
Face recognition and analysis被引用 15
一句话总结

本文提出混合多任务学习(HMTL),一种将自监督辅助任务——图像拼图与感知修复——整合到细粒度面部表征微调中的方法。在AffectNet数据集上,HMTL在无需预训练数据的情况下实现了八类情绪面部表情识别的最先进性能,优于传统的自监督预训练方法,并在低数据环境下展现出更大的性能提升。

ABSTRACT

Facial emotion recognition (FER) is a fine-grained problem where the value of transfer learning is often assumed. We first quantify this assumption and show that, on AffectNet, training from random initialization with sufficiently strong augmentation consistently matches or surpasses fine-tuning from ImageNet. Motivated by this result, we propose Hybrid Multi-Task Learning (HMTL) for FER in the wild. HMTL augments supervised learning (SL) with self-supervised learning (SSL) objectives during training, while keeping the inference-time model unchanged. We instantiate HMTL with two tailored pretext tasks, puzzling and inpainting with a perceptual loss, that encourage part-aware and expression-relevant features. On AffectNet, both HMTL variants achieve state-of-the-art accuracy in the eight-emotion setting without any additional pretraining data, and they provide larger gains under low-data regimes. Compared with conventional SSL pretraining, HMTL yields stronger downstream performance. Beyond FER, the same strategy improves fine-grained facial analysis tasks, including head pose estimation and gender recognition. These results suggest that aligned SSL auxiliaries are an effective and simple way to strengthen supervised fine-grained facial representation without adding extra computation cost during inference time.

研究动机与目标

  • 探究在真实场景下,细粒度面部表征学习是否需要自监督预训练。
  • 通过在不增加额外数据或推理成本的前提下改进特征学习,解决面部表情识别中标签数据有限的挑战。
  • 开发一种统一的训练框架,通过面向面部细粒度分析的自监督目标来增强监督学习。
  • 评估对齐的自监督任务是否能在情绪识别之外的多个细粒度面部分析任务中提升性能。

提出的方法

  • 提出混合多任务学习(HMTL),将面部表情识别的监督学习与两个自监督掩码任务联合训练。
  • 引入一种‘拼图’任务,将输入图像分割为图像块,并训练模型预测图像块的顺序,以促进对局部区域敏感的特征学习。
  • 采用基于VGG的感知损失实现感知修复任务,以重建缺失的图像区域,促进与表情相关的特征学习。
  • 推理阶段的模型结构与标准监督学习保持一致,确保部署时无额外计算开销。
  • 使用多任务损失函数,结合交叉熵损失用于情绪分类,以及两个辅助任务的损失,联合优化训练过程。
  • 在训练过程中应用强数据增强策略,以提升泛化能力,尤其在低数据场景下表现更优。

实验结果

研究问题

  • RQ1在AffectNet上,从随机初始化开始进行微调并结合强数据增强,是否优于从ImageNet预训练模型进行迁移学习?
  • RQ2在不使用预训练数据的前提下,自监督辅助任务能否提升下游面部表情识别的性能?
  • RQ3所提出的掩码任务——拼图与感知修复——在学习部分感知特征与表情相关特征方面分别起到什么作用?
  • RQ4HMTL框架是否可泛化至情绪识别之外的其他细粒度面部分析任务?
  • RQ5在下游性能与数据效率方面,HMTL与传统自监督预训练方法相比表现如何?

主要发现

  • 在AffectNet上,HMTL结合两个辅助任务,在无需任何预训练数据的情况下,实现了八类情绪设置下的最先进准确率。
  • HMTL优于传统的自监督预训练方法,表明对齐的辅助任务比通用预训练更具有效性。
  • HMTL在低数据场景下的性能增益尤为显著,表明其具有更高的数据效率。
  • 相同的HMTL策略在其他细粒度面部分析任务(如头部姿态估计与性别识别)中也提升了性能。
  • 仅从随机初始化开始并结合强数据增强的训练策略,其性能达到或超过从ImageNet微调的模型,挑战了ImageNet预训练为必需的假设。
  • 感知修复任务对性能的贡献大于拼图任务,表明与表情相关的图像重建比空间顺序预测更具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。