Skip to main content
QUICK REVIEW

[论文解读] Emotion Recognition with Incomplete Labels Using Modified Multi-task Learning Technique

Phan Tran Dac Thinh, Hoàng Mạnh Hùng|arXiv (Cornell University)|Jul 8, 2021
Emotion and Mood Recognition被引用 11
一句话总结

本论文提出了一种改进的多任务学习方法,采用ResNet50并结合VGGFace2预训练,在AffWild2数据集上提升了情绪识别与面部动作单元检测的性能,该数据集的标签存在不完整的情况。通过联合训练七种基本情绪与12个动作单元,并使用Focal Loss缓解类别不平衡问题,该方法在情绪分类任务上实现了0.757的F1加权准确率,在动作单元检测任务上达到了0.731,显著优于单任务基线模型。

ABSTRACT

The task of predicting affective information in the wild such as seven basic emotions or action units from human faces has gradually become more interesting due to the accessibility and availability of massive annotated datasets. In this study, we propose a method that utilizes the association between seven basic emotions and twelve action units from the AffWild2 dataset. The method based on the architecture of ResNet50 involves the multi-task learning technique for the incomplete labels of the two tasks. By combining the knowledge for two correlated tasks, both performances are improved by a large margin compared to those with the model employing only one kind of label.

研究动机与目标

  • 解决AffectNet等情感计算数据集中标签不完整且不平衡的问题,如AffWild2数据集。
  • 通过多任务学习共享表示,提升面部情绪分类与动作单元检测的性能。
  • 利用Focal Loss缓解七种基本情绪数据集中类别不平衡问题。
  • 评估共享主干网络架构在真实世界、非约束性面部数据上的多任务训练有效性。

提出的方法

  • 采用ImageNet预训练权重的ResNet50作为主干网络,并通过VGGFace2预训练进行微调,以提升在面部情感识别任务上的泛化能力。
  • 采用改进的多任务训练方案,处理三类不同的数据子集:仅含情绪标签的图像、仅含AU标签的图像,以及同时包含两类标签的数据。
  • 在七分类情绪分类任务中使用Focal Loss,以缓解长尾类分布问题,提升少数类别的性能。
  • 在12个多标签动作单元检测任务中使用二元交叉熵损失。
  • 实施三阶段训练循环:第一阶段在仅含情绪标签的数据上更新;第二阶段在仅含AU标签的数据上更新;第三阶段在联合标注数据上更新,所有阶段均在同一优化周期内完成。
  • 对输入图像进行归一化处理(112×112,RGB),不使用数据增强,且由于音频存在不一致的可用性与质量,故排除音频信息。

实验结果

研究问题

  • RQ1在标签不完整的情况下,通过共享表示的多任务学习是否能同时提升情绪分类与动作单元检测的性能?
  • RQ2Focal Loss在缓解七种基本情绪数据集中因类别不平衡导致的性能下降方面是否有效?
  • RQ3相较于ImageNet或EmotionNet预训练,使用VGGFace2预训练是否能提升模型在AffWild2数据集上的泛化能力?
  • RQ4共享主干网络架构在多任务学习中在多大程度上增强了两种情感识别任务的特征学习能力?
  • RQ5通过分别处理部分标注数据(仅情绪、仅AU、联合标注)的训练方案,是否相比标准多任务学习具有更好的收敛性与性能?

主要发现

  • 所提方法在七种基本情绪分类任务上实现了0.757的F1加权准确率,显著优于基线模型的0.366,以及单任务ResNet50(EmotionNet)基线的0.462。
  • 采用Focal Loss与多任务学习的模型达到0.757的F1加权准确率,优于仅使用共享主干网络的方案(0.713)与VGGFace2预训练基线(0.556)。
  • 在面部动作单元检测任务中,多任务学习方法实现了0.731的F1加权准确率,优于单任务基线(0.31)与共享主干基线(0.655)。
  • 与ImageNet或EmotionNet预训练相比,使用VGGFace2预训练显著提升了两个任务的性能。
  • 分别处理仅含情绪标签、仅含AU标签及联合标注数据的训练方案,提升了模型收敛性与性能,尤其在处理不完整标签方面表现更优。
  • 模型在仅训练10个周期后即达到最优性能,表明所提出的训练策略与学习率调度具有高效的特征学习能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。