Skip to main content
QUICK REVIEW

[论文解读] Multitask Emotion Recognition with Incomplete Labels

Didan Deng, Zhaokang Chen|arXiv (Cornell University)|Feb 10, 2020
Emotion and Mood Recognition参考文献 34被引用 14
一句话总结

本论文提出了一种用于多任务面部情绪识别的教师-学生蒸馏框架,适用于不完整标签的情况,其中在部分真实标签上训练的教师模型生成软标签以监督多个学生模型。学生模型在面部动作单元检测、表情分类和效价-唤醒估计任务上均优于教师模型,尤其在模型集成后表现更优,表明通过完整但不完美的监督实现了更好的泛化能力。

ABSTRACT

We train a unified model to perform three tasks: facial action unit detection, expression classification, and valence-arousal estimation. We address two main challenges of learning the three tasks. First, most existing datasets are highly imbalanced. Second, most existing datasets do not contain labels for all three tasks. To tackle the first challenge, we apply data balancing techniques to experimental datasets. To tackle the second challenge, we propose an algorithm for the multitask model to learn from missing (incomplete) labels. This algorithm has two steps. We first train a teacher model to perform all three tasks, where each instance is trained by the ground truth label of its corresponding task. Secondly, we refer to the outputs of the teacher model as the soft labels. We use the soft labels and the ground truth to train the student model. We find that most of the student models outperform their teacher model on all the three tasks. Finally, we use model ensembling to boost performance further on the three tasks.

研究动机与目标

  • 解决多任务面部情绪识别中因数据集通常不包含全部三类标签(动作单元、表情、效价-唤醒)而导致的不完整标签学习挑战。
  • 缓解情绪数据集中存在的数据不平衡问题,尤其针对表情识别和动作单元检测等分类任务。
  • 开发一种通用的、与网络架构无关的方法,利用教师模型生成的软标签来训练学生模型,即使某些任务的真实标签缺失。
  • 通过共享特征学习挖掘任务间相关性,从而在单任务基线基础上提升模型泛化能力和性能。
  • 证明基于教师模型软标签训练的学生模型优于教师模型,尤其在模型集成后表现更优。

提出的方法

  • 仅使用每条样本中可用的真实标签,独立训练教师模型完成全部三项任务。
  • 将教师模型的输出作为软标签——即各类别的概率分布——用于所有任务,即使在真实标签缺失的样本上也适用。
  • 结合真实标签(当可用时)和教师模型生成的软标签,联合监督多个学生模型进行训练。
  • 应用数据平衡技术,包括对少数类进行过采样、对多数类进行欠采样,以缓解分类任务中的类别不平衡问题。
  • 采用共享主干网络与任务特定分类头的结构,实现特征共享并提升模型参数效率。
  • 通过模型集成进一步提升性能,融合多个学生模型的预测结果。

实验结果

研究问题

  • RQ1在不完整标签的多任务情绪识别中,基于教师模型软标签训练的学生模型是否能超越教师模型?
  • RQ2数据平衡是否能提升多任务情绪识别性能?其对回归任务(如效价-唤醒)与分类任务的影响是否不同?
  • RQ3具有共享特征和软标签蒸馏的教师-学生框架能否有效处理多个情绪识别任务中的缺失标签问题?
  • RQ4与仅使用稀疏真实标签训练相比,从在不完整监督下训练的教师模型中蒸馏知识是否能增强学生模型的泛化能力?
  • RQ5在不完整标签存在的情况下,模型集成对面部动作单元检测、表情分类和效价-唤醒估计任务的性能影响如何?

主要发现

  • 学生模型在所有三项任务——面部动作单元检测、表情分类和效价-唤醒估计——上,无论在验证集还是测试集上,均持续优于教师模型。
  • 学生模型集成达到最高性能,使用CNN-RNN架构且序列长度为32时,面部动作单元检测的F1得分为0.607,唤醒估计的F1得分为0.454。
  • 对于CNN-RNN模型且序列长度为32,学生模型集成在面部动作单元上取得0.607的F1得分,在表情分类上为0.405,在效价上为0.440,在唤醒上为0.454。
  • 数据平衡显著提升了分类任务的性能(例如,AU检测的F1从0.5465提升至0.5802),但对回归任务影响甚微。
  • 采用软标签蒸馏的教师-学生框架在泛化能力上优于仅使用不完整真实标签的训练方式,即使教师模型使用的是相同数据。
  • 该方法具有通用性,可推广至情绪识别之外的任务,因其不依赖教师或学生模型的特定神经网络架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。