Skip to main content
QUICK REVIEW

[论文解读] Affect Expression Behaviour Analysis in the Wild using Consensual Collaborative Training

Darshan Gera, S. Balasubramanian|arXiv (Cornell University)|Jul 8, 2021
Emotion and Mood Recognition参考文献 34被引用 4
一句话总结

该论文提出了一种名为共识协作训练(Consensual Collaborative Training, CCT)的鲁棒深度学习框架,用于在真实世界场景下进行面部表情识别,通过使用动态混合的监督损失与一致性损失,联合训练三个网络来缓解噪声标注的影响。该方法在Aff-Wild2数据集上优于多个竞争方法,在使用三网络结构并基于AffectNet进行预训练的情况下,验证集上的综合得分达到0.4814,展示了在无音频或关键点特征依赖的前提下,对真实世界噪声环境的优越泛化能力。

ABSTRACT

Facial expression recognition (FER) in the wild is crucial for building reliable human-computer interactive systems. However, annotations of large scale datasets in FER has been a key challenge as these datasets suffer from noise due to various factors like crowd sourcing, subjectivity of annotators, poor quality of images, automatic labelling based on key word search etc. Such noisy annotations impede the performance of FER due to the memorization ability of deep networks. During early learning stage, deep networks fit on clean data. Then, eventually, they start overfitting on noisy labels due to their memorization ability, which limits FER performance. This report presents Consensual Collaborative Training (CCT) framework used in our submission to expression recognition track of the Affective Behaviour Analysis in-the-wild (ABAW) 2021 competition. CCT co-trains three networks jointly using a convex combination of supervision loss and consistency loss, without making any assumption about the noise distribution. A dynamic transition mechanism is used to move from supervision loss in early learning to consistency loss for consensus of predictions among networks in the later stage. Co-training reduces overall error, and consistency loss prevents overfitting to noisy samples. The performance of the model is validated on challenging Aff-Wild2 dataset for categorical expression classification. Our code is made publicly available at https://github.com/1980x/ABAW2021DMACS.

研究动机与目标

  • 为解决如Aff-Wild2等大规模真实世界面部表情数据集中因噪声标注导致的模型性能下降问题,尤其是深度网络对噪声标签的记忆现象。
  • 开发一种无需事先知晓噪声分布或架构约束的噪声鲁棒训练框架。
  • 通过在训练过程中利用多网络间的共识,提升面部表情识别的泛化能力。
  • 在ABAW 2021竞赛中,于具有挑战性的Aff-Wild2数据集上验证所提方法的有效性。

提出的方法

  • CCT通过使用相同架构但不同随机初始化的三个深度神经网络进行联合训练,以促进多样化的学习路径并减少个体误差累积。
  • 训练损失为交叉熵监督损失与一致性损失的凸组合,通过类似高斯的上升函数实现动态平衡,使损失权重随时间从监督主导逐步转向共识构建主导。
  • 一致性损失通过对齐三个网络预测结果的后验分布,强制其预测保持一致,从而防止对噪声标签的过拟合。
  • 动态加权因子λ在训练初期强调监督损失,后期则优先考虑一致性损失,实现先在干净数据上稳健学习,后在困难样本上达成共识。
  • 该框架与网络架构无关,且不假设任何特定的噪声分布,因此可广泛应用于各类噪声面部表情识别数据集。
  • 在AffectNet等大规模数据集上进行预训练可提升性能,消融实验也证实了三网络结构与一致性损失的有效性。

实验结果

研究问题

  • RQ1通过动态损失过渡联合训练三个深度网络,能否有效降低面部表情识别中噪声标注的影响?
  • RQ2监督损失与一致性损失之间的动态平衡如何影响模型在噪声真实世界数据集上的泛化能力?
  • RQ3在存在标签噪声的情况下,协同训练的最优网络数量是多少?
  • RQ4在AffectNet等大规模数据集上进行预训练是否能提升CCT框架的性能?
  • RQ5与仅使用监督损失训练相比,引入一致性损失有何优势?

主要发现

  • 三网络CCT结构在Aff-Wild2验证集上取得最高性能,综合得分为0.4814,优于单网络、双网络或四网络结构。
  • 使用动态平衡因子β = 4.0时性能最佳,综合得分为0.4814,表明从监督到一致性的过渡达到最优。
  • 在AffectNet上进行预训练显著提升了性能(F1: 0.4040,准确率: 0.6378),相较于RAFDB或MS-Celeb-1M更具优势,证实其在大规模FER任务中的价值。
  • 过采样未提升性能,因此最终训练中未采用,最佳模型为无过采样训练。
  • 引入一致性损失后,综合得分从仅使用交叉熵损失时的0.445提升至0.454,证明其在减少对噪声标签过拟合方面的有效性。
  • 模型在测试集上的F1得分为0.4646,在ABAW 2021表情分类赛道中位列顶尖提交结果,尽管未使用音频或视频特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。