[论文解读] Training Deep Networks for Facial Expression Recognition with Crowd-Sourced Label Distribution
本文提出使用众包标签分布而非单一多数投票来训练深度卷积神经网络(DCNNs)进行面部表情识别。通过利用每张图像的多个噪声标签,结合概率标签抽取(PLD)和交叉熵损失(CEL),该方法显著提升了准确率——比多数投票高出1%以上,表明建模标签不确定性可增强对噪声众包数据的鲁棒性。
Crowd sourcing has become a widely adopted scheme to collect ground truth labels. However, it is a well-known problem that these labels can be very noisy. In this paper, we demonstrate how to learn a deep convolutional neural network (DCNN) from noisy labels, using facial expression recognition as an example. More specifically, we have 10 taggers to label each input image, and compare four different approaches to utilizing the multiple labels: majority voting, multi-label learning, probabilistic label drawing, and cross-entropy loss. We show that the traditional majority voting scheme does not perform as well as the last two approaches that fully leverage the label distribution. An enhanced FER+ data set with multiple labels for each face image will also be shared with the research community.
研究动机与目标
- 通过利用多位标注者提供的标签分布,解决面部表情识别中噪声且主观的众包标签问题。
- 通过建模情绪标注中的不确定性,提升分类性能,超越传统多数投票方法。
- 创建并发布一个增强版FER+数据集,每张图像包含10个众包标签,以支持未来关于噪声标签学习的研究。
- 在深度网络上评估并比较四种训练方案——多数投票、多标签学习、概率标签抽取和交叉熵损失。
- 证明充分利用标签分布可提升在真实世界面部表情识别任务中的泛化能力与准确率。
提出的方法
- 从非专家标注者处收集每张图像的10个众包情绪标签,形成每个样本的标签分布。
- 对标签频率进行异常值剔除和归一化处理,为每张图像生成有效的概率分布 $ p_k^i $。
- 使用概率标签抽取(PLD):在每个训练周期中,从分布 $ p_k^i $ 中抽取一个单一情绪标签,然后应用标准交叉熵损失。
- 直接将交叉熵损失(CEL)应用于完整标签分布:$ \mathcal{L} = -\sum_{k=1}^{8} p_k^i \log q_k^i $,其中 $ q_k^i $ 为网络的预测概率。
- 使用每个四种方案(MV、ML、PLD、CEL)在五个随机种子下训练自定义的VGG13网络,以确保统计稳健性。
- 以多数情绪作为评估的真值,比较所有方案的测试准确率。
实验结果
研究问题
- RQ1与多数投票相比,建模众包情绪标签的完整分布是否能提升面部表情识别的准确率?
- RQ2不同处理标签分布的策略(如多标签学习、概率采样和直接分布拟合)如何影响DCNN的性能?
- RQ3使用标签分布是否能减轻面部表情识别中噪声且主观的标注带来的影响?
- RQ4在测试准确率方面,概率标签抽取与直接交叉熵损失在标签分布上的相对表现如何?
- RQ5尽管多标签学习在理论上具有处理多标签的灵活性,为何其表现仍低于预期?
主要发现
- 概率标签抽取(PLD)和交叉熵损失(CEL)方法取得了最高的测试准确率,分别为84.986% ± 0.366% 和 84.716% ± 0.239%。
- PLD与CEL均显著优于多数投票(MV),准确率提升超过1%,t值约为3.1,表明在99–99.5%置信水平下具有统计显著性。
- 多标签学习(ML)表现低于预期,准确率为83.966% ± 0.362%,表明训练与评估协议之间存在不匹配。
- PLD与CEL之间的性能差距在标准差范围内,表明两者效果相当,尽管PLD略占优势,可能因其与DisturbLabel方法的相似性。
- 模型在‘厌恶’和‘轻蔑’类别上表现最差,原因在于FER+训练集中样本数量过少,凸显数据不平衡是主要局限。
- 公开发布FER+数据集,包含每张图像10个标签及经异常值剔除的分布,以支持未来关于噪声标签学习的研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。