Skip to main content
QUICK REVIEW

[论文解读] Multi-model Ensemble Learning Method for Human Expression Recognition

Jun Yu, Zhongpeng Cai|arXiv (Cornell University)|Mar 28, 2022
Human Pose and Action Recognition被引用 4
一句话总结

本文提出了一种用于野生视频数据中人类表情识别的多模型集成学习方法,结合ResNet、EfficientNet和InceptionNet主干网络,并采用焦点损失(focal loss)以解决类别不平衡问题。该方法在AffWild2数据集上采用内部折内与跨折集成策略,通过模型融合与数据分布多样性提升F1分数,展示了在真实世界表情识别场景中的优异性能。

ABSTRACT

Analysis of human affect plays a vital role in human-computer interaction (HCI) systems. Due to the difficulty in capturing large amounts of real-life data, most of the current methods have mainly focused on controlled environments, which limit their application scenarios. To tackle this problem, we propose our solution based on the ensemble learning method. Specifically, we formulate the problem as a classification task, and then train several expression classification models with different types of backbones--ResNet, EfficientNet and InceptionNet. After that, the outputs of several models are fused via model ensemble method to predict the final results. Moreover, we introduce the multi-fold ensemble method to train and ensemble several models with the same architecture but different data distributions to enhance the performance of our solution. We conduct many experiments on the AffWild2 dataset of the ABAW2022 Challenge, and the results demonstrate the effectiveness of our solution.

研究动机与目标

  • 解决在数据稀缺且复杂的非约束性(野生)视频环境中识别人类面部表情的挑战。
  • 通过利用不同深度学习架构(ResNet、EfficientNet、InceptionNet)进行特征提取,提升识别性能。
  • 在模型训练过程中使用焦点损失缓解AffWild2数据集中的类别不平衡问题。
  • 通过应用多折集成策略与不同数据划分,提升模型的泛化能力和鲁棒性。
  • 通过多个模型的集成融合,在ABAW2022表情分类挑战赛中实现最先进性能。

提出的方法

  • 使用ResNet50、EfficientNet-b0和InceptionNet-v1作为主干网络,分别训练三个独立的表情分类模型,所有模型均使用VGGFace2或ImageNet的预训练权重初始化,以提升特征学习能力。
  • 应用数据增强技术,包括随机水平翻转(RandomHorizontalFlipping)和颜色抖动(ColorJitter),以增加训练数据的多样性并提升模型泛化能力。
  • 采用两阶段集成策略:第一阶段,使用可学习的融合权重融合不同主干网络模型的输出;第二阶段,应用五折交叉验证,对相同架构但不同数据划分的模型进行训练与集成。
  • 使用焦点损失作为损失函数,以缓解AffWild2数据集中类别不平衡问题,其定义为 $\mathbf{F}\mathbf{L}(p)=\sum_{i=1}^{m}y_{i}\alpha_{i}(1-p_{i})^{\gamma_{i}}\log(p_{i})$,其中包含类别特定权重 $\alpha_i$ 和聚焦参数 $\gamma$。
  • 使用Adam优化器配合余弦退火学习率调度器进行训练优化,并在NVIDIA Tesla A100 GPU上使用批量大小256进行训练。
  • 通过加权平均融合所有模型的最终预测结果以最大化性能,融合权重根据验证集表现进行调优。

实验结果

研究问题

  • RQ1结合具有不同结构设计的多种深度学习架构,是否能提升在野生视频数据中表情识别的性能?
  • RQ2在AffWild2数据集中,使用焦点损失在缓解表情分类任务中的类别不平衡问题方面效果如何?
  • RQ3在不同数据分布的多折数据上训练并集成模型,是否能增强模型的鲁棒性与泛化能力?
  • RQ4在野生表情识别设置中,模型集成学习相较于单模型基线模型,其性能提升程度如何?
  • RQ5对于在不同主干网络和数据划分上训练的多样化模型,最优的预测融合策略是什么?

主要发现

  • 多模型集成方法在AffWild2测试集上实现了0.421的最终平均F1分数,显著优于单个模型。
  • ResNet50在Fold 1中取得了最高的F1分数0.317,而EfficientNet-b0与InceptionNet-v1在各折中表现也具有竞争力,表明其特征学习具有互补性。
  • 跨折集成策略通过降低方差并增强泛化能力,有效提升了模型性能,尤其在融合不同数据划分上训练的模型时效果显著。
  • 使用焦点损失显著提升了模型收敛速度,并改善了少数类别的F1分数,有效缓解了AffWild2数据集中的长尾分布问题。
  • 最终的集成模型通过融合多个融合配置的结果,实现了最佳整体性能,验证了所提出的多模型与多折集成方法的有效性。
  • 该方法在非约束性环境中表现出强鲁棒性与泛化能力,验证了其在真实世界人机交互应用中的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。