[论文解读] DFEW: A Large-Scale Database for Recognizing Dynamic Facial Expressions in the Wild
本文提出了 DFEW,一个大规模的野外动态面部表情数据库,包含来自1,500部电影的16,372段视频剪辑,涵盖姿态变化、遮挡等多样的现实世界挑战。本文提出了表达聚类时空特征学习(EC-STFL)框架,通过学习与表情相关的时空特征,提升了动态面部表情识别(FER)的性能,在DFEW和迁移学习基准上均取得了最先进结果。
Recently, facial expression recognition (FER) in the wild has gained a lot of researchers' attention because it is a valuable topic to enable the FER techniques to move from the laboratory to the real applications. In this paper, we focus on this challenging but interesting topic and make contributions from three aspects. First, we present a new large-scale 'in-the-wild' dynamic facial expression database, DFEW (Dynamic Facial Expression in the Wild), consisting of over 16,000 video clips from thousands of movies. These video clips contain various challenging interferences in practical scenarios such as extreme illumination, occlusions, and capricious pose changes. Second, we propose a novel method called Expression-Clustered Spatiotemporal Feature Learning (EC-STFL) framework to deal with dynamic FER in the wild. Third, we conduct extensive benchmark experiments on DFEW using a lot of spatiotemporal deep feature learning methods as well as our proposed EC-STFL. Experimental results show that DFEW is a well-designed and challenging database, and the proposed EC-STFL can promisingly improve the performance of existing spatiotemporal deep neural networks in coping with the problem of dynamic FER in the wild. Our DFEW database is publicly available and can be freely downloaded from https://dfew-dataset.github.io/.
研究动机与目标
- 为非受限环境中的动态面部表情识别研究,解决缺乏大规模、真实场景下的动态面部表情数据库的问题。
- 开发一种鲁棒的深度学习框架,能够应对光照变化、遮挡和姿态变化等现实世界挑战。
- 建立一个基准数据集和框架,以提升真实应用场景下的性能表现与迁移学习能力。
提出的方法
- 通过从1,500多部电影中提取16,372段视频剪辑,构建 DFEW 数据库,捕捉自然、非受限的面部表情。
- 每段视频剪辑由10名独立且训练有素的标注员进行标注,以确保7种基本面部表情的可靠分布。
- EC-STFL 框架引入一种新型损失函数,基于表情类别对特征进行聚类,增强时空特征学习中的判别能力。
- 该框架引入一个权衡参数 λ,用于平衡表情感知聚类损失与标准分类损失。
- 采用跨多种批量大小的批量归一化策略,以确保训练稳定性。
- 通过使用 DFEW 和其他动作数据集的预训练模型,开展迁移学习实验,以评估在 AFEW7.0 上的泛化性能。
实验结果
研究问题
- RQ1与标准时空网络相比,所提出的 EC-STFL 框架在非受限、真实环境下的动态面部表情识别任务中,性能提升程度如何?
- RQ2DFEW 数据库在多大程度上提升了真实生活应用中情绪识别的迁移学习性能?
- RQ3EC-STFL 框架对超参数(如权衡参数 λ 和批量大小)的敏感性如何?
- RQ4DFEW 数据库能否作为下游情绪识别任务的强预训练源,其表现是否优于现有的动作识别数据集?
- RQ5多标注员标注对 DFEW 数据集在动态 FER 研究中的可靠性与实用性有何影响?
主要发现
- 当从 DFEW fd2 微调时,EC-STFL 框架在 AFEW7.0 基准上取得了 53.26 的 WAR 分数,相比之前最先进方法提升了约 2 个百分点。
- 从 DFEW 进行迁移学习的表现优于从其他大规模动作数据集(如 UCF101、Sports 1M 和 Kinect700)进行迁移学习,证明了 DFEW 作为预训练源的有效性。
- EC-STFL 框架在不同主干网络(包括 C3D 和 3D ResNet18)上,均在不同批量大小和权衡参数下表现出一致的性能提升。
- 由于每一样本由10名独立标注员进行标注,DFEW 数据集实现了高标注可靠性,形成了稳健且分布均衡的表情标签集合。
- 敏感性分析表明,EC-STFL 在广泛的批量大小和最优权衡参数范围内均表现出稳定性,表明其具备强大的泛化能力和鲁棒性。
- DFEW 数据集包含来自1,500部多样化电影的16,372段剪辑,是目前公开可用的最大规模野外动态面部表情数据库,为 FER 研究提供了丰富的现实世界多样性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。