Skip to main content
QUICK REVIEW

[论文解读] FERV39k: A Large-Scale Multi-Scene Dataset for Facial Expression Recognition in Videos

Yan Wang, Yixuan Sun|arXiv (Cornell University)|Mar 17, 2022
Emotion and Mood Recognition被引用 5
一句话总结

FERV39k 是一个大规模、多场景的视频数据集,包含 38,935 个视频片段,覆盖 22 种场景,分布在 4 种情境下——日常生活、弱交互类节目、强交互类活动和异常事件——并标注了 7 种基本面部表情。该数据集可为基于视频的面部表情识别深度学习模型提供稳健的基准测试,采用 Two VGG13-LSTM 框架在完整数据集上实现了 44.54% 的准确率,达到当前最先进水平,同时揭示了不同场景间显著的性能差距,凸显了开发场景感知型 FER 模型的必要性。

ABSTRACT

Current benchmarks for facial expression recognition (FER) mainly focus on static images, while there are limited datasets for FER in videos. It is still ambiguous to evaluate whether performances of existing methods remain satisfactory in real-world application-oriented scenes. For example, the "Happy" expression with high intensity in Talk-Show is more discriminating than the same expression with low intensity in Official-Event. To fill this gap, we build a large-scale multi-scene dataset, coined as FERV39k. We analyze the important ingredients of constructing such a novel dataset in three aspects: (1) multi-scene hierarchy and expression class, (2) generation of candidate video clips, (3) trusted manual labelling process. Based on these guidelines, we select 4 scenarios subdivided into 22 scenes, annotate 86k samples automatically obtained from 4k videos based on the well-designed workflow, and finally build 38,935 video clips labeled with 7 classic expressions. Experiment benchmarks on four kinds of baseline frameworks were also provided and further analysis on their performance across different scenes and some challenges for future research were given. Besides, we systematically investigate key components of DFER by ablation studies. The baseline framework and our project will be available.

研究动机与目标

  • 为解决真实世界非受限环境中面部表情识别(FER)缺乏大规模、多场景、高质量视频数据集的问题。
  • 克服现有数据集在场景同质性、规模不足以及缺乏场景级别差异方面的局限性。
  • 开发一种系统化、可扩展的工作流程,用于生成候选视频片段,并通过众包和专业标注确保高质量的人工标注。
  • 建立一个用于评估不同真实世界场景下 FER 模型性能的基准,揭示不同场景上下文中的性能差异与挑战。

提出的方法

  • 通过四阶段策略构建数据集:(1) 基于场景多样性与上下文独特性,定义 4 种情境和 22 种细粒度场景;(2) 使用精心设计的视频片段生成流水线,从 4,000 个原始视频中自动生成 86,000 个候选视频片段。
  • 采用混合标注流程:先通过众包进行快速标注,再通过专业标注并实施严格质量控制,以确保高精度、细粒度的表情标签。
  • 最终数据集包含 38,935 个视频片段,涵盖 7 种经典表情(如开心、悲伤、愤怒),持续时间从 0.5 秒到 4 秒不等,包含 100 万张面部帧(分辨率 336×504)和 100 万张裁剪人脸(分辨率 224×224)。
  • 在完整数据集上训练并评估基线模型(包括 I3D、3D-R18、VGG13-LSTM 和 ResNet-LSTM),以评估其在所有场景和子场景中的泛化能力与场景特定性能。
  • 通过消融研究分析端到端视频表情识别的关键组件,包括时间建模和特征提取策略。
  • 使用整体准确率和场景级指标评估性能,并通过混淆矩阵可视化分析不同场景类型下的错误模式。

实验结果

研究问题

  • RQ1尽管表情强度相同,模型在不同真实世界视频场景(如脱口秀与正式活动)中的表现为何存在差异?
  • RQ2现有深度学习架构在面部表情识别中,对多样化、非受限视频场景的泛化能力如何?
  • RQ3场景特定上下文对表情识别模型的可靠性与一致性有何影响?
  • RQ4所提出的四阶段流水线在生成高质量、大规模视频片段候选样本用于标注方面的有效性如何?
  • RQ5在端到端基于视频的面部表情识别中,哪些关键组件显著影响性能?

主要发现

  • Two VGG13-LSTM 模型在完整 FERV39k 数据集上达到最高整体准确率 44.54%,优于 I3D 和 3D-R18 等其他架构。
  • 不同场景间性能差异显著:模型在 'Business' 场景中准确率达 63.72%,但在 'AI9k' 场景中仅 31.68%,表明存在强烈的领域偏移和场景特异性挑战。
  • 在所有场景上训练的模型在子场景如 'Interview' 和 'Crime' 上泛化能力差,准确率分别降至 33.73% 和 27.33%,凸显了场景感知适应的必要性。
  • 混淆矩阵显示,在低强度或模糊语境下,'Happy' 和 'Sad' 表情常被误分类,尤其在 'Live Show' 和 'Talk-Show' 场景中更为明显。
  • 消融研究证实,通过 LSTM 层进行时间建模可显著提升性能,Two VGG13-LSTM 达到 44.54% 的准确率,而 VGG16-LSTM 仅为 41.70%,表明序列建模的重要性。
  • 该数据集表明,场景上下文是关键因素:在多样化场景上训练的模型整体表现更优,但在未见或重叠度低的场景上测试时性能急剧下降,强调了开发场景感知型 FER 系统的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。