[论文解读] FEAFA: A Well-Annotated Dataset for Facial Expression Analysis and 3D Facial Animation
FEAFA 是一个新颖的、高度细致的面部表情数据集,包含来自 122 名参与者的 99,356 幅人工标注的视频帧,这些帧均在真实世界条件下录制。该数据集为 9 个对称性 AUs 和 10 个单侧 AUs 提供了连续的浮点强度标注(0–1),以及 4 个描述符,支持通过深度卷积神经网络(CNN)进行精确的 AU 值回归,并可通过从 2D 视频预测驱动混合形状模型,实现无需 3D 重建的 3D 面部动画。
Facial expression analysis based on machine learning requires large number of well-annotated data to reflect different changes in facial motion. Publicly available datasets truly help to accelerate research in this area by providing a benchmark resource, but all of these datasets, to the best of our knowledge, are limited to rough annotations for action units, including only their absence, presence, or a five-level intensity according to the Facial Action Coding System. To meet the need for videos labeled in great detail, we present a well-annotated dataset named FEAFA for Facial Expression Analysis and 3D Facial Animation. One hundred and twenty-two participants, including children, young adults and elderly people, were recorded in real-world conditions. In addition, 99,356 frames were manually labeled using Expression Quantitative Tool developed by us to quantify 9 symmetrical FACS action units, 10 asymmetrical (unilateral) FACS action units, 2 symmetrical FACS action descriptors and 2 asymmetrical FACS action descriptors, and each action unit or action descriptor is well-annotated with a floating point number between 0 and 1. To provide a baseline for use in future research, a benchmark for the regression of action unit values based on Convolutional Neural Networks are presented. We also demonstrate the potential of our FEAFA dataset for 3D facial animation. Almost all state-of-the-art algorithms for facial animation are achieved based on 3D face reconstruction. We hence propose a novel method that drives virtual characters only based on action unit value regression of the 2D video frames of source actors.
研究动机与目标
- 为解决现有数据集中缺乏细粒度、连续的面部表情标注的问题,这些数据集通常仅限于二值或五级强度划分。
- 实现对连续面部动作单元(AU)强度的精确回归,以提升面部表情分析与动画的质量。
- 为在真实世界、多样化人口统计数据上使用深度学习进行联合 AU 值回归提供基准。
- 展示一种新型的 3D 面部动画流程,通过直接从 2D 视频帧回归 AU 值来绕过 3D 形状重建。
- 通过公开、高质量标注的数据集,支持未来在面部表情识别、图像操作和动画方面的研究。
提出的方法
- FEAFA 数据集通过在不同年龄群体和真实世界条件下录制 123 段网络摄像头视频,共包含 122 名参与者构建而成。
- 每帧均使用自定义的表达量化工具进行人工标注,为 9 个对称性 AUs、10 个单侧 AUs、2 个对称性 ADs 和 2 个单侧 ADs 分配浮点强度值(0 至 1)。
- 开发了一个基于卷积神经网络(CNN)的基线深度学习系统,用于从 2D 视频帧中联合回归所有 AU 强度。
- 3D 面部动画流程利用预测的 AU 值驱动混合形状模型,其中虚拟角色的面部被重建为中性形状与特定表情形状的线性组合。
- 该方法利用动态 AU 依赖关系和共现模式,以提升动画的真实感与时间一致性。
- 系统采用 AlexNet 的特征实现,无需 3D 重建,在标准硬件上即可实现超过 18 fps 的实时性能。
实验结果
研究问题
- RQ1与离散的五级强度划分相比,连续的高分辨率 AU 强度标注(0–1)是否能提升面部表情分析的准确性?
- RQ2仅依靠 2D 视频帧,能否在不进行显式 3D 形状重建的情况下实现逼真的 3D 面部动画?
- RQ3在具有细粒度标注的真实世界多样化数据集上,使用深度 CNN 进行联合 AU 值回归的效果如何?
- RQ4通过建模 AU 间的关系与动态依赖性,所提出的方法能否生成更具自然感与真实感的面部动画?
- RQ5FEAFA 数据集相较于现有基准,在支持 AU 检测与强度估计任务方面表现如何?
主要发现
- FEAFA 数据集包含来自 123 段视频的 99,356 帧,涵盖 122 名参与者,对 25 个面部运动组件(9 个对称性 AUs、10 个单侧 AUs、2 个对称性 ADs、2 个单侧 ADs)提供了连续的 AU 强度标注。
- 所提出的基于 CNN 的基线系统能够从 2D 视频帧中稳健地联合回归 AU 强度,实现精确且连续的表情表征。
- 3D 面部动画流程成功仅通过 2D 视频输入和 AU 值回归生成了逼真的角色动画,无需耗时的 3D 重建步骤。
- 该动画系统在标准消费级硬件上运行速度超过 18 fps,证明了其在实际应用中的实时可行性。
- 连续的 AU 强度标注相比离散的五级划分能实现更精确的 AU 检测与强度估计,AU 值通过预定义区间映射至 FACS 强度等级 A–E。
- 该数据集支持广泛的应用前景,包括面部表情识别、图像操作以及改进的人机交互。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。