[论文解读] Facial Expression Recognition Using Human to Animated-Character Expression Translation
本文提出 HA-GAN,一种条件生成对抗网络(GAN),可将人类面部表情转换为固定动画角色形象,减少个体间差异并生成纯粹、风格化的表情。通过在 FERGDB 数据集上进行训练,该模型在静态图像上的 FER 准确率得到提升,在不使用时序数据的情况下实现了最先进性能。
Facial expression recognition is a challenging task due to two major problems: the presence of inter-subject variations in facial expression recognition dataset and impure expressions posed by human subjects. In this paper we present a novel Human-to-Animation conditional Generative Adversarial Network (HA-GAN) to overcome these two problems by using many (human faces) to one (animated face) mapping. Specifically, for any given input human expression image, our HA-GAN transfers the expression information from the input image to a fixed animated identity. Stylized animated characters from the Facial Expression Research Group-Database (FERGDB) are used for the generation of fixed identity. By learning this many-to-one identity mapping function using our proposed HA-GAN, the effect of inter-subject variations can be reduced in Facial Expression Recognition(FER). We also argue that the expressions in the generated animated images are pure expressions and since FER is performed on these generated images, the performance of facial expression recognition is improved. Our initial experimental results on the state-of-the-art datasets show that facial expression recognition carried out on the generated animated images using our HA-GAN framework outperforms the baseline deep neural network and produces comparable or even better results than the state-of-the-art methods for facial expression recognition.
研究动机与目标
- 解决面部表情识别(FER)数据集中存在的个体间差异问题,该问题会降低模型在未见个体上的泛化能力。
- 缓解姿态数据集中表情不纯且不一致的问题,该问题阻碍了 FER 的准确识别。
- 通过生成具有纯粹、专家设计表情的逼真动画图像用于训练,提升 FER 性能。
- 通过将多样化的人脸映射到单一动画身份,实现与身份无关的 FER。
- 提供一种数据增强框架,提升 FER 性能,而无需依赖 3D 骨骼数据或视频序列。
提出的方法
- 训练一种条件 GAN 框架 HA-GAN,学习从多样化的人脸表情图像到固定动画角色身份的多对一映射。
- 生成器网络利用 FERGDB 数据集,将输入的人脸图像中的表情细节迁移至预设的动画面部,该数据集包含精心制作的、纯表情动画。
- 判别器经过训练,能够区分真实动画图像与生成图像,以确保图像的逼真度和表情保真度。
- 通过对抗损失和感知损失端到端训练模型,以保留面部结构和表情细节。
- 在生成的动画图像上执行 FER,这些图像被用作微调深度卷积神经网络分类器的训练数据。
- 采用与身份无关的交叉验证划分方式,评估模型在未见个体上的泛化能力。
实验结果
研究问题
- RQ1从人类面部到固定动画身份的多对一映射能否减轻 FER 中个体间差异的影响?
- RQ2与真实人类图像相比,通过动画生成纯正、艺术家设计的面部表情是否能提升 FER 准确率?
- RQ3基于 GAN 的图像翻译框架能否生成逼真的动画表情,同时保留来自人类输入的表情语义?
- RQ4在静态图像基准测试中,FER 在生成动画图像上的表现与最先进方法相比如何?
- RQ5该方法能否在不使用视频序列或时序信息的情况下实现高准确率?
主要发现
- 在 CK+ 数据集上,HA-GAN 在六类表情分类任务中达到 96.14% 的准确率,优于 CNN 基线模型(92.45%),并匹配或超越最先进方法。
- 在 MMI 数据集上,HA-GAN 达到 71.87% 的准确率,显著高于基线 CNN(58.46%),并与先进静态方法 DeRL(73.23%)相当。
- 在 Oulu-CASIA 数据集上,HA-GAN 达到 88.26% 的准确率,超过基线 CNN(73.14%),并优于未使用时序信息的动态方法(如 LBP-TOP 和 HOG 3D)。
- 结果表明,基于生成动画图像的 FER 准确率高于真实人类图像,支持了‘纯表情有助于提升识别性能’的假设。
- 该方法在不依赖视频数据或复杂时序建模的情况下,实现了静态图像基准测试的最先进性能。
- HA-GAN 的成功表明,合成的、风格化的表情可作为 FER 的有效数据增强手段,尤其在低数据量或身份差异较大的场景中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。