[论文解读] M2FPA: A Multi-Yaw Multi-Pitch High-Quality Database and Benchmark for Facial Pose Analysis
本文提出了M2FPA,一个大规模、高质量的多偏航角与多俯仰角人脸数据库,包含229名受试者在62种姿态下的397,544张图像,涵盖不同的光照条件、配饰和属性。该研究在生成对抗网络(GAN)框架中提出了一种基于解析引导的判别器,以提升人脸正向化性能,在M2FPA和Multi-PIE数据集上均实现了姿态不变人脸识别与生成的最先进性能,极端姿态变化下Rank-1准确率最高达99.96%。
Facial images in surveillance or mobile scenarios often have large view-point variations in terms of pitch and yaw angles. These jointly occurred angle variations make face recognition challenging. Current public face databases mainly consider the case of yaw variations. In this paper, a new large-scale Multi-yaw Multi-pitch high-quality database is proposed for Facial Pose Analysis (M2FPA), including face frontalization, face rotation, facial pose estimation and pose-invariant face recognition. It contains 397,544 images of 229 subjects with yaw, pitch, attribute, illumination and accessory. M2FPA is the most comprehensive multi-view face database for facial pose analysis. Further, we provide an effective benchmark for face frontalization and pose-invariant face recognition on M2FPA with several state-of-the-art methods, including DR-GAN, TP-GAN and CAPG-GAN. We believe that the new database and benchmark can significantly push forward the advance of facial pose analysis in real-world applications. Moreover, a simple yet effective parsing guided discriminator is introduced to capture the local consistency during GAN optimization. Extensive quantitative and qualitative results on M2FPA and Multi-PIE demonstrate the superiority of our face frontalization method. Baseline results for both face synthesis and face recognition from state-of-theart methods demonstrate the challenge offered by this new database.
研究动机与目标
- 为解决真实世界人脸姿态分析中缺乏全面且高质量的数据库,涵盖偏航角与俯仰角变化的问题。
- 为在极端视角变化下评估人脸正向化与姿态不变人脸识别提供基准。
- 开发一种鲁棒的深度学习方法,在大偏航角与俯仰角下合成人脸时仍能保持身份信息。
- 通过新型解析引导判别器,提升生成正脸图像的局部面部一致性。
- 在监控与移动应用中实现更真实、更准确的人脸合成与识别。
提出的方法
- 使用受控采集系统收集M2FPA数据库,捕捉13个偏航角(-90°至+90°)与5个俯仰角(-30°至+45°)共62种姿态,图像分辨率为高分辨率(1920×1080)。
- 数据库包含4种属性、7种光照条件以及5种类型的遮挡眼镜,以增强多样性与真实感。
- 引入基于解析引导的判别器,在GAN训练过程中利用语义分割图强制实现局部面部一致性。
- 采用条件生成对抗网络(Conditional GAN)框架,由生成器将侧脸或极端姿态输入合成正脸图像。
- 使用预训练模型(LightCNN-29v2与IR-50)评估人脸识别性能,基于特征嵌入的距离度量进行评估。
- 在M2FPA与Multi-PIE上进行基准评估,对比当前最先进方法,包括DR-GAN、TP-GAN与CAPG-GAN。
实验结果
研究问题
- RQ1在极端偏航角与俯仰角变化下,人脸正向化方法的性能如何变化?
- RQ2解析引导判别器在多大程度上能提升生成正脸图像的局部面部一致性和真实感?
- RQ3所提方法在大视角变化下与SOTA方法相比,在姿态不变人脸识别方面表现如何?
- RQ4姿态、光照与配饰的多样化变化对人脸识别系统鲁棒性有何影响?
- RQ5像M2FPA这样大规模、多视角的人脸数据库能否作为未来姿态不变人脸分析研究的可靠基准?
主要发现
- 在Multi-PIE数据集上,该方法在±90°姿态变化下实现了99.96%的Rank-1识别准确率,优于所有对比方法。
- 在M2FPA数据集中,该方法在+30°与-30°俯仰角下分别达到98.6%与97.2%的Rank-1准确率,超越DR-GAN、TP-GAN与CAPG-GAN。
- 解析引导判别器显著提升了局部面部结构的一致性,使生成的正脸图像更具照片级真实感,优于基线GAN模型。
- DR-GAN在M2FPA上表现欠佳,归因于其无监督训练方式,以及该数据集姿态变化的高度多样性。
- M2FPA数据库在现有数据库中提供了最全面的偏航角、俯仰角、光照、配饰与属性覆盖。
- 基准评估结果表明,M2FPA构成显著挑战,极端姿态下识别准确率显著下降,凸显了对鲁棒姿态不变方法的迫切需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。