[论文解读] DigiFace-1M: 1 Million Digital Face Images for Face Recognition
本文提出 DigiFace-1M,一个包含 122 万张逼真数字人脸图像的大规模合成人脸数据集,通过计算机图形学流程生成,可在不侵犯隐私或引入标签噪声的情况下训练人脸识别模型。通过完全控制姿态、配饰和光照等属性,作者在 LFW 上实现了 96.17% 的准确率,相较于基于 GAN 的合成数据方法在错误率降低方面提升了 52.5%,且在仅使用 12 万张真实图像进行微调后,性能可与在数百万张真实图像上训练的模型相媲美。
State-of-the-art face recognition models show impressive accuracy, achieving over 99.8% on Labeled Faces in the Wild (LFW) dataset. Such models are trained on large-scale datasets that contain millions of real human face images collected from the internet. Web-crawled face images are severely biased (in terms of race, lighting, make-up, etc) and often contain label noise. More importantly, the face images are collected without explicit consent, raising ethical concerns. To avoid such problems, we introduce a large-scale synthetic dataset for face recognition, obtained by rendering digital faces using a computer graphics pipeline. We first demonstrate that aggressive data augmentation can significantly reduce the synthetic-to-real domain gap. Having full control over the rendering pipeline, we also study how each attribute (e.g., variation in facial pose, accessories and textures) affects the accuracy. Compared to SynFace, a recent method trained on GAN-generated synthetic faces, we reduce the error rate on LFW by 52.5% (accuracy from 91.93% to 96.17%). By fine-tuning the network on a smaller number of real face images that could reasonably be obtained with consent, we achieve accuracy that is comparable to the methods trained on millions of real face images.
研究动机与目标
- 为解决人脸识别数据集中因未经同意收集网络爬取数据而引发的伦理问题。
- 减少真实世界网络爬取人脸数据集中固有的数据偏差和标签噪声。
- 开发一个可扩展的合成人脸数据集,以支持训练鲁棒的人脸识别模型。
- 评估通过图形渲染生成的合成人脸在人脸识别性能上是否优于 GAN 生成的合成人脸。
- 证明在少量真实数据上进行微调即可实现与在大规模真实数据集上训练的模型相当的性能。
提出的方法
- 作者利用从 511 份获得同意的人脸扫描数据构建的参数化人脸几何与纹理模型,生成多样化的人脸身份。
- 每个身份在面部几何、纹理、发型、颜色、厚度和密度等方面通过程序化方式实现变化。
- 合成图像在姿态、表情、配饰(眼镜、化妆、头饰)、光照、相机角度和环境方面实现受控变化。
- 通过图形渲染管线生成数据集,确保三维一致性,并在属性变化过程中避免身份漂移。
- 应用激进的数据增强策略,以缩小合成数据与真实数据之间的域差距。
- 采用两阶段训练策略:先在合成数据上进行预训练,再在少量真实人脸图像子集上进行微调。
实验结果
研究问题
- RQ1通过图形渲染流程生成的大规模合成人脸数据集是否能在不依赖真实世界网络爬取数据的情况下实现最先进的人脸识别准确率?
- RQ2在图形渲染合成人脸上训练的模型性能与在 GAN 生成的合成人脸或真实世界数据集上训练的模型相比如何?
- RQ3在少量真实人脸图像上进行微调,能在多大程度上弥合合成数据与真实数据训练之间的性能差距?
- RQ4姿态、配饰和光照的受控变化对模型鲁棒性和准确率有何影响?
- RQ5该合成数据集能否缓解现有真实世界人脸识别数据集中存在的数据偏差和标签噪声问题?
主要发现
- 仅在合成数据上训练的 DigiFace-1M 数据集在 LFW 基准测试中达到 96.17% 的准确率,显著优于基于 GAN 的合成方法 SynFace 在同一基准上仅实现的 91.93% 准确率。
- 在仅使用 12 万张真实人脸图像(MS1MV2 的 2%)进行微调后,模型在 LFW、CFP-FP 和 CPLFW 上的平均准确率超过 SV-AM-Softmax,且与在数百万张真实图像上训练的模型性能相当。
- 与使用 SynFace 相比,使用 DigiFace-1M 可将 LFW 上的错误率降低 52.5%,证明图形渲染生成的合成人脸在人脸识别性能上优于 GAN 生成的合成人脸。
- 在 DigiFace-1M 上训练的模型在 AgeDB 和 CALFW 上表现出显著的性能差距,表明当前合成数据尚未建模年龄变化,这仍是主要的域差距。
- 结果表明,通过激进的数据增强和受控的属性变化,可有效缩小合成数据与真实数据之间的域差距,从而在极少真实数据的情况下实现高性能。
- 该数据集在伦理上是可靠的,因为它仅依赖于 511 份获得同意的扫描数据进行模型初始化,避免了网络爬取数据带来的隐私侵犯和伦理问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。