[论文解读] Physically-Based Face Rendering for NIR-VIS Face Recognition
本文提出了一种基于物理的新型方法,利用3D人脸重建和一种新颖的像素级VIS-to-NIR反射率转换,生成高质量、身份一致的配对NIR-VIS人脸图像。通过利用大规模逼真数据集并引入ID-MMD损失以减小模态差异并突出身份特征,该方法在四个NIR-VIS基准测试中实现了最先进性能,即使在未使用现有NIR-VIS数据集的情况下也优于先前方法,并且在微调后进一步提升性能。
Near infrared (NIR) to Visible (VIS) face matching is challenging due to the significant domain gaps as well as a lack of sufficient data for cross-modality model training. To overcome this problem, we propose a novel method for paired NIR-VIS facial image generation. Specifically, we reconstruct 3D face shape and reflectance from a large 2D facial dataset and introduce a novel method of transforming the VIS reflectance to NIR reflectance. We then use a physically-based renderer to generate a vast, high-resolution and photorealistic dataset consisting of various poses and identities in the NIR and VIS spectra. Moreover, to facilitate the identity feature learning, we propose an IDentity-based Maximum Mean Discrepancy (ID-MMD) loss, which not only reduces the modality gap between NIR and VIS images at the domain level but encourages the network to focus on the identity features instead of facial details, such as poses and accessories. Extensive experiments conducted on four challenging NIR-VIS face recognition benchmarks demonstrate that the proposed method can achieve comparable performance with the state-of-the-art (SOTA) methods without requiring any existing NIR-VIS face recognition datasets. With slightly fine-tuning on the target NIR-VIS face recognition datasets, our method can significantly surpass the SOTA performance. Code and pretrained models are released under the insightface (https://github.com/deepinsight/insightface/tree/master/recognition).
研究动机与目标
- 解决用于训练鲁棒跨模态人脸识别模型的配对NIR-VIS人脸数据有限的挑战。
- 克服NIR与VIS光谱之间的域差距,该差距会阻碍模型的泛化能力和性能。
- 在合成数据生成过程中,保持不同姿态、表情和光照条件下的人脸身份一致性。
- 开发一种模态不变的特征学习机制,强调身份特征而非姿态或配饰等虚假变化。
- 在不依赖现有配对NIR-VIS数据集的情况下,在多个NIR-VIS人脸识别基准测试中实现最先进性能。
提出的方法
- 使用最先进的反射率获取方法,从大规模2D人脸图像数据集中重建3D人脸形状和反射率图。
- 应用一种新颖的像素级VIS-to-NIR反射率转换,将可见光谱反射率转换为近红外反射率,同时保持身份特征。
- 使用基于物理的渲染器,在受控光照、姿态和表情条件下生成高分辨率、逼真的配对NIR-VIS图像。
- 使用大规模VIS人脸识别数据集与合成的NIR-VIS配对数据联合训练人脸识别网络。
- 引入一种基于身份的最大均值差异(ID-MMD)损失,以最小化NIR与VIS特征之间的域级分布差异,同时促进以身份为中心的特征学习。
- 在目标NIR-VIS数据集上使用身份损失和ID-MMD损失对模型进行微调,以进一步提升性能。
实验结果
研究问题
- RQ1基于物理的3D人脸渲染结合新颖的VIS-to-NIR反射率转换,能否生成高质量、身份一致的配对NIR-VIS人脸图像?
- RQ2此类合成数据集能否在无需真实配对NIR-VIS数据的情况下,有效训练NIR-VIS人脸识别模型?
- RQ3所提出的ID-MMD损失是否能有效减小NIR与VIS特征之间的模态差距,同时聚焦于身份相关模式的学习?
- RQ4所提出方法在标准NIR-VIS人脸识别基准测试中的性能与最先进方法相比如何?
- RQ5在真实目标数据集上进行微调,能在多大程度上进一步提升模型的泛化能力和准确性?
主要发现
- 所提方法在CASIA NIR-VIS 2.0和Oulu-CASIA NIR-VIS数据集上实现了与最先进方法相当的性能,且未使用任何现有NIR-VIS数据集。
- 在具有挑战性的LAMP-HQ数据集上,该方法在FAR=0.1%时的验证率(VR)达到99.0%,比之前最先进方法高出19.8%。
- 在LC-29数据集上微调后,该方法在FAR=0.01%时达到99.9%的验证率,较仅使用身份损失的基线模型提升了6.6%。
- 在低样本量数据集如Oulu-CASIA和BUAA-VisNir上,该方法在FAR=0.1%时的验证率分别比DVG-Face高出1.8%和0.8%。
- 特征相似度分布显示,经过ID-MMD损失训练后,正样本对(同一身份)的相似度显著更高,而负样本对的相似度更低。
- 定性对比显示,该方法在生成图像对中保持了完美的身份一致性,而DVG-Face在生成过程中存在身份漂移问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。