Skip to main content
QUICK REVIEW

[论文解读] Improving Heterogeneous Face Recognition with Conditional Adversarial Networks

Wuming Zhang, Zhixin Shu|arXiv (Cornell University)|Sep 8, 2017
Face recognition and analysis参考文献 23被引用 12
一句话总结

本文提出一种基于条件生成对抗网络(cGAN)的方法,用于异构人脸识别(HFR),通过单张2D彩色图像重建2.5D深度图像,实现精确的跨模态匹配。通过分别训练2D和2.5D特征提取的卷积神经网络(CNN),并融合多模态匹配得分,该框架在FRGC 2D/3D基准上实现了最先进(SOTA)的识别准确率,且推理速度达到实时(每张图像1.6 ms)。

ABSTRACT

Heterogeneous face recognition between color image and depth image is a much desired capacity for real world applications where shape information is looked upon as merely involved in gallery. In this paper, we propose a cross-modal deep learning method as an effective and efficient workaround for this challenge. Specifically, we begin with learning two convolutional neural networks (CNNs) to extract 2D and 2.5D face features individually. Once trained, they can serve as pre-trained models for another two-way CNN which explores the correlated part between color and depth for heterogeneous matching. Compared with most conventional cross-modal approaches, our method additionally conducts accurate depth image reconstruction from single color image with Conditional Generative Adversarial Nets (cGAN), and further enhances the recognition performance by fusing multi-modal matching results. Through both qualitative and quantitative experiments on benchmark FRGC 2D/3D face database, we demonstrate that the proposed pipeline outperforms state-of-the-art performance on heterogeneous face recognition and ensures a drastically efficient on-line stage.

研究动机与目标

  • 解决异构人脸识别(HFR)中的挑战:探针图像为2D彩色图像,而图库中包含3D深度数据。
  • 通过利用3D形状信息,克服光照和姿态变化下2D人脸识别的局限性。
  • 开发一个端到端框架,利用条件生成对抗网络(cGAN)从单张2D彩色图像重建逼真的2.5D深度图像。
  • 通过避免在线推理时获取3D数据,实现实时、高效的HFR,同时保持高识别准确率。
  • 融合2D与2.5D匹配得分,提升识别性能,超越现有跨模态方法。

提出的方法

  • 为2D(彩色)和2.5D(深度)人脸特征提取分别训练两个独立的深度卷积神经网络(CNN),作为预训练模型。
  • 采用带跳跃连接和自编码器结构的条件生成对抗网络(cGAN),从2D彩色图像重建2.5D深度图像。
  • 使用联合损失函数,结合Softmax分类损失与相关性损失,对齐跨模态的特征。
  • 应用双路CNN,学习2D与2.5D特征之间的跨模态相关性,用于匹配任务。
  • 融合多模态匹配得分(2D与2.5D),以提升识别性能。
  • 推理时仅使用2D探针图像和重建的2.5D深度图像,避免测试阶段实际获取3D数据。

实验结果

研究问题

  • RQ1条件生成对抗网络(cGAN)能否有效从单张2D彩色人脸图像重建出适用于HFR的逼真2.5D深度图像?
  • RQ22D与2.5D匹配得分的融合如何提升识别准确率,相较于单模态或传统跨模态方法?
  • RQ3在联合训练目标中,Softmax损失与相关性损失的最优平衡比例如何,以实现鲁棒的跨模态特征学习?
  • RQ4尽管存在深度重建与多模态匹配的复杂性,该方法能否实现实时性能?
  • RQ5在训练数据有限的极端面部条件下(如胡须、阴影),该方法的泛化能力如何?

主要发现

  • 在Huang等人(2012)的协议下,该方法在FRGC数据集上实现了0.9792的Rank-1识别准确率,优于现有最先进方法。
  • 在Wang等人(2014)的协议下,该方法达到0.9745的Rank-1准确率,超过此前最佳结果0.9600。
  • 在单张NVIDIA GTX TITAN X GPU上,模型每张图像的深度图像重建耗时仅1.6 ms,支持实时推理。
  • 消融实验表明,当相关性损失权重λ = 0.6时性能最优,当λ > 0.8时准确率显著下降。
  • 即使不使用相关性损失(λ = 0),模型仍保持92.45%的准确率,表明网络仅通过Softmax损失也能学习到有用特征。
  • 该方法是首个无需依赖3D原型模型即可实现2.5D深度重建的工作,提升了泛化能力,并降低了对先验3D人脸数据库的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。