Skip to main content
QUICK REVIEW

[论文解读] Frankenstein: Learning Deep Face Representations using Small Data

Guosheng Hu, Xiaojiang Peng|arXiv (Cornell University)|Mar 21, 2016
Face recognition and analysis参考文献 57被引用 8
一句话总结

本文提出 Frankenstein 方法,一种数据合成技术,通过将真实人脸图像中的面部组件(眼睛、鼻子、嘴巴)进行组合,生成大规模用于深度人脸识别的合成训练数据。仅使用 10,000 张真实图像并结合合成人脸数据进行增强训练,该方法在 CASIA NIR-VIS2.0 数据集上实现了与使用 500,000 张图像训练的模型相当的性能,准确率达到 85.05%,在该数据集上达到新的 SOTA 水平,采用 LDA 度量学习方法。

ABSTRACT

Deep convolutional neural networks have recently proven extremely effective for difficult face recognition problems in uncontrolled settings. To train such networks, very large training sets are needed with millions of labeled images. For some applications, such as near-infrared (NIR) face recognition, such large training datasets are not publicly available and difficult to collect. In this work, we propose a method to generate very large training datasets of synthetic images by compositing real face images in a given dataset. We show that this method enables to learn models from as few as 10,000 training images, which perform on par with models trained from 500,000 images. Using our approach we also obtain state-of-the-art results on the CASIA NIR-VIS2.0 heterogeneous face recognition dataset.

研究动机与目标

  • 为解决在缺乏大规模标注数据集的场景下(尤其是近红外成像领域)训练深度卷积神经网络进行人脸识别的挑战。
  • 克服小样本训练设置下因数据稀缺导致的模型过拟合问题。
  • 开发一种数据增强技术,能够生成多样化且逼真的人脸图像,同时保持身份一致性和语义连贯性。
  • 通过利用通过面部组件组合生成的合成数据,实现仅使用极少真实数据即可获得高性能的人脸识别。
  • 在异构人脸识别基准(如 CASIA NIR-VIS2.0)上实现最先进的性能,而无需依赖海量真实训练数据。

提出的方法

  • 该方法通过自动检测并从两张真实人脸图像中提取面部组件(眼睛、鼻子、嘴巴)来生成合成人脸图像。
  • 利用固定的几何配置将来自不同个体的面部组件组合成一张新的、结构一致的人脸图像,以保证解剖学上的合理性。
  • 合成数据生成过程完全自动化,无需使用 3D 人脸模型或人工标注。
  • 该方法结合使用 LSSF(局部自适应特征)归一化与数据融合技术,以减小可见光与近红外图像之间的域偏移。
  • 将合成图像用于训练深度卷积神经网络,并在 LFW 和 CASIA NIR-VIS2.0 数据集上评估性能。
  • 采用 LDA 度量学习进一步提升在合成数据与真实数据上的识别准确率。

实验结果

研究问题

  • RQ1通过从真实图像中组合面部组件生成的合成数据,是否能有效训练深度卷积神经网络进行人脸识别,且仅使用极少的真实训练数据?
  • RQ2在泛化能力和准确率方面,使用合成数据训练的卷积神经网络与使用大规模真实数据集训练的模型相比表现如何?
  • RQ3在异构人脸识别中,合成数据在多大程度上能够缩小可见光与近红外人脸图像之间的域差距?
  • RQ4将原始数据与合成数据进行特征融合,是否能提升识别性能,使其优于单独使用任一数据源?
  • RQ5所提出的方法是否能在不依赖海量真实训练数据的前提下,实现在 CASIA NIR-VIS2.0 等基准数据集上的最先进性能?

主要发现

  • 仅使用 10,000 张真实图像并结合合成人脸数据进行增强训练的卷积神经网络,在 CASIA NIR-VIS2.0 数据集上实现了 68.97% 的人脸识别准确率,与在 500,000 张图像上训练的模型性能相当。
  • 采用 LSSF 归一化后,可见光与近红外图像之间的域差距显著减小,使在未见近红外图像上的泛化准确率从 38.45% 提升至 66.37%。
  • 将原始 LFW 数据与合成数据的特征进行融合,使识别准确率从 66.37% 提升至 68.97%,证明了数据多样性带来的有效性。
  • 在采用 LDA 度量学习后,该方法在 CASIA NIR-VIS2.0 数据集上达到 85.05% 的准确率,比之前最先进方法高出 3.2 个百分点。
  • 在未使用度量学习的情况下,该方法相比手工设计的描述符方法(C-CBFD)高出 23.35 个百分点(79.96% vs. 56.6%)。
  • 与使用 Gabor 特征和 RBM 的最佳报告方法(86.2%)相比,该方法性能具有竞争力,且基于前馈卷积神经网络的推理流程更快。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。