[论文解读] Deep 3D Face Identification
本文提出一种基于迁移学习和3D数据增强的深度3D人脸识别方法,以应对大规模3D人脸数据集稀缺的问题。通过在经形态可变模型和正交投影生成的增强3D扫描上微调预训练的VGG-Face卷积神经网络,该方法在Bosphorus、BU-3DFE和3D-TEC数据集上实现了最先进(SOTA)的识别准确率,并具备高效、可扩展的匹配能力。
We propose a novel 3D face recognition algorithm using a deep convolutional neural network (DCNN) and a 3D augmentation technique. The performance of 2D face recognition algorithms has significantly increased by leveraging the representational power of deep neural networks and the use of large-scale labeled training data. As opposed to 2D face recognition, training discriminative deep features for 3D face recognition is very difficult due to the lack of large-scale 3D face datasets. In this paper, we show that transfer learning from a CNN trained on 2D face images can effectively work for 3D face recognition by fine-tuning the CNN with a relatively small number of 3D facial scans. We also propose a 3D face augmentation technique which synthesizes a number of different facial expressions from a single 3D face scan. Our proposed method shows excellent recognition results on Bosphorus, BU-3DFE, and 3D-TEC datasets, without using hand-crafted features. The 3D identification using our deep features also scales well for large databases.
研究动机与目标
- 解决深度神经网络训练中大规模3D人脸数据集稀缺的挑战。
- 克服因数据稀缺导致难以学习具有判别性的3D人脸识别深度特征的问题。
- 通过利用深度特征,实现在大规模图库集合中高效且可扩展的3D人脸识别。
- 在最小化表情变化引起的类内差异的同时,最大化类间差异。
- 开发一种数据增强技术,从单个3D扫描中合成多样化的面部表情。
提出的方法
- 利用迁移学习,在少量3D人脸扫描上微调预训练的VGG-Face卷积神经网络。
- 通过应用多线性形态可变模型(形状使用Basel Face Model,表情使用FaceWarehouse)生成增强的3D人脸数据。
- 在正交投影为2D深度图之前,对3D扫描应用刚性变换(旋转和平移)。
- 在增强过程中通过向3D扫描添加随机补丁来模拟遮挡。
- 使用正交投影将3D点云投影到2D平面,生成与2D卷积神经网络兼容的2.5D深度图。
- 从微调后的卷积神经网络中提取深度特征,并在主成分分析(PCA)和归一化后,通过余弦距离执行身份匹配。
实验结果
研究问题
- RQ1从2D人脸识别卷积神经网络迁移学习是否能有效提升在有限3D数据下的3D人脸识别性能?
- RQ2使用形态可变模型进行3D人脸增强在提升对表情变化的鲁棒性方面有多有效?
- RQ3从2D训练的卷积神经网络提取的深度特征是否能在无需手工设计几何特征的情况下泛化到3D人脸识别?
- RQ4该方法在大规模3D人脸识别任务中,计算时间和准确率的可扩展性如何?
- RQ5与最先进3D人脸识别技术相比,该方法在标准基准测试中是否能达到具有竞争力的性能?
主要发现
- 在Bosphorus数据集上,该方法实现了99.2%的rank-1识别准确率,优于先前方法。
- 在BU-3DFE数据集上,该方法达到95.0%的rank-1准确率,展现出在具有挑战性的基准上的强劲性能。
- 在3D-TEC数据集上,该方法在I类和II类中实现94.8%的rank-1准确率,在III类和IV类中实现81.3%的准确率,显示出对表情变化的鲁棒性。
- 每次探测样本的总识别计算时间为3.25秒,其中特征提取和匹配耗时不足1秒,使其在大规模图库中具备高效性。
- 该方法在性能上与最先进方法相当或更优,且由于高效的特征匹配机制,其可扩展性显著提升。
- 通过引入表情合成与随机遮挡的数据增强技术,显著提升了泛化能力,尤其在探测样本与图库间存在表情不匹配的情况下表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。