[论文解读] Super-realtime facial landmark detection and shape fitting by deep regression of shape model parameters
本文提出了一种超实时的人脸关键点检测方法,通过深度神经网络直接从基于主成分分析(PCA)的统计形状模型回归形状模型参数,避免了迭代优化。通过将PCA层集成到网络中实现端到端可微训练,该方法在单张GPU上实现了410 FPS的推理速度,同时在包括RGB、热成像和医学影像在内的多种数据集上保持了高精度。
We present a method for highly efficient landmark detection that combines deep convolutional neural networks with well established model-based fitting algorithms. Motivated by established model-based fitting methods such as active shapes, we use a PCA of the landmark positions to allow generative modeling of facial landmarks. Instead of computing the model parameters using iterative optimization, the PCA is included in a deep neural network using a novel layer type. The network predicts model parameters in a single forward pass, thereby allowing facial landmark detection at several hundreds of frames per second. Our architecture allows direct end-to-end training of a model-based landmark detection method and shows that deep neural networks can be used to reliably predict model parameters directly without the need for an iterative optimization. The method is evaluated on different datasets for facial landmark detection and medical image segmentation. PyTorch code is freely available at https://github.com/justusschock/shapenet
研究动机与目标
- 在多种成像模态下实现超实时、高精度且鲁棒的人脸关键点检测。
- 通过用直接深度回归替代迭代优化,克服传统基于模型的拟合方法(如主动形状模型)的计算瓶颈。
- 将基于PCA的形状模型集成到可微神经网络层中,实现端到端训练和更快的推理速度。
- 将该方法推广至人脸检测之外的其他形状拟合任务,如医学影像中的形状拟合,以及热成像等非视觉模态。
- 通过使用轻量级全卷积架构直接从输入图像学习形状参数预测,减少对迭代优化的依赖。
提出的方法
- 该方法采用轻量级全卷积神经网络进行特征提取,避免使用全连接层以减少参数量并提升速度。
- 提出一种新型可微PCA层,将最终的关键点位置计算为形状特征向量的线性组合,其权重由预测的参数决定,从而支持端到端反向传播。
- 全局变换参数(平移、缩放、旋转)被单独预测,并应用于标准形状以实现与图像坐标系的对齐。
- 沿图像两个轴分别使用空间分离卷积,进一步降低参数量并保持高效率。
- 使用可微损失函数对网络进行端到端训练,最小化预测关键点与真实关键点之间的归一化点对点误差。
- 该架构在不同数据集上统一应用,仅根据模态调整形状参数数量和输入预处理方式。
实验结果
研究问题
- RQ1深度回归形状模型参数是否能够在保持或提升精度的前提下,替代基于模型的关键点拟合中的迭代优化?
- RQ2集成到深度神经网络中的可微PCA层在多大程度上能够支持端到端训练和超实时推理?
- RQ3该方法在RGB、热成像和医学影像等成像模态中如何泛化,这些模态在对比度、分辨率和外观上存在差异?
- RQ4在300W、热成像人脸、猫、JSRT和PROMISE12等基准数据集上,该方法在速度和精度方面的表现如何?
- RQ5引入全局变换参数是否能在不增加模型复杂度的前提下,提升对头部姿态和图像尺度变化的鲁棒性?
主要发现
- 在使用半精度推理的GeForce RTX 2080 Ti上,该方法实现了410 FPS的推理速度,且该速度与形状参数数量无关,保持稳定。
- 在300W数据集上,该方法在户外集上的归一化点对点误差为0.0126,在室内集上为0.0108,表明在非约束条件下仍具有高精度。
- 在热成像人脸数据集上,该方法实现了0.0102的归一化误差,优于其在更具挑战性的RGB数据集上的表现,可能归因于受控的成像条件。
- 在猫数据集上,该方法在姿态和品种差异较大的情况下实现了0.0211的归一化误差,表明其对关键点数量少和视觉差异大的情况具有鲁棒性。
- 在JSRT肺部X光片数据集上,仅使用25个形状参数,该方法实现了0.0238的归一化误差,表明其在低对比度、小样本医学影像中的有效性。
- 在PROMISE12前列腺MRI数据集的2D切片上,该方法实现了0.0281的归一化误差,证实其在低形状变异的3D医学结构中的适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。