[论文解读] Face Alignment Assisted by Head Pose Estimation
本文提出了一种用于级联人脸对齐的监督初始化方案,通过深度卷积神经网络显式估计头部姿态。通过根据估计的头部姿态将3D人脸形状投影或从训练数据中检索最近邻形状,该方法在大姿态变化下提升了对齐的鲁棒性,在300W数据集上将失败案例减少了50%,同时实现了具有竞争力的性能。
In this paper we propose a supervised initialization scheme for cascaded face alignment based on explicit head pose estimation. We first investigate the failure cases of most state of the art face alignment approaches and observe that these failures often share one common global property, i.e. the head pose variation is usually large. Inspired by this, we propose a deep convolutional network model for reliable and accurate head pose estimation. Instead of using a mean face shape, or randomly selected shapes for cascaded face alignment initialisation, we propose two schemes for generating initialisation: the first one relies on projecting a mean 3D face shape (represented by 3D facial landmarks) onto 2D image under the estimated head pose; the second one searches nearest neighbour shapes from the training set according to head pose distance. By doing so, the initialisation gets closer to the actual shape, which enhances the possibility of convergence and in turn improves the face alignment performance. We demonstrate the proposed method on the benchmark 300W dataset and show very competitive performance in both head pose estimation and face alignment.
研究动机与目标
- 解决当前最先进的人脸对齐方法在大头部姿态变化下失败率高的问题。
- 通过用姿态感知初始化替代均值或随机初始化,提升级联人脸对齐的性能。
- 开发一种可靠的深度卷积神经网络,用于在非约束环境下进行头部姿态估计。
- 证明基于姿态的初始化能够提升收敛性和对齐精度,尤其在具有挑战性的姿态下表现更优。
- 展示所提出的初始化方案在不同级联人脸对齐框架中的可泛化能力。
提出的方法
- 训练一个深度卷积神经网络(ConvNet),直接从2D人脸图像中估计头部姿态(偏航角、俯仰角、翻滚角)。
- 利用估计的头部姿态,将标准3D人脸形状(含3D关键点)投影到检测到的人脸边界框内的2D图像平面上。
- 另一种初始化方案基于3D姿态空间中的姿态距离,从训练集中检索最近邻形状。
- 将所提出的初始化方法集成到鲁棒级联姿态回归(RCPR)框架中,以评估性能。
- 在300W基准数据集上评估两种初始化方案,比较失败率和对齐精度。
- 在不同的人脸检测条件下进行测试,包括Viola-Jones和HeadHunter生成的紧密边界框,以评估鲁棒性。
实验结果
研究问题
- RQ1显式头部姿态估计是否能提升在大姿态变化下级联人脸对齐的可靠性?
- RQ2与均值或随机初始化相比,基于姿态的初始化是否能减少失败案例?
- RQ3在不同的人脸检测方案下,基于姿态的初始化性能与当前最先进的人脸对齐方法相比如何?
- RQ4所提出的初始化方案是否可泛化至其他级联人脸对齐框架?
- RQ5头部姿态估计精度对最终对齐性能有何影响?
主要发现
- 使用3D形状投影初始化方法,失败案例数(对齐误差 > 0.1)从130例减少至69例,降幅达50%。
- 最近邻初始化方案同样将失败案例从130例减少至72例,证实两种基于姿态的策略均能持续提升性能。
- 头部姿态估计模型在非约束人脸图像上的绝对平均误差为4°,支持可靠初始化。
- 该方法在性能上与近期最先进的人脸对齐模型(包括SDM、IFA、LBF、CFAN和TCDCN)相比具有竞争力。
- 在使用HeadHunter人脸检测器时,该方法表现出更优的鲁棒性,即使在边界框更紧且更不规则的情况下也能保持稳定性能。
- 整个处理流程每张图像耗时3.8毫秒(姿态估计0.3毫秒,对齐3.5毫秒),表明具备实时处理可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。