[论文解读] Face Detection, Bounding Box Aggregation and Pose Estimation for Robust Facial Landmark Localisation in the Wild
本文提出了一种从粗到精的框架,用于在非受限环境中实现鲁棒的面部关键点定位,结合了多种基于CNN的人脸检测器、边界框聚合、通过级联形状回归进行姿态估计,以及细粒度的关键点精炼。该方法在300W和Menpo基准测试中取得了最先进性能,在第二届面部关键点定位竞赛中,300W室内+室外数据集的归一化RMS误差达到2.26。
We present a framework for robust face detection and landmark localisation of faces in the wild, which has been evaluated as part of `the 2nd Facial Landmark Localisation Competition'. The framework has four stages: face detection, bounding box aggregation, pose estimation and landmark localisation. To achieve a high detection rate, we use two publicly available CNN-based face detectors and two proprietary detectors. We aggregate the detected face bounding boxes of each input image to reduce false positives and improve face detection accuracy. A cascaded shape regressor, trained using faces with a variety of pose variations, is then employed for pose estimation and image pre-processing. Last, we train the final cascaded shape regressor for fine-grained landmark localisation, using a large number of training samples with limited pose variations. The experimental results obtained on the 300W and Menpo benchmarks demonstrate the superiority of our framework over state-of-the-art methods.
研究动机与目标
- 解决在姿态、光照和遮挡存在极端变化的非受限环境中实现准确面部关键点定位的挑战。
- 通过聚合多个面部检测器的输出,提升人脸检测的可靠性,减少误报并增强检测一致性。
- 通过将级联形状回归过程划分为从粗到精的阶段,并引入姿态感知预处理,提升关键点定位的精度。
- 在不依赖预提供的人脸边界框的情况下,实现在基准数据集上的优异性能,模拟真实世界部署场景。
- 在Menpo和300W基准测试中,超越现有方法,在第二届面部关键点定位竞赛中表现领先。
提出的方法
- 采用两个公开和两个专有的基于CNN的人脸检测器,生成多样化的初始人脸检测结果,以提升检测覆盖范围。
- 应用边界框聚合策略,合并重叠或冲突的检测结果,减少误报并提高定位一致性。
- 使用在多样化姿态变化数据上训练的级联形状回归器,估计头部姿态,并对图像进行预处理,以提升关键点初始化质量。
- 利用在姿态变化有限的数据上训练的第二个级联形状回归器,执行细粒度的关键点定位,实现高精度精炼。
- 在推理阶段应用图像变换(旋转/翻转),将人脸对齐至标准姿态,提升回归精度。
- 在形状回归组件中,利用VLFeat工具箱提取的HOG和LBP特征。
实验结果
研究问题
- RQ1结合多个面部检测器并聚合其边界框,是否能显著提升在非受限环境下的面部检测准确率?
- RQ2通过级联形状回归进行姿态估计,是否能提升后续关键点定位的鲁棒性和准确性?
- RQ3将级联形状回归划分为从粗到精的阶段,是否能提升关键点定位的精度,尤其是在姿态变化较大的情况下?
- RQ4与最先进方法相比,该框架在300W和Menpo等标准化基准测试中的表现如何?
- RQ5在Menpo基准测试中,由于缺乏预提供的边界框,性能会受到多大影响?该框架是否能有效补偿这一缺陷?
主要发现
- 所提框架在300W室内+室外测试集上实现了2.26的归一化RMS误差,优于第二届面部关键点定位竞赛中所有参赛者。
- 在Menpo基准测试中,该方法显著优于基线方法Viola-Jones + APS,尤其在处理半正面和侧脸变化时表现更优。
- 使用多个面部检测器并结合边界框聚合,有效减少了误报,并在多样化测试图像中提升了检测一致性。
- 通过级联回归进行姿态估计,实现了有效的预处理,提升了关键点初始化质量与整体定位精度。
- 从粗到精的级联形状回归策略,特别是结合姿态特异性精炼,显著提升了关键点定位的精度。
- 该框架在300W和Menpo基准测试中均表现出强大的泛化能力,证实其在真实世界非受限环境下的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。