[论文解读] Face Alignment Robust to Pose, Expressions and Occlusions
本文提出了一种集成鲁棒约束局部模型(ERCLM)用于人脸对齐,可在极端变化条件下联合估计面部形状、姿态、表情以及二值遮挡标签。通过在离散化姿态/表情/遮挡空间中进行假设-验证搜索,并结合考虑遮挡的鲁棒形状拟合与关键点检测,ERCLM 在存在遮挡、姿态和表情变化的野外人脸数据上实现了最先进水平的准确率与稳定性。
We propose an Ensemble of Robust Constrained Local Models for alignment of faces in the presence of significant occlusions and of any unknown pose and expression. To account for partial occlusions we introduce, Robust Constrained Local Models, that comprises of a deformable shape and local landmark appearance model and reasons over binary occlusion labels. Our occlusion reasoning proceeds by a hypothesize-and-test search over occlusion labels. Hypotheses are generated by Constrained Local Model based shape fitting over randomly sampled subsets of landmark detector responses and are evaluated by the quality of face alignment. To span the entire range of facial pose and expression variations we adopt an ensemble of independent Robust Constrained Local Models to search over a discretized representation of pose and expression. We perform extensive evaluation on a large number of face images, both occluded and unoccluded. We find that our face alignment system trained entirely on facial images captured "in-the-lab" exhibits a high degree of generalization to facial images captured "in-the-wild". Our results are accurate and stable over a wide spectrum of occlusions, pose and expression variations resulting in excellent performance on many real-world face datasets.
研究动机与目标
- 解决人脸对齐中的‘鸡生蛋蛋生鸡’问题,即姿态、表情、遮挡与形状估计相互依赖。
- 开发一种对部分遮挡、未知面部姿态和多样化表情具有鲁棒性的方法,适用于非约束的‘野外’环境。
- 显式估计每个关键点的二值遮挡标签,为识别和三维建模等下游应用提供辅助信息。
- 通过仅在‘实验室’数据上进行训练,实现对‘野外’数据集的强大泛化能力。
- 支持在模糊对齐场景中进行鲁棒系统级决策,输出多个假设。
提出的方法
- 使用一组独立的鲁棒约束局部模型(RCLMs)来覆盖离散化的人脸姿态、表情和二值遮挡标签空间。
- 采用假设-验证策略:通过将形状拟合到关键点检测器响应的随机子集来生成假设,然后通过对齐质量评估每个假设。
- 通过每个关键点的二值标签实现遮挡推理,这些标签在形状拟合过程中推断得出,通过测试哪种配置最能解释可见的面部结构。
- 采用三种采样策略——随机、贪心和基于置信度——来生成关键点假设,以在鲁棒性与效率之间取得平衡。
- 通过最终的形状精炼阶段优化最佳假设,以提高对齐准确率。
- 利用基于CLM的优化方法固有的鲁棒性,可容忍较差的初始边界框,而回归方法则不具备此特性。
实验结果
研究问题
- RQ1在极端变化条件下,人脸对齐系统能否联合且稳健地估计形状、姿态、表情和遮挡标签?
- RQ2如何将遮挡推理整合到基于形状的对齐框架中,以提升对部分遮挡人脸的性能?
- RQ3在仅使用‘实验室’数据进行训练的情况下,该方法能否有效泛化到具有未知姿态、表情和遮挡的‘野外’图像?
- RQ4在离散化姿态/表情/遮挡空间上采用假设-验证方法,是否能优于将这些因素独立处理的标准流水线?
- RQ5在模糊或遮挡场景中,多个对齐假设在多大程度上能提升系统级鲁棒性?
主要发现
- ERCLM 在具有严重遮挡和姿态变化的数据集上实现了最先进的人脸对齐性能,表现出卓越的准确率与稳定性。
- 尽管仅在‘实验室’数据上进行训练,该方法在‘野外’图像上仍表现出良好的泛化能力,表明其具备强大的域泛化能力。
- 在测试的所有失败案例中,ERCLM 排名前三的假设中均包含正确对齐结果,且正确结果通常位列第二或第三。
- 如表 IV 所示,用于假设生成的随机采样比贪心或基于置信度的采样更具鲁棒性,尤其在检测器存在误差时。
- ERCLM 的计算速度慢于回归方法(约每张人脸 10 秒),但其对初始化的鲁棒性以及可并行化特性在一定程度上弥补了这一缺点。
- 该系统为每个关键点输出二值遮挡标签,为下游任务(如三维头姿态估计和表情识别)提供了宝贵辅助信息。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。