[论文解读] A Convolution Tree with Deconvolution Branches: Exploiting Geometric Relationships for Single Shot Keypoint Detection
本文提出了一种新颖的端到端、单阶段卷积-反卷积网络,采用姿态条件路由机制,通过可学习的变换函数建模关键点之间的几何关系,以提升面部关键点检测性能。该方法利用基于姿态的路由机制,构建反卷积树结构,选择性地在可见与不可见关键点之间传播信息,在AFLW和AFW数据集上分别实现了3.93和3.28的归一化平均误差(NME),达到当前最优性能。
Recently, Deep Convolution Networks (DCNNs) have been applied to the task of face alignment and have shown potential for learning improved feature representations. Although deeper layers can capture abstract concepts like pose, it is difficult to capture the geometric relationships among the keypoints in DCNNs. In this paper, we propose a novel convolution-deconvolution network for facial keypoint detection. Our model predicts the 2D locations of the keypoints and their individual visibility along with 3D head pose, while exploiting the spatial relationships among different keypoints. Different from existing approaches of modeling these relationships, we propose learnable transform functions which captures the relationships between keypoints at feature level. However, due to extensive variations in pose, not all of these relationships act at once, and hence we propose, a pose-based routing function which implicitly models the active relationships. Both transform functions and the routing function are implemented through convolutions in a multi-task framework. Our approach presents a single-shot keypoint detection method, making it different from many existing cascade regression-based methods. We also show that learning these relationships significantly improve the accuracy of keypoint detections for in-the-wild face images from challenging datasets such as AFW and AFLW.
研究动机与目标
- 解决在具有极端姿态变化、遮挡以及不可见关键点缺乏标注的非约束、野外图像中实现高精度面部关键点检测的挑战。
- 通过在特征层面学习空间依赖关系,超越仅依赖得分图的方式,建模面部关键点之间的几何关系。
- 通过基于估计的3D头部姿态条件化路由,实现在部分关键点被遮挡或不可见时仍能有效传递信息。
- 开发一种快速、非迭代的全卷积框架,避免级联回归,并通过残差SqueezeNet减少模型参数。
- 在统一的多任务学习框架中,同时提升关键点检测精度并估计3D头部姿态。
提出的方法
- 该方法采用深层卷积网络,其反卷积分支构成树状结构,用于在面部关键点之间传播特征级信息。
- 基于姿态的路由函数根据预测的3D头部姿态动态激活相关反卷积分支,确保仅传递有意义的信息。
- 可学习的变换函数通过卷积实现,用于在特征层面建模关键点对之间的空间关系,捕捉几何约束。
- 网络在多任务框架中端到端训练,同时预测2D关键点位置、可见性状态和3D头部姿态。
- 采用残差SqueezeNet以减少模型参数量,同时保持性能,实现高效推理。
- 该框架通过在训练中将不可见关键点视为背景,隐式处理遮挡,但仍能通过信息传递准确预测其位置。
实验结果
研究问题
- RQ1能否在深层网络中,通过可学习的卷积变换在特征层面有效建模面部关键点之间的几何关系?
- RQ2如何使关键点之间的信息传递在非约束人脸图像中对遮挡和姿态变化具有鲁棒性?
- RQ3在无3D监督的情况下,单阶段、端到端的深度学习框架能否超越级联回归方法在面部关键点检测中的性能?
- RQ4与固定或无条件的信息传递相比,姿态条件路由在多大程度上提升了关键点检测的准确性?
- RQ5统一网络能否以高精度同时预测2D关键点位置、可见性状态和3D头部姿态?
主要发现
- 所提方法在AFLW数据集上实现了3.93的归一化平均误差(NME),优于所有先前的SOTA方法,仅CCL(使用重新标注数据)略优。
- 在AFW数据集上,该方法实现了3.28的NME,表现优异,尤其在部分遮挡和侧脸图像上仍具强鲁棒性。
- 累积误差分布曲线显示,AFLW数据集中超过90%的人脸误差低于人脸尺寸的5%,表明对变化具有强鲁棒性。
- 定性结果表明,由于反卷积树中有效的信息传递,即使在侧脸中也能准确预测不可见关键点。
- 在AFW数据集上的姿态估计性能显示,超过85%的人脸预测姿态与真实姿态偏差在±15°以内,证实了3D姿态估计分支的有效性。
- 消融实验表明,姿态条件路由与特征级信息传递的结合显著提升了检测精度,优于不包含这些组件的基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。