[论文解读] Pose2Instance: Harnessing Keypoints for Person Instance Segmentation
本文提出Pose2Instance,一种深度学习框架,通过将分割任务条件化于人体关键点热图,提升了人体实例分割的性能。通过利用经过距离变换的关键点先验(无论是来自理想标注还是预测的热图),该方法在最先进仅基于分割的模型上实现了3.8%至10.5%的相对准确率提升,表明姿态先验能显著增强实例级人体分割性能。
Human keypoints are a well-studied representation of people.We explore how to use keypoint models to improve instance-level person segmentation. The main idea is to harness the notion of a distance transform of oracle provided keypoints or estimated keypoint heatmaps as a prior for person instance segmentation task within a deep neural network. For training and evaluation, we consider all those images from COCO where both instance segmentation and human keypoints annotations are available. We first show how oracle keypoints can boost the performance of existing human segmentation model during inference without any training. Next, we propose a framework to directly learn a deep instance segmentation model conditioned on human pose. Experimental results show that at various Intersection Over Union (IOU) thresholds, in a constrained environment with oracle keypoints, the instance segmentation accuracy achieves 10% to 12% relative improvements over a strong baseline of oracle bounding boxes. In a more realistic environment, without the oracle keypoints, the proposed deep person instance segmentation model conditioned on human pose achieves 3.8% to 10.5% relative improvements comparing with its strongest baseline of a deep network trained only for segmentation.
研究动机与目标
- 探究人体姿态先验是否能在最先进语义分割模型的基础上,进一步提升实例级人体分割性能。
- 量化在推理阶段使用理想人体关键点标注作为先验时的性能增益。
- 开发一种端到端的深度神经网络模型,通过共享特征联合学习关键点估计与实例分割。
- 在无理想关键点的现实场景中,评估姿态条件化分割的有效性。
- 证明姿态信息可被有效整合到深度分割架构中,从而提升实例级定位与分割的准确性。
提出的方法
- 该方法使用共享的卷积主干网络(至倒数第二层)同时用于关键点热图预测与分割任务,实现特征共享。
- 通过距离变换对关键点热图进行处理,生成编码人体几何结构的空间先验。
- 将经过距离变换的关键点热图作为额外输入通道,拼接至最终的分割头,用于实例级预测。
- 模型采用级联方式训练:首先预测边界框与关键点热图,然后利用姿态先验对分割结果进行优化。
- 采用多任务训练策略,通过共享特征提取器联合优化关键点估计与分割任务。
- 该框架在COCO实例分割与COCO人体关键点数据集的交集上进行评估,采用多个IoU阈值下的标准AP指标。
实验结果
研究问题
- RQ1是否可以仅通过使用距离变换后的关键点热图作为先验,无需任何模型微调,提升实例分割性能?
- RQ2在无理想关键点的现实场景中,与仅基于分割的基线模型相比,姿态条件化分割模型能带来多大的性能增益?
- RQ3当使用预测的关键点热图与理想关键点标注时,实例分割准确率的相对提升分别是多少?
- RQ4级联结构的Pose2Instance是否在分割准确率上优于多任务联合学习方法?
- RQ5当关键点估计失败时,尤其在人群密集或遮挡严重的场景中,姿态条件化分割模型的鲁棒性如何?
主要发现
- 在使用理想关键点标注的受限设置下,Pose2Instance模型相比仅使用理想边界框的强基线模型,实例分割准确率提升了10%至12%。
- 在无理想关键点的现实设置中,级联结构的Pose2Instance模型相比仅基于分割的基线模型,AP指标实现了3.8%至10.5%的相对提升。
- 级联结构的Pose2Instance模型优于多任务联合学习模型,在IoU=0.5时AP绝对提升3%,在IoU=[0.5,0.95]时提升4%。
- 定性结果表明,即使在人群密集的场景中,该模型仍能成功分割出个体的人体实例,但当姿态估计器失效时性能会下降。
- 即使使用基于VGG的姿势估计器,该方法依然有效,表明该框架对关键点预测中的中等误差具有鲁棒性。
- 姿态先验的引入显著提升了分割准确率,尤其在部分遮挡或实例密度高的情况下,此时外观相似性使分离变得困难。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。