Skip to main content
QUICK REVIEW

[论文解读] Weakly and Semi Supervised Human Body Part Parsing via Pose-Guided Knowledge Transfer

Hao-Shu Fang, Guansong Lu|arXiv (Cornell University)|May 11, 2018
Human Pose and Action Recognition参考文献 31被引用 7
一句话总结

本文提出了一种弱监督与半监督的人体部位分割方法,通过姿态引导的知识迁移,将源人物的部位分割标注转移到目标人物。通过基于关键点的姿态匹配实现解剖学上的相似性建模,生成合成的密集分割标签,使半监督模型在 PASCAL-Person-Part 数据集上相比强监督基线模型实现了 6 mIOU 的性能提升,达到新的最先进水平。

ABSTRACT

Human body part parsing, or human semantic part segmentation, is fundamental to many computer vision tasks. In conventional semantic segmentation methods, the ground truth segmentations are provided, and fully convolutional networks (FCN) are trained in an end-to-end scheme. Although these methods have demonstrated impressive results, their performance highly depends on the quantity and quality of training data. In this paper, we present a novel method to generate synthetic human part segmentation data using easily-obtained human keypoint annotations. Our key idea is to exploit the anatomical similarity among human to transfer the parsing results of a person to another person with similar pose. Using these estimated results as additional training data, our semi-supervised model outperforms its strong-supervised counterpart by 6 mIOU on the PASCAL-Person-Part dataset, and we achieve state-of-the-art human parsing results. Our approach is general and can be readily extended to other object/animal parsing task assuming that their anatomical similarity can be annotated by keypoints. The proposed model and accompanying source code are available at https://github.com/MVIG-SJTU/WSHP

研究动机与目标

  • 为解决深度学习驱动的分割模型因缺乏密集标注的人体部位分割数据而性能受限的问题。
  • 利用人体之间解剖结构与姿态的相似性,将少数完全标注人物的部位分割标注迁移到大量弱标注人物上。
  • 开发一个可泛化的框架,利用稀疏关键点标注作为强先验,用于人体分割中的密集语义分割。
  • 证明通过姿态引导迁移生成的合成数据可显著提升模型泛化能力与性能,即使关键点估计存在噪声。
  • 将该方法扩展至其他物体类别(如马和牛),当存在关键点标注时亦可适用。

提出的方法

  • 通过基于关键点的姿态匹配,识别与目标人物姿态最相似的源人物。
  • 将最相似的源人物的部位分割标注迁移至目标人物,形成一致的、姿态对齐的部位级先验。
  • 对多个相似源人物的标注进行平均,以降低噪声并提高可靠性。
  • 通过一个优化网络,结合输入图像与迁移得到的部位级先验,生成高质量的密集分割预测。
  • 将优化后的分割结果作为合成训练数据,用于半监督学习范式中对分割网络的监督。
  • 该框架对关键点预测噪声具有鲁棒性,即使使用最先进姿态估计器生成的预测姿态,仍表现出强劲性能。

实验结果

研究问题

  • RQ1稀疏关键点标注能否被有效利用,以生成高质量的合成密集分割标签用于人体部位分割?
  • RQ2从解剖学上相似的人物中进行姿态引导的知识迁移,是否能提升弱监督与半监督分割的泛化能力与性能?
  • RQ3当训练数据有限时,该方法能否超越完全监督基线模型?
  • RQ4该方法对现实世界姿态估计器产生的噪声关键点预测有多大的鲁棒性?
  • RQ5当存在关键点标注时,该方法能否泛化至人类以外的其他物体类别(如马和牛)?

主要发现

  • 在 PASCAL-Person-Part 数据集上,半监督模型相比其强监督基线模型实现了 6 mIOU 的性能提升,超越了此前最先进结果。
  • 使用 VGG-16 主干网络时,该方法优于基于 ResNet-101 的强监督基线模型,证明了知识迁移策略的有效性。
  • 在多尺度测试下,该方法达到 67.6 mIOU,相比此前最佳结果提升 3 mIOU。
  • 当使用姿态估计结果(如在 COCO 上微调的 MPII 模型)时,该方法达到 61.8 mIOU,与使用真实关键点标注训练的结果相当,表明对噪声具有强鲁棒性。
  • 在 Horse-Cow 数据集上,该方法分别将马与牛的 mIOU 提升了 3.14 和 3.39,使用 ResNet-101 主干网络时分别达到 76.99 和 74.22 mIOU,创下新的最先进结果。
  • 定性结果表明,优化网络生成的掩码更紧凑、更精确,且减少了结构错误,这些改进被有效传递至主分割网络。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。