Skip to main content
QUICK REVIEW

[论文解读] Semi-supervised Keypoint Localization

Olga Moskvyak, Frédéric Maire|arXiv (Cornell University)|Jan 20, 2021
Human Pose and Action Recognition参考文献 34被引用 5
一句话总结

本文提出了一种半监督关键点定位方法,通过少量标注图像和大量未标注图像,联合学习关键点热图与姿态不变的语义关键点表征。通过在热图上强制实施变换等变性,在表征上强制实施变换不变性,并在不同视角间保持语义一致性,该方法显著提升了关键点检测的准确性——在ATRW和LSP等挑战性数据集上,仅使用10%的标注数据即可达到与全监督模型相当的性能。

ABSTRACT

Knowledge about the locations of keypoints of an object in an image can assist in fine-grained classification and identification tasks, particularly for the case of objects that exhibit large variations in poses that greatly influence their visual appearance, such as wild animals. However, supervised training of a keypoint detection network requires annotating a large image dataset for each animal species, which is a labor-intensive task. To reduce the need for labeled data, we propose to learn simultaneously keypoint heatmaps and pose invariant keypoint representations in a semi-supervised manner using a small set of labeled images along with a larger set of unlabeled images. Keypoint representations are learnt with a semantic keypoint consistency constraint that forces the keypoint detection network to learn similar features for the same keypoint across the dataset. Pose invariance is achieved by making keypoint representations for the image and its augmented copies closer together in feature space. Our semi-supervised approach significantly outperforms previous methods on several benchmarks for human and animal body landmark localization.

研究动机与目标

  • 解决关键点定位任务中因标注数据有限而带来的挑战,尤其针对姿态变化剧烈的野生动物。
  • 减轻在现实场景中专家标注成本高且稀少的关键点检测任务中的人工标注负担。
  • 开发一种能有效利用标注与未标注数据的方法,以提升关键点检测性能。
  • 通过学习姿态不变的关键点表征,提升对姿态变化的鲁棒性。
  • 实现跨物种与跨领域的可迁移性,包括人类与动物体部关键点检测。

提出的方法

  • 联合训练关键点检测网络,通过监督损失与无监督损失,同时预测热图与语义关键点表征。
  • 应用变换等变性损失(TE),以确保数据增强下热图的一致性。
  • 施加变换不变性损失(TI),在特征空间中对齐图像及其增强版本的关键点表征。
  • 引入语义一致性损失(SC),鼓励不同图像中同一关键点的特征保持相似,无论姿态如何。
  • 在无监督损失中使用真实热图作为可靠监督信号,以指导训练过程。
  • 通过结合监督热图损失与三种无监督约束进行模型优化,损失权重采用可学习的系数。

实验结果

研究问题

  • RQ1半监督学习能否显著减少关键点定位任务中对标注关键点数据的依赖?
  • RQ2变换等变性与不变性约束在高姿态变化条件下如何提升关键点检测性能?
  • RQ3图像间语义一致性在不同姿态下对同一关键点的特征学习有多大促进作用?
  • RQ4在无监督损失中引入真实热图对模型性能有何影响?
  • RQ5未标注数据量的变化对半监督关键点定位模型泛化能力有何影响?

主要发现

  • 该方法在ATRW虎类数据集上仅使用10%的标注数据,即可达到与全监督模型相当的性能。
  • 在LSP人体姿态数据集上,仅使用50%的标注数据,该方法即可达到接近监督学习的性能。
  • 语义一致性损失(SC)是最具影响力的组件,当在5%标注数据下移除时,性能从66%下降至46%。
  • 该方法在多个用于人类与动物关键点定位的基准测试中,优于以往的监督与无监督方法。
  • 消融实验证实,TE、TI与SC损失的组合优于任一单独损失。
  • 模型对损失权重超参数变化具有鲁棒性,最优性能在λ₂=0.5、λ₃=10²、λ₄=10²时达到。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。