Skip to main content
QUICK REVIEW

[论文解读] Weakly Supervised Learning of Affordances

Abhilash Srikantha, Jüergen Gall|arXiv (Cornell University)|May 10, 2016
Robot Manipulation and Learning参考文献 21被引用 15
一句话总结

本文提出了一种弱监督深度学习框架,用于使用图像级标签、关键点注释和人体姿态作为上下文线索进行语义可操作性分割。通过将期望最大化(EM)优化循环与深度卷积神经网络(DCNN)相结合,该方法在极少监督下实现了最先进性能,在包含 3090 张图像、9916 个物体实例以及丰富的人机交互上下文的新像素级注释数据集上,平均准确率达到 0.27。

ABSTRACT

Localizing functional regions of objects or affordances is an important aspect of scene understanding. In this work, we cast the problem of affordance segmentation as that of semantic image segmentation. In order to explore various levels of supervision, we introduce a pixel-annotated affordance dataset of 3090 images containing 9916 object instances with rich contextual information in terms of human-object interactions. We use a deep convolutional neural network within an expectation maximization framework to take advantage of weakly labeled data like image level annotations or keypoint annotations. We show that a further reduction in supervision is possible with a minimal loss in performance when human pose is used as context.

研究动机与目标

  • 通过允许从弱监督(如图像级标签或稀疏关键点注释)中学习,解决像素级可操作性分割的高标注成本问题。
  • 探索人体-物体交互上下文(特别是人体姿态)在提升弱监督可操作性分割中的作用。
  • 开发一种可扩展的端到端深度学习框架,利用弱标注和上下文线索,减少对昂贵像素级标注的依赖。
  • 引入一个新的大规模像素级注释可操作性数据集,包含丰富的人机交互上下文信息,用于基准测试。
  • 证明人体姿态能够有效实现跨图像的关键点注释迁移,从而在弱监督设置中实现更优的初始化和性能。

提出的方法

  • 该方法采用期望最大化(EM)框架,通过弱监督迭代优化分割预测:E 步通过以关键点注释为中心的高斯分布估计潜在的像素级分割;M 步则使用这些估计作为伪真值来训练 DCNN。
  • 该方法在 [10] 的 EM 框架基础上进行了扩展,引入了关键点注释中的空间依赖性,从而有效利用稀疏点击点或关键点标签。
  • 人体姿态被用作上下文先验:一个回归模型将人体姿态映射到缺乏直接关键点注释图像中的预测关键点位置,从而实现弱标注的迁移。
  • 该框架支持混合监督,允许同时在具有图像级标签和关键点注释的图像上进行训练。
  • 在 E 步中使用常数偏置项以平衡前景和背景预测,提升收敛性和分割质量。
  • 该方法在包含 9916 个物体实例、标注有像素级可操作性标签和丰富人机交互上下文的新数据集(3090 张图像)上进行了评估。

实验结果

研究问题

  • RQ1是否能够从弱监督(如图像级标签或稀疏关键点注释)中有效学习可操作性分割,而无需完整像素级注释?
  • RQ2人体姿态作为上下文信号,在弱监督可操作性分割中实现跨图像关键点注释迁移时有多有效?
  • RQ3整合人体-物体交互上下文在多大程度上能提升弱监督可操作性分割模型的性能?
  • RQ4在混合监督(图像标签和关键点注释)下训练时,基于 EM 的深度学习框架是否能超越现有弱监督方法?
  • RQ5不同上下文先验(如人体姿态与物体边界框)对关键点注释迁移质量和最终分割准确率的影响如何?

主要发现

  • 所提出的基于 EM 的方法结合关键点监督和人体姿态上下文,在 CAD120 数据集上实现了 0.27 的平均准确率,显著优于基线方法。
  • 仅使用 2/3 的带关键点注释的训练数据(TrainXOnly),并通过 EM 框架迭代优化至收敛,性能从 0.22 提升至 0.25,证明了迭代优化的有效性。
  • 该方法大幅优于半监督基线 [10],平均准确率达到 0.25 对比 0.16,表明 [10] 中的常数偏置项对可操作性分割而言不足。
  • 通过人体姿态回归实现关键点注释迁移,性能从 1 次迭代时的 0.25 提升至收敛时的 0.27,表明基于姿态的上下文能增强模型泛化能力。
  • 若将人体姿态替换为物体边界框进行关键点回归,性能显著下降至 0.21 的平均准确率,证实人体姿态相比简单物体定位提供了更有效且信息量更高的上下文。
  • 定性结果表明,与 VGG+SRF 等监督基线模型相比,甚至优于在弱监督下训练的 DeepLab 模型,该方法在细粒度可操作性(如 '可切割')方面产生了更准确且空间一致的可操作性分割结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。