Skip to main content
QUICK REVIEW

[论文解读] Perceiving 3D Human-Object Spatial Arrangements from a Single Image in the Wild

Jason Zhang, Sam Pepose|arXiv (Cornell University)|Jul 30, 2020
3D Shape Modeling and Analysis参考文献 65被引用 6
一句话总结

本文提出PHOSA方法,通过联合推理与数据驱动先验,从单张野外图像中推断人类与物体的三维空间排列。通过引入尺度损失、遮挡感知的轮廓重投影损失以及人-物交互损失,该方法在无3D监督的情况下实现了全局一致的3D布局,显著降低了在存在大型或手持物体的复杂场景中的歧义性。

ABSTRACT

We present a method that infers spatial arrangements and shapes of humans and objects in a globally consistent 3D scene, all from a single image in-the-wild captured in an uncontrolled environment. Notably, our method runs on datasets without any scene- or object-level 3D supervision. Our key insight is that considering humans and objects jointly gives rise to "3D common sense" constraints that can be used to resolve ambiguity. In particular, we introduce a scale loss that learns the distribution of object size from data; an occlusion-aware silhouette re-projection loss to optimize object pose; and a human-object interaction loss to capture the spatial layout of objects with which humans interact. We empirically validate that our constraints dramatically reduce the space of likely 3D spatial configurations. We demonstrate our approach on challenging, in-the-wild images of humans interacting with large objects (such as bicycles, motorcycles, and surfboards) and handheld objects (such as laptops, tennis rackets, and skateboards). We quantify the ability of our approach to recover human-object arrangements and outline remaining challenges in this relatively domain. The project webpage can be found at https://jasonyzhang.com/phosa.

研究动机与目标

  • 为解决从单张野外图像中推断全局一致的3D人-物空间排列的挑战,该问题由于2D投影模糊性而本质上是病态的。
  • 通过利用联合人-物约束(如典型交互模式和物体尺寸先验),而非依赖孤立的3D估计,减少3D重建中的歧义性。
  • 开发一种自监督优化框架,学习物体尺度分布并强制执行深度排序与遮挡一致性,而无需3D标注。
  • 展示仅使用2D实例分割和预训练3D人体重建模型,即可在非受控环境中实现整体3D场景理解的可行性。
  • 建立一种可扩展的3D物体理解流水线,能够在多种物体类别和交互类型间泛化。

提出的方法

  • 该方法使用每实例的内在尺度将局部3D预测转换到共享的世界坐标系中,实现人类与物体之间的度量一致性。
  • 引入尺度损失,从数据中学习物体尺寸分布,提供无需监督的物体尺度数据驱动先验。
  • 遮挡感知的轮廓重投影损失确保3D物体姿态与可见图像轮廓保持一致,提升几何保真度。
  • 人-物交互损失编码空间关系(如手在把手上的位置),指导物体相对于人体的定位。
  • 全局优化框架将这些损失与深度排序和碰撞避免相结合,生成一致的3D场景布局。
  • 该框架在可微渲染器上使用基于梯度的优化,仅依赖2D实例分割掩码和2D关键点预测,来优化3D姿态与形状。

实验结果

研究问题

  • RQ1在非受控环境中,对人类与物体进行联合推理是否能减少从单张图像进行3D重建时的歧义性?
  • RQ2在无3D监督的情况下,物体尺寸与人-物交互的数据驱动先验在多大程度上能提升3D布局的一致性?
  • RQ3遮挡感知损失与交互感知损失在复杂场景中引导3D物体姿态估计的效率如何?
  • RQ4自监督的、基于优化的方法是否能在多种物体类别和交互类型下实现合理的3D人-物排列?
  • RQ5各损失项(尺度、遮挡、交互、深度、碰撞)对最终3D布局质量的相对贡献如何?

主要发现

  • 在68%的测试案例中,所提方法在3D人-物重建上优于独立的3D人体与物体重建,50%的案例表现相当,表明具有统计显著性提升。
  • 若省略遮挡感知轮廓损失与交互损失,性能下降最为显著,凸显其在几何与空间合理性中的关键作用。
  • 尺度损失在大多数物体类别中均提升了结果,尤其在初始值远离经验均值时,表明其在解决尺度歧义方面的价值。
  • 深度排序损失提供了适度的性能增益,而碰撞损失影响较弱,可能由于表面三角形优化中的局部极小值问题。
  • 该方法成功重建了多样化的交互,包括大型物体(如冲浪板、摩托车)和手持物品(如笔记本电脑、网球拍),展现出广泛的适用性。
  • 定性结果表明,联合推理能够解决独立估计无法处理的根本性歧义问题,如漂浮物体或位置错误的姿态。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。