Skip to main content
QUICK REVIEW

[论文解读] DECO: Dense Estimation of 3D Human-Scene Contact In The Wild

Shashank Tripathi, Agniv Chatterjee|UvA-DARE (University of Amsterdam)|Sep 26, 2023
Human Pose and Action RecognitionComputer Science被引用 3
一句话总结

DECO 提出了一种新颖的3D接触估计方法,用于在非受限、真实场景的图像中实现人体与物体及场景之间的密集、顶点级接触估计。该方法利用了一个新数据集 DAMON,其中包含人工标注的3D接触标签,并采用结合身体部位驱动与场景上下文驱动推理的双注意力网络,在 RICH、BEHAVE 和 DAMON 基准上实现了最先进性能,显著优于先前方法。

ABSTRACT

Understanding how humans use physical contact to interact with the world is key to enabling human-centric artificial intelligence. While inferring 3D contact is crucial for modeling realistic and physically-plausible human-object interactions, existing methods either focus on 2D, consider body joints rather than the surface, use coarse 3D body regions, or do not generalize to in-the-wild images. In contrast, we focus on inferring dense, 3D contact between the full body surface and objects in arbitrary images. To achieve this, we first collect DAMON, a new dataset containing dense vertex-level contact annotations paired with RGB images containing complex human-object and human-scene contact. Second, we train DECO, a novel 3D contact detector that uses both body-part-driven and scene-context-driven attention to estimate vertex-level contact on the SMPL body. DECO builds on the insight that human observers recognize contact by reasoning about the contacting body parts, their proximity to scene objects, and the surrounding scene context. We perform extensive evaluations of our detector on DAMON as well as on the RICH and BEHAVE datasets. We significantly outperform existing SOTA methods across all benchmarks. We also show qualitatively that DECO generalizes well to diverse and challenging real-world human interactions in natural images. The code, data, and models are available at https://deco.is.tue.mpg.de.

研究动机与目标

  • 在非受限、真实场景的图像中,实现人体完整表面与场景物体之间精确、密集的3D接触估计。
  • 解决真实世界图像中高质量、密集3D接触标注的缺乏问题,该问题限制了鲁棒3D接触检测器的训练。
  • 开发一种能够同时推理身体部位身份与周围场景上下文的方法,以推断接触关系,从而在泛化能力上超越仅依赖2D或粗粒度3D表示的方法。
  • 创建一个新的基准数据集 DAMON,其包含在 SMPL 人体网格上的、由人工标注的顶点级3D接触标签,涵盖多样的人体-物体及人体-场景交互。
  • 在包括真实场景和扫描数据集在内的多个基准上,超越现有最先进方法在3D接触估计方面的表现。

提出的方法

  • 提出 DECO,一种3D接触检测器,以单张RGB图像为输入,输出在SMPL人体网格顶点级别的密集接触标签。
  • 采用双注意力机制:身体部位驱动注意力聚焦于相关身体区域,场景上下文驱动注意力用于推理与物体之间的接近度和空间关系。
  • 使用结合接触分类、部件感知损失和场景感知监督的多任务损失进行端到端训练,损失权重通过实验调优。
  • 使用基于ResNet的2D特征提取器处理输入图像、场景分割掩码和部件分割掩码,随后进行特征融合与3D回归。
  • 引入上下文分支(L²_s 和 L²_p),利用2D场景和部件上下文特征优化预测,将测地线误差降低约24%。
  • 利用一种新型交互式3D标注工具收集DAMON数据集,实现对人体完整网格上精确的人工标注3D接触标签。

实验结果

研究问题

  • RQ1深度学习模型能否在非受限的真实世界图像中准确预测人体完整表面与场景物体之间的密集3D接触?
  • RQ2将身体部位身份与场景上下文信息相结合,相较于仅依赖单一模态的方法,如何提升接触估计性能?
  • RQ3与基于SDF的伪真值或合成数据相比,人工标注的3D接触数据集(DAMON)在泛化能力和准确性方面能提升多少?
  • RQ4所提出的双注意力机制是否在捕捉多样化交互中的复杂全身体接触模式方面优于现有网络架构?
  • RQ5DECO在未见于训练分布的、来自互联网的图像上是否具备良好的泛化能力?

主要发现

  • 在RICH测试集上,DECO的平均IoU达到0.510,在DAMON数据集上mIoU达到0.450,显著优于先前SOTA方法。
  • 在RICH数据集上,通过引入上下文分支,DECO相比基线模型将测地线误差降低了24%。
  • DAMON数据集的Fleiss’ Kappa为0.656,表明标注者之间具有显著一致性;标签准确率mIoU为0.450,且人工标注标签在真实接触的保真度上优于基于SDF的伪真值。
  • 在互联网图像上的定性结果表明,DECO在训练分布外的多样化、具有挑战性的现实世界交互中表现出良好的泛化能力。
  • 加入上下文分支的模型仅增加1%的参数复杂度,但性能显著提升,证明了场景与部件上下文在接触推理中的价值。
  • 在所有基准上,包括RICH和BEHAVE数据集,DECO均优于基线方法如BSTRO和POSA^PIXIE。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。