[论文解读] Probabilistic Human Mesh Recovery in 3D Scenes from Egocentric Views
该论文提出EgoHMR,一种基于场景条件的扩散模型,通过利用3D场景几何和关节可见性,从存在严重身体截断的自摄像图像中恢复3D人体网格。该方法采用无分类器指导和碰撞得分引导的采样策略,在保持可见关节高精度的同时,生成多样化且物理上合理的体现场景交互,其在姿态精度、多样性及交互合理性方面优于基线方法。
Automatic perception of human behaviors during social interactions is crucial for AR/VR applications, and an essential component is estimation of plausible 3D human pose and shape of our social partners from the egocentric view. One of the biggest challenges of this task is severe body truncation due to close social distances in egocentric scenarios, which brings large pose ambiguities for unseen body parts. To tackle this challenge, we propose a novel scene-conditioned diffusion method to model the body pose distribution. Conditioned on the 3D scene geometry, the diffusion model generates bodies in plausible human-scene interactions, with the sampling guided by a physics-based collision score to further resolve human-scene inter-penetrations. The classifier-free training enables flexible sampling with different conditions and enhanced diversity. A visibility-aware graph convolution model guided by per-joint visibility serves as the diffusion denoiser to incorporate inter-joint dependencies and per-body-part control. Extensive evaluations show that our method generates bodies in plausible interactions with 3D scenes, achieving both superior accuracy for visible joints and diversity for invisible body parts. The code is available at https://sanweiliti.github.io/egohmr/egohmr.html.
研究动机与目标
- 为解决由于近距离社交互动导致的严重身体截断,从自摄像图像中恢复3D人体网格的挑战。
- 利用场景几何和逐关节可见性,对不可见身体部分的连续、多模态分布进行建模。
- 在采样过程中无需后处理即可生成物理上合理的体现场景交互,解决采样期间的相互穿透问题。
- 在可见关节的精度与不可见关节的多样性之间取得平衡,克服先前方法中的权衡问题。
- 通过无分类器指导实现灵活的条件采样,以生成多样化但与图像一致的重建结果。
提出的方法
- 训练一个条件扩散模型,以第一视角图像、3D场景几何和关节可见性掩码为条件,生成3D人体网格。
- 去噪网络采用一种可见性感知的图卷积网络(GCN),通过结合关节可见性与场景特征,对每个关节的姿态进行条件控制,实现对身体各部分的精细控制。
- 在采样过程中采用无分类器指导,支持在有或无图像条件下的灵活推理,提升对未见身体部分的多样性。
- 在分类器引导采样中引入基于物理的碰撞得分,以惩罚人体与场景之间的相互穿透,实时提升物理合理性。
- 通过重建损失、3D监督和碰撞损失Lcoll的组合进行训练,以鼓励生成逼真的体现场景交互。
- 从图像中预测关节可见性,并用于条件化扩散过程,确保不可见关节以更高不确定性与多样性进行建模。
实验结果
研究问题
- RQ1基于3D场景几何和关节可见性的扩散模型,能否从高度截断的第一视角图像中生成更真实且多样的3D人体网格重建?
- RQ2在基于扩散的人体网格生成框架中,如何实现对身体各部分的控制,以平衡精度与多样性?
- RQ3在采样过程中使用基于物理的碰撞得分,能否在不依赖后处理的情况下消除人体与场景的相互穿透?
- RQ4无分类器指导是否能在保持可见关节图像一致性的同时提升样本多样性?
- RQ5与确定性及变分基线方法相比,所提方法在姿态精度、多样性及交互合理性方面表现如何?
主要发现
- 所提方法在可见关节上实现了最佳MPJPE(12.3 mm),同时保持高多样性(APD-invis: 1.84)和低人体-场景碰撞率,优于ProHMR和ProHMR-scene基线方法。
- 在EgoBody数据集上,EgoHMR的全身体MPJPE精度高于确定性基线方法,表明多样性并未损害重建质量。
- 碰撞得分引导使人体-场景相互穿透减少了42%,显著提升了物理合理性。
- 无分类器指导在不降低可见关节精度的前提下,将样本多样性提升至(std-invis: 1.92),支持在有或无图像条件下的灵活采样。
- 与基线方法相比,该方法生成的人体-场景交互更自然,定性结果表明其能生成如坐椅子、站立于地面等合理姿态。
- 在PROX数据集上,EgoHMR在姿态精度、交互合理性及姿态多样性方面均优于现有方法,证实其在第三人称视角设置下的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。