[论文解读] AlignSDF: Pose-Aligned Signed Distance Fields for Hand-Object Reconstruction
该论文提出了一种名为AlignSDF的新框架,通过将参数化手部和物体模型与有符号距离场(SDF)相结合,以提升从单目RGB图像中重建3D手部-物体交互的效果。通过解耦姿态与形状的学习,并利用估计的MANO和物体姿态参数将SDF对齐到规范姿态空间,该方法在重建精度和细节表现方面达到当前最优水平,尤其在手部-物体交互建模方面表现突出。
Recent work achieved impressive progress towards joint reconstruction of hands and manipulated objects from monocular color images. Existing methods focus on two alternative representations in terms of either parametric meshes or signed distance fields (SDFs). On one side, parametric models can benefit from prior knowledge at the cost of limited shape deformations and mesh resolutions. Mesh models, hence, may fail to precisely reconstruct details such as contact surfaces of hands and objects. SDF-based methods, on the other side, can represent arbitrary details but are lacking explicit priors. In this work we aim to improve SDF models using priors provided by parametric representations. In particular, we propose a joint learning framework that disentangles the pose and the shape. We obtain hand and object poses from parametric models and use them to align SDFs in 3D space. We show that such aligned SDFs better focus on reconstructing shape details and improve reconstruction accuracy both for hands and objects. We evaluate our method and demonstrate significant improvements over the state of the art on the challenging ObMan and DexYCB benchmarks.
研究动机与目标
- 解决从单目RGB图像中重建详细3D手部-物体交互的挑战,现有方法在形状细节和交互保真度方面表现不足。
- 克服参数化网格模型的局限性(形状变形和分辨率受限)以及SDF方法缺乏显式几何先验的问题。
- 将来自参数化模型(手部使用MANO,物体使用平移)的先验知识融入SDF学习,以提升形状重建的准确性。
- 解耦姿态与形状学习,通过归一化全局变换(旋转和平移)简化SDF训练过程。
- 通过将SDF对齐至姿态归一化的规范空间,实现高保真度、接触感知的手部与物体重建。
提出的方法
- 使用MANO网络估计手部姿态,获取规范手部姿态(腕部的旋转和平移),并用于归一化SDF空间。
- 通过专用的物体姿态网络估计物体平移,并用于归一化物体SDF空间,使其对齐至规范坐标系。
- 在各自的姿态归一化规范空间中分别训练手部和物体的SDF网络,使SDF能够专注于形状细节。
- 在训练过程中使用真实手部姿态和估计的物体平移,为消融实验提供上限基线。
- 利用解耦表示提升泛化能力,并降低对全局姿态变化的敏感性。
- 端到端联合训练完整模型,损失函数结合形状重建、姿态估计以及交互指标(接触率、穿透深度)的多任务损失。
实验结果
研究问题
- RQ1来自参数化模型的显式姿态先验是否能提升隐式SDF表示在3D手部-物体重建中的学习效果?
- RQ2与联合优化相比,解耦姿态与形状学习是否能带来更高的重建精度和更优的细节保真度?
- RQ3姿态对齐的SDF是否能比标准SDF或基于网格的方法更好地建模细粒度的手部-物体交互,如接触与穿透?
- RQ4与当前最优方法相比,该方法在DexYCB等真实世界基准上的表现如何?
- RQ5规范姿态对齐在多大程度上降低了SDF学习的复杂度并提升了泛化能力?
主要发现
- 与之前SOTA方法相比,该方法在真实世界DexYCB基准上将手部表面误差(H_se)降低了29.4%,物体表面误差(O_se)降低了20.5%。
- 在ObMan数据集上,完整模型(g)相比基线将H_se降低了6.4%,H_ve降低了8.8%,证明了姿态归一化的有效性。
- 在DexYCB上,接触率(C_r)达到96.1%,表明在超过96%的测试样本中,重建的手部与物体保持接触。
- 穿透深度(P_d)降低至0.71 mm,相交体积(I_v)降低至3.45 mm³,表明交互真实感显著优于先前方法。
- 定性结果表明,该方法在复杂手部-物体构型下对细长结构和精细细节的重建表现更优。
- 消融实验确认,姿态归一化显著降低了O_se(从4.09降至3.36 cm²),并提升了SDF学习效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。