[论文解读] GarmentNets: Category-Level Pose Estimation for Garments via Canonical Space Shape Completion
GarmentNets 通过在共享的规范空间中对各类服装实例进行 3D 形状补全,提出了一种类别级姿态估计方法,采用新颖的环绕数场表示以处理细薄、非水密结构。该方法在形状补全任务中实现显著性能提升——相比占用网格最高提升 32.2%,并能有效泛化至未见过的真实世界和模拟服装。
This paper tackles the task of category-level pose estimation for garments. With a near infinite degree of freedom, a garment's full configuration (i.e., poses) is often described by the per-vertex 3D locations of its entire 3D surface. However, garments are also commonly subject to extreme cases of self-occlusion, especially when folded or crumpled, making it challenging to perceive their full 3D surface. To address these challenges, we propose GarmentNets, where the key idea is to formulate the deformable object pose estimation problem as a shape completion task in the canonical space. This canonical space is defined across garments instances within a category, therefore, specifies the shared category-level pose. By mapping the observed partial surface to the canonical space and completing it in this space, the output representation describes the garment's full configuration using a complete 3D mesh with the per-vertex canonical coordinate label. To properly handle the thin 3D structure presented on garments, we proposed a novel 3D shape representation using the generalized winding number field. Experiments demonstrate that GarmentNets is able to generalize to unseen garment instances and achieve significantly better performance compared to alternative approaches.
研究动机与目标
- 解决服装类别级姿态估计的挑战,因服装具有近乎无限的自由度且极易发生严重自遮挡。
- 克服现有方法依赖完全可见性、已知实例网格或物理先验的局限,这些限制了其对未见服装的泛化能力。
- 开发一种适用于细薄、非水密织物结构的鲁棒 3D 形状表示,此类结构不适用于传统表示方法(如占用网格或有符号距离函数)。
- 通过类别内共享的规范空间,实现对训练中未见的新型服装实例的有效泛化。
- 通过结合部分 RGB-D 观测、学习到的形状补全与隐式形变场,支持实际机器人操作,实现任务空间中准确的姿态预测。
提出的方法
- 使用标准化人体姿态为每类服装定义一个规范空间,从而在多样化的服装实例间实现类别级对应学习。
- 将部分 3D 观测(如 RGB-D 点云)映射至规范空间,并通过学习的神经网络执行 3D 形状补全,以预测完整且密集的 3D 网格。
- 引入广义环绕数场(WNF)作为新型 3D 形状表示,可精确捕捉细薄、连续的织物几何结构,具备强表面梯度与平滑内部。
- 使用学习到的隐式形变场网络将补全后的规范网格映射回真实世界任务空间,校正前期阶段的误差,提升姿态精度。
- 使用预对齐的 3D 网格和密集对应标签进行端到端训练,利用模拟数据,实现对真实世界未见服装的泛化。
- 将学习到的形变场与物理模拟用于反向映射进行比较;学习到的形变场通过自纠正 NOCS 预测误差,优于基于物理的方法。
实验结果
研究问题
- RQ1规范空间表示能否在多样且未见的服装实例之间实现类别级泛化,用于服装姿态估计?
- RQ2如何有效表示细薄、非水密的 3D 织物结构,以支持精确的形状补全与姿态估计?
- RQ3在规范空间中进行形状补全是否相比直接在任务空间中预测或使用物理模拟,能带来更好的泛化性和性能?
- RQ4学习到的隐式形变场能否在将补全后的规范网格映射回真实世界任务空间时,优于物理模拟方法?
- RQ5在模拟数据上训练的模型,能在多大程度上泛化至真实世界中对褶皱、部分可见服装的 RGB-D 观测?
主要发现
- 在规范网格上,GarmentNets 在 Chamfer 距离下相比占用网格提升 32.2%,相比 TDF 提升 18.7%,相比 TSDF 提升 26.7%。
- 该模型能有效泛化至未见过的真实世界服装,在使用 iPhone 12 Pro Max 捕获的 RGB-D 数据中成功完成 3D 几何补全并估计姿态。
- 与物理模拟相比,学习到的隐式形变场将平均姿态误差降低了 68.5%,裤子的平均误差为 1.41 cm,而物理模拟为 1.64 cm。
- 环绕数场表示能够精确建模细薄织物结构,避免了 TDF 的过度平滑问题和占用网格的体素尺寸限制。
- 在未见的服装实例上,该方法在衬衫上实现 1.70 cm 的平均 Chamfer 距离,在裤子上实现 1.41 cm,展现出强大的零样本泛化能力。
- 系统通过在规范空间中补全完整 3D 网格,成功处理了极端自遮挡和部分观测情况,即使仅可见表面的 30–40% 也能实现有效补全。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。