[论文解读] Learning to Reconstruct Texture-less Deformable Surfaces from a Single View
本文提出了一种数据驱动的深度学习方法,用于从单张图像重建无纹理、可变形表面的三维形状,绕过了传统SfS方法的局限性。与预测网格参数不同,该方法使用卷积神经网络(CNN)回归密集的深度图和法线图,在捕捉细小细节(如褶皱)方面相比当前最先进的SfS方法表现出更高的精度,且在未见过的物体上具有显著的泛化能力,推理速度比现有方法快了数个数量级。
Recent years have seen the development of mature solutions for reconstructing deformable surfaces from a single image, provided that they are relatively well-textured. By contrast, recovering the 3D shape of texture-less surfaces remains an open problem, and essentially relates to Shape-from-Shading. In this paper, we introduce a data-driven approach to this problem. We introduce a general framework that can predict diverse 3D representations, such as meshes, normals, and depth maps. Our experiments show that meshes are ill-suited to handle texture-less 3D reconstruction in our context. Furthermore, we demonstrate that our approach generalizes well to unseen objects, and that it yields higher-quality reconstructions than a state-of-the-art SfS technique, particularly in terms of normal estimates. Our reconstructions accurately model the fine details of the surfaces, such as the creases of a T-Shirt worn by a person.
研究动机与目标
- 解决从单张图像重建无纹理可变形表面这一长期挑战,该任务对传统SfS方法而言仍具挑战性。
- 克服在无纹理环境下基于网格的回归方法在捕捉细小几何细节(如褶皱和自阴影)方面的局限性。
- 开发一种无需微调或重新训练即可在多种物体类别间泛化的数据驱动SfS框架。
- 构建一个大规模的真实世界数据集,包含26,500个标注样本,涵盖在复杂光照条件下发生复杂形变的均匀反光可变形表面。
- 实现高质量的三维重建,提升法线估计精度,并显著加快推理速度,优于基于优化的SfS方法。
提出的方法
- 训练一个多流卷积神经网络(CNN),直接从单张RGB图像预测密集的深度图和法线图,避免了网格参数化。
- 模型使用一个大规模的真实世界数据集进行训练,包含26,500个样本,涵盖在真实光照条件下发生复杂形变的无纹理可变形表面。
- 监督信号来自真实深度图和法线图,相较于完整的三维网格或复杂的光照标注,这些数据更容易获取。
- 网络架构设计用于处理复杂的光度效应(如自阴影、遮挡和相互反射),而无需显式建模。
- 推理通过一次前向传播完成,实现近实时性能,与需要迭代求解器的基于优化的SfS方法形成对比。
- 该方法泛化能力出色:在某一类物体(如T恤)上训练后,无需微调即可实现对其他类别(如毛衣、连帽衫)的准确重建。
实验结果
研究问题
- RQ1数据驱动方法是否能在复杂光照条件下,优于传统SfS方法重建无纹理可变形表面?
- RQ2与基于网格的回归相比,预测密集深度图和法线图是否更适用于无纹理三维重建?
- RQ3在单一物体上训练的模型是否能泛化到未见过的、结构不同的可变形物体,而无需微调?
- RQ4该方法在捕捉细小几何细节(如锐利褶皱和折叠)方面的表现如何?
- RQ5与当前最先进的SfS方法相比,该方法在重建精度与推理速度之间存在怎样的权衡?
主要发现
- 所提方法在所有评估指标上均优于当前最先进的SfS方法[5],在T恤测试集上的平均角度误差(mAE)为18.07° ± 12.71°,而SIRFS为30.17° ± 20.26°。
- 法线质量显著更优:在T恤上,66.27%的预测结果与真实值相差小于10°,而SIRFS仅为36.63%。
- 模型泛化效果良好:当在衣物和T恤数据上联合训练后,对未见衣物(如毛衣和连帽衫)的性能提升,mAE分别降至25.75° ± 16.72°和24.66° ± 17.36°。
- 推理速度比SIRFS快逾10,000倍,每张图像仅需0.01秒(对比SIRFS的113.653秒),原因在于无需迭代优化。
- 基于深度的指标(mD)也表现出一致改进:在T恤上,mD为17.18 ± 18.58 mm(本方法)对比SIRFS的31.09 ± 15.03 mm。
- 定性结果表明,该方法在恢复衣物中的细小细节(如锐利褶皱和折叠)方面表现更优,如图1和图7所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。