[论文解读] Implicit Mesh Reconstruction from Unannotated Image Collections
该论文提出了一种自监督方法,仅使用未标注图像集合中的前景掩码,通过学习的隐式函数将球体变形为3D形状,同时预测纹理和相机位姿。尽管仅依赖弱监督,其性能仍可与强监督方法相媲美,在30种不同物体类别上实现了有意义的形状与纹理重建。
We present an approach to infer the 3D shape, texture, and camera pose for an object from a single RGB image, using only category-level image collections with foreground masks as supervision. We represent the shape as an image-conditioned implicit function that transforms the surface of a sphere to that of the predicted mesh, while additionally predicting the corresponding texture. To derive supervisory signal for learning, we enforce that: a) our predictions when rendered should explain the available image evidence, and b) the inferred 3D structure should be geometrically consistent with learned pixel to surface mappings. We empirically show that our approach improves over prior work that leverages similar supervision, and in fact performs competitively to methods that use stronger supervision. Finally, as our method enables learning with limited supervision, we qualitatively demonstrate its applicability over a set of about 30 object categories.
研究动机与目标
- 通过仅使用类别级图像集合与近似实例分割,实现从单张RGB图像中推断3D形状、纹理和相机位姿。
- 避免在3D重建中依赖强监督信号,如3D标注、2D关键点或位姿标签。
- 学习一个类别特定的隐式形状空间,以捕捉姿态和形变等实例级变化。
- 通过几何一致性与重投影损失隐式构建监督信号,无需直接监督。
- 通过仅利用野外图像与弱标注,将3D重建扩展至多样化物体类别。
提出的方法
- 将3D形状表示为图像条件化的隐式函数,该函数将球体变形为预测的网格,并学习纹理预测。
- 通过可微分渲染损失,强制使渲染预测与输入图像保持一致。
- 引入局部像素到表面映射与全局3D形状预测之间的几何循环一致性损失,以提升几何保真度。
- 为每种类别使用单个3D模板作为初始化,并通过端到端学习从图像集合中微调。
- 通过结合重投影精度、边界对齐与刚性先验的多组件损失进行优化,以提升泛化能力。
- 利用前景掩码的弱监督,并在训练过程中隐式推断相机位姿。
实验结果
研究问题
- RQ1能否仅使用前景掩码作为监督信号,从未标注图像集合中准确推断出3D形状、纹理与相机位姿?
- RQ2如何利用局部像素到表面映射与全局3D预测之间的几何一致性,来在无显式监督下提升3D重建质量?
- RQ3在仅使用弱监督的情况下,隐式形状表示在多大程度上能捕捉姿态与形变等实例级变化?
- RQ4与使用更强监督(如2D关键点或3D模板)的先前方法相比,该方法的性能如何?
- RQ5该方法能否在包括无任何标注3D数据的物体类别上实现良好泛化?
主要发现
- 在PASCAL3D+数据集上,该方法实现了具有竞争力的3D重建性能,飞机类别的平均IoU为0.44,汽车类别的平均IoU为0.66,与使用更强监督的方法相当或更优。
- 在语义关键点重投影任务中,该方法达到54.1% PCK-P与41.3% PCK-T,优于先前的弱监督方法。
- 消融实验表明,若移除几何一致性损失(Lgcc),性能下降至50.5% PCK-P,证实了该损失的重要性。
- 边界对齐与刚性先验显著提升了定性结果,尤其在处理复杂形状与遮挡时表现更优。
- 该模型能有效泛化至ImageNet中的30种多样化类别,仅使用PointRend自动生成的掩码,成功捕捉了身体形态与头部姿态等变化。
- 尽管无直接监督,该方法仍能在可见与不可见区域生成有意义的纹理,展示了鲁棒的隐式纹理学习能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。