Skip to main content
QUICK REVIEW

[论文解读] Multiview Aggregation for Learning Category-Specific Shape Reconstruction

Srinath Sridhar, Davis Rempe|arXiv (Cornell University)|Jul 1, 2019
3D Shape Modeling and Analysis参考文献 43被引用 14
一句话总结

该论文提出X-NOCS地图,一种新颖的3D形状表征方法,能够从可变数量的RGB视角中编码可见和被遮挡的表面。通过使用排列等变的2D卷积神经网络,它聚合多视角特征并执行高效的并集操作,以重建密集的、类别特定的形状,实现了SOTA性能,且随着视角数量增加而进一步提升。

ABSTRACT

We investigate the problem of learning category-specific 3D shape reconstruction from a variable number of RGB views of previously unobserved object instances. Most approaches for multiview shape reconstruction operate on sparse shape representations, or assume a fixed number of views. We present a method that can estimate dense 3D shape, and aggregate shape across multiple and varying number of input views. Given a single input view of an object instance, we propose a representation that encodes the dense shape of the visible object surface as well as the surface behind line of sight occluded by the visible surface. When multiple input views are available, the shape representation is designed to be aggregated into a single 3D shape using an inexpensive union operation. We train a 2D CNN to learn to predict this representation from a variable number of views (1 or more). We further aggregate multiview information by using permutation equivariant layers that promote order-agnostic view information exchange at the feature level. Experiments show that our approach is able to produce dense 3D reconstructions of objects that improve in quality as more views are added.

研究动机与目标

  • 为解决从可变数量的RGB视角(包括被遮挡区域)学习类别特定3D形状重建的挑战。
  • 设计一种形状表征方法,以兼容多视角聚合的方式编码可见和隐藏(被遮挡)的表面几何信息。
  • 通过排列等变层实现对视角顺序不敏感的多视角特征融合,以提升重建质量。
  • 实现随着添加更多视角而提升保真度的密集3D形状重建,且无需固定视角数量。
  • 在ShapeNet类别上的单视角和多视角重建基准中超越现有方法。

提出的方法

  • 提出X-NOCS地图作为NOCS地图的扩展,为每个像素编码从相机视角出发的最远表面点,从而捕捉被遮挡的几何结构。
  • 使用基于SegNet的2D卷积神经网络编码器-解码器,从单张RGB图像预测NOCS和X-NOCS地图,同时保持像素到3D空间的对应关系。
  • 对来自不同视角的多个预测NOCS和X-NOCS地图执行并集操作,以形成完整的3D形状估计。
  • 引入排列等变层,实现对视角顺序不敏感的多视角特征融合,促进信息的稳健交换。
  • 在可变数量视角上端到端训练模型,使测试时可对任意数量的视角进行推理。
  • 在标准NOCS空间中使用DLT进行相机位姿估计,实现跨视角的一致3D形状对齐。

实验结果

研究问题

  • RQ1深度学习模型能否从可变数量的RGB视角中准确重建未见物体实例的密集3D形状?
  • RQ2如何通过单一表征同时编码可见和被遮挡的表面几何信息,以支持多视角聚合?
  • RQ3与独立处理各视角相比,排列等变特征融合在多视角3D形状重建中的提升程度如何?
  • RQ4随着输入视角数量的增加,重建质量是否持续提升?模型在测试时能否泛化到不同视角数量?
  • RQ5与现有3D重建方法相比,所提出的X-NOCS表征在精度和细节保留方面表现如何?

主要发现

  • 所提方法在汽车、飞机和椅子类别上实现了SOTA的单视角重建性能,其Chamfer距离分别为0.1569、0.1855和0.3803,优于DPC。
  • 在五视角条件下,该方法将椅子类别的Chamfer距离降低至0.1576,显著优于3D-R2N2在相同条件下的0.1932。
  • 随着视角数量的增加,重建质量持续提升,证明了多视角聚合的有效性。
  • 定性结果表明,该方法能捕捉扶手和复杂轮廓等精细细节,而3D-R2N2即使在五视角条件下也难以重建这些特征。
  • 排列等变网络在不同输入视角顺序下均表现出稳健性能,证实了无序特征融合的成功。
  • X-NOCS表征能够准确预测可见和隐藏的表面几何结构,在形状补全方面优于基线NOCS地图。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。