Skip to main content
QUICK REVIEW

[论文解读] Learning to Detect 3D Reflection Symmetry for Single-View Reconstruction

Yichao Zhou, Shichen Liu|arXiv (Cornell University)|Jun 17, 2020
Advanced Vision and Imaging参考文献 53被引用 5
一句话总结

本文提出 SymmetryNet,一种几何感知的深度学习框架,能够从单张 RGB 图像中检测 3D 反射对称平面,并利用这些平面构建平面扫掠代价体积,以实现高精度的深度估计。通过利用图像内部像素在对称性下的对应关系,该方法在深度图精度和泛化能力方面达到当前最优水平,即使在非对称或未见过的物体上也优于纯数据驱动的方法。

ABSTRACT

3D reconstruction from a single RGB image is a challenging problem in computer vision. Previous methods are usually solely data-driven, which lead to inaccurate 3D shape recovery and limited generalization capability. In this work, we focus on object-level 3D reconstruction and present a geometry-based end-to-end deep learning framework that first detects the mirror plane of reflection symmetry that commonly exists in man-made objects and then predicts depth maps by finding the intra-image pixel-wise correspondence of the symmetry. Our method fully utilizes the geometric cues from symmetry during the test time by building plane-sweep cost volumes, a powerful tool that has been used in multi-view stereopsis. To our knowledge, this is the first work that uses the concept of cost volumes in the setting of single-image 3D reconstruction. We conduct extensive experiments on the ShapeNet dataset and find that our reconstruction method significantly outperforms the previous state-of-the-art single-view 3D reconstruction networks in term of the accuracy of camera poses and depth maps, without requiring objects being completely symmetric. Code is available at https://github.com/zhou13/symmetrynet.

研究动机与目标

  • 通过引入几何先验,特别是反射对称性,来解决单目 3D 重建的病态问题,以提升精度与泛化能力。
  • 开发一种深度学习框架,通过粗到细策略从单张 RGB 图像中检测 3D 镜像平面。
  • 利用对称性诱导的像素对应关系构建平面扫掠代价体积,以实现深度预测,增强几何一致性。
  • 通过依赖几何线索而非纯数据驱动模式,提升对未见物体类别和真实世界图像的泛化能力。
  • 证明基于对称性的几何先验在重建保真度与鲁棒性方面优于纯学习方法。

提出的方法

  • 该方法使用主干特征提取器将输入 RGB 图像编码为多尺度特征。
  • 可微分的特征投影模块通过图像内对称对应关系将特征投影,构建平面扫掠代价体积。
  • 代价体积网络利用反射对称性带来的几何约束,处理这些 3D 代价体积以预测深度图。
  • 通过粗到细策略执行镜像平面检测,实现对 3D 对称平面的精确定位。
  • 该框架将几何先验整合到端到端学习流程中,使网络能够从基于对称性的光度一致性中学习。
  • 通过分析概率张量中多个深度假设的一致性,实现深度置信度估计。

实验结果

研究问题

  • RQ1反射对称性是否能在单目 RGB 图像中有效检测,以指导 3D 重建?
  • RQ2基于图像内部对称对应关系构建的平面扫掠代价体积是否能提升深度估计精度?
  • RQ3与纯数据驱动方法相比,引入几何对称性先验是否能增强对未见物体类别的泛化能力?
  • RQ4该方法在对称性不完美或非对称的真实世界物体上的表现如何?
  • RQ5网络是否能通过分析基于对称性的对应关系一致性,学习到可靠的深度置信度?

主要发现

  • SymmetryNet 在深度图精度和相机位姿估计方面显著优于当前最先进的单目重建网络,即使在对称性不完美时也表现优异。
  • 由于依赖几何线索,该方法在未见类别(如船只和沙发)上表现出良好的泛化能力,这些类别未出现在训练数据中。
  • 在真实世界图像上,基于 ShapeNet 合成数据训练的模型仍能生成高质量的深度图和准确的对称平面。
  • 可视化结果表明,SymmetryNet 生成的深度图更清晰,细节恢复更好,尤其在扶手椅扶手和书桌框架等复杂部位表现更优。
  • 深度置信度图显示,不确定性仅出现在遮挡区域、非对称区域或无纹理区域——与几何预期一致。
  • 该方法在对称与非对称情况下均表现出优越性能,证明了基于对称性的几何先验具有强大鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。