Skip to main content
QUICK REVIEW

[论文解读] Learning to Reconstruct 3D Manhattan Wireframes from a Single Image

Yichao Zhou, Haozhi Qi|arXiv (Cornell University)|May 17, 2019
3D Surveying and Cultural Heritage参考文献 33被引用 7
一句话总结

本文提出一种深度学习方法,通过使用统一的卷积神经网络联合检测2D拐点、线条、深度和消失点,从单张RGB图像重建出精确的3D曼哈顿线框。该方法利用平行性等全局结构先验,生成紧凑且几何一致的3D线框表示,在合成与真实城市场景中均实现了最先进的2D线框检测(提升4个点的AP)和鲁棒的3D重建效果。

ABSTRACT

In this paper, we propose a method to obtain a compact and accurate 3D wireframe representation from a single image by effectively exploiting global structural regularities. Our method trains a convolutional neural network to simultaneously detect salient junctions and straight lines, as well as predict their 3D depth and vanishing points. Compared with the state-of-the-art learning-based wireframe detection methods, our network is simpler and more unified, leading to better 2D wireframe detection. With global structural priors from parallelism, our method further reconstructs a full 3D wireframe model, a compact vector representation suitable for a variety of high-level vision tasks such as AR and CAD. We conduct extensive evaluations on a large synthetic dataset of urban scenes as well as real images. Our code and datasets have been made public at https://github.com/zhou13/shapeunity.

研究动机与目标

  • 解决在不依赖深度传感器或多视角设置的情况下,从单张RGB图像恢复3D场景几何结构的挑战。
  • 开发一种统一的深度学习框架,联合预测2D线框组件(拐点、线条)及其3D深度,同时估计消失点。
  • 利用全局结构先验(特别是曼哈顿几何与平行性)实现鲁棒且精确的3D线框重建。
  • 生成适合AR、CAD及高层视觉任务的紧凑向量化3D线框表示。
  • 在合成城市数据集和真实图像上评估该方法,验证其泛化能力与鲁棒性。

提出的方法

  • 训练一个单一的卷积神经网络,从单张图像中同时检测C型拐点、T型拐点、直线,并预测其3D深度与消失点。
  • 网络采用统一的损失函数,结合2D线框检测、深度预测与消失点估计,实现几何关系的端到端优化。
  • 在后处理阶段施加几何约束(如曼哈顿世界中的线段平行性与正交性),以优化3D线框几何结构。
  • 通过图像平面上线段的聚类进行消失点估计,随后利用几何一致性与深度先验进行优化。
  • 采用非线性优化方法对深度进行细化,以确保与估计的消失点及线段几何的一致性,从而提升深度精度。
  • 最终通过使用预测的深度与消失点约束,将2D检测结果投影到3D空间,构建3D线框。

实验结果

研究问题

  • RQ1单个深度神经网络能否以高精度联合预测2D线框组件(拐点、线条)及其3D深度?
  • RQ2曼哈顿世界中的全局几何先验(如平行性与正交性)在从单张图像重建3D线框方面有多有效?
  • RQ3联合学习拐点类型(C型拐点与T型拐点)在多大程度上提升了3D重建质量?
  • RQ4与当前最先进的2D线框检测与3D重建技术相比,该方法在精度与鲁棒性方面表现如何?
  • RQ5所生成的3D线框表示能否有效用于新视角合成与高层视觉任务?

主要发现

  • 该方法在2D线框检测任务上相比基线方法[12]实现了4个百分点的平均精度(AP)提升,尽管参数量更少(19M vs. 30M)。
  • 网络性能显著优于为线条与拐点分别训练分支的方案,证明联合优化是性能提升的关键。
  • 通过神经网络实现的消失点检测达到2.69°的平均角度误差与2.3%的失败率,鲁棒性优于LSD/J-Linkage方法,尽管在成功情况下的误差略高。
  • 深度细化使65%的测试样本中SILog误差降低,表明来自消失点的几何约束可有效提升深度精度。
  • 该方法在合成与真实图像上均生成视觉合理且几何一致的3D线框,新视角合成结果展现出连贯的3D结构。
  • 系统在真实城市场景中表现出良好的泛化能力,包括复杂结构如大本钟,且不易受纹理线条或表面图案干扰。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。