Skip to main content
QUICK REVIEW

[论文解读] Semantic Photometric Bundle Adjustment on Natural Sequences

Rui Zhu, Chaoyang Wang|arXiv (Cornell University)|Nov 30, 2017
Robotics and Sensor-Based Localization参考文献 22被引用 3
一句话总结

本文提出语义光度束调整(PBA),将基于深度学习的3D形状先验整合进光度优化框架,以实现从自然图像序列中密集、精确的3D重建。通过利用语义先验,该方法在低纹理条件或视点覆盖有限的情况下,仍能实现最先进的深度精度与重建密度,同时保持SLAM级别的相机位姿估计与PBA级别的光度一致性。

ABSTRACT

The problem of obtaining dense reconstruction of an object in a natural sequence of images has been long studied in computer vision. Classically this problem has been solved through the application of bundle adjustment (BA). More recently, excellent results have been attained through the application of photometric bundle adjustment (PBA) methods -- which directly minimize the photometric error across frames. A fundamental drawback to BA & PBA, however, is: (i) their reliance on having to view all points on the object, and (ii) for the object surface to be well textured. To circumvent these limitations we propose semantic PBA which incorporates a 3D object prior, obtained through deep learning, within the photometric bundle adjustment problem. We demonstrate state of the art performance in comparison to leading methods for object reconstruction across numerous natural sequences.

研究动机与目标

  • 解决经典方法与光度束调整(PBA)在物体纹理差或仅部分可见时,难以从自然序列中重建密集3D形状的局限性。
  • 将深度学习中学习得到的3D形状先验整合进PBA优化流程,以提升重建密度与鲁棒性。
  • 在无需大量视点覆盖或高纹理的情况下,实现在自然序列中精确、全局一致的6DoF相机位姿估计与密集深度图恢复。
  • 通过在推理时强制执行光度一致性,弥合基于深度学习的3D重建与几何优化之间的差距。

提出的方法

  • 该方法构建了一个语义PBA目标函数,联合优化相机位姿与深度图,同时引入由深度神经网络生成的3D形状先验。
  • 利用学习到的形状先验(如来自ShapeNet的数据)作为几何先验,对优化过程进行正则化,从而在点自遮挡或纹理差时仍能实现重建。
  • 通过最小化跨帧的光度误差,利用估计的相机位姿将重建的3D形状重投影至图像平面,以实现一致性。
  • 以经典PBA的结果(如Ham等人[11])作为初始化,提供强基线,提升收敛性与精度。
  • 在优化过程中施加轮廓与深度约束,进一步正则化解。
  • 构建了一个新数据集,包含渲染序列与自然序列,附带真实相机位姿、深度图及与CAD对齐的形状,用于评估。

实验结果

研究问题

  • RQ1在经典PBA因纹理差或可见性有限而失效的自然图像序列中,学习到的3D形状先验是否能显著提升3D重建的密度与精度?
  • RQ2将语义先验整合进PBA优化流程后,对相机位姿初始化误差较大的情况,其收敛鲁棒性如何提升?
  • RQ3在真实世界自然序列中,语义PBA在深度精度与重建密度方面,相较于经典PBA与基于深度学习的方法,其性能提升程度如何?
  • RQ4在推理时强制执行光度一致性,并结合形状先验,是否能产生比端到端学习方法更可靠、几何上更一致的3D重建?

主要发现

  • 在渲染序列上,所提方法达到0.0627的深度误差与0.9342的重建密度,优于Ham等人(0.0682深度误差,0.4732密度)与openMVS(0.0731深度误差,0.5862密度)。
  • 在自然序列上,方法实现0.0756的深度误差与0.9076的重建密度,显著优于openMVS(0.0798深度误差,0.6987密度)与Ham等人(0.0804深度误差,0.6558密度)。
  • 该方法对初始化误差表现出优越的鲁棒性,即使在较大的初始位姿误差下也能可靠收敛,如图8所示,其收敛稳定性优于Zhu等人[26]。
  • 得益于语义形状先验,该方法实现了SLAM级别的相机位姿估计,同时生成的深度图密度高于openMVS与Ham等人。
  • 定性结果表明,即使仅使用两帧图像,该方法仍能生成完整的3D形状与全局一致的相机轨迹,而经典PBA方法在如此低观测条件下完全失效。
  • 基于合成数据训练的生成方法(如[3, 6])在自然序列上存在域差距问题,而所提方法由于在推理时强制执行几何一致性,仍保持强大性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。