[论文解读] DeepSFM: Structure From Motion Via Deep Bundle Adjustment
DeepSFM 提出了一种用于运动结构重建(SfM)的深度学习框架,通过两种可微分代价体积迭代优化三维深度和相机位姿:基于深度的代价体积(D-CV)用于强制执行图像一致性和几何一致性,基于位姿的代价体积(P-CV)通过假设的相机运动强制执行一致性。该方法在噪声或稀疏初始位姿和深度估计下表现出卓越的鲁棒性,实现了最先进性能。
Structure from motion (SfM) is an essential computer vision problem which has not been well handled by deep learning. One of the promising trends is to apply explicit structural constraint, e.g. 3D cost volume, into the network. However, existing methods usually assume accurate camera poses either from GT or other methods, which is unrealistic in practice. In this work, we design a physical driven architecture, namely DeepSFM, inspired by traditional Bundle Adjustment (BA), which consists of two cost volume based architectures for depth and pose estimation respectively, iteratively running to improve both. The explicit constraints on both depth (structure) and pose (motion), when combined with the learning components, bring the merit from both traditional BA and emerging deep learning technology. Extensive experiments on various datasets show that our model achieves the state-of-the-art performance on both depth and pose estimation with superior robustness against less number of inputs and the noise in initialization.
研究动机与目标
- 解决基于深度学习的 SfM 方法缺乏显式几何约束且依赖精确初始相机位姿的局限性。
- 通过将物理先验整合到深度学习框架中,克服传统 SfM 在无纹理或非朗伯表面场景下的脆弱性。
- 通过模拟束调整的迭代特性,即使在初始估计存在噪声或稀疏的情况下,也能实现深度与位姿的鲁棒联合优化。
- 通过将可微分、迭代的架构嵌入照片一致性和几何一致性,弥合传统几何 SfM 与端到端深度学习之间的差距。
提出的方法
- 提出一种受束调整启发的物理驱动深度网络,使用两种不同的可微分代价体积:D-CV 用于深度估计,P-CV 用于位姿优化。
- D-CV 通过将像素反投影到离散深度平面,测量不同视图间图像特征和深度值的差异,计算光度一致性和几何一致性代价。
- P-CV 执行类似的代价计算,但通过假设相机移动到离散位置,测量光度和几何差异以优化位姿。
- 网络在 D-CV 和 P-CV 推理之间交替进行迭代优化步骤,以类似坐标下降的方式逐步提升深度和位姿估计。
- 初始深度通过传统 3D 代价体积获得;初始位姿由直接回归模型(如 DeMoN)推导,支持从弱监督进行端到端训练。
- 迭代过程避免了展开列文伯格-麦马尔夸特(Levenberg–Marquardt, LM)优化的内存和计算瓶颈,支持更多次迭代,收敛效果优于先前方法。
实验结果
研究问题
- RQ1深度学习框架能否有效将显式的几何约束——光度一致性和几何一致性——嵌入网络中,实现联合 SfM 优化?
- RQ2当使用噪声或不准确的相机位姿初始化时,基于深度学习的 SfM 方法与传统束调整相比性能如何?
- RQ3通过 D-CV 和 P-CV 的迭代优化,与单次前向传播相比,深度和位姿估计的性能提升程度如何?
- RQ4当输入图像数量减少或输入位姿受到噪声污染时,该方法是否仍保持鲁棒性?
- RQ5将物理先验整合到可微分架构中,是否能在泛化能力和准确性方面超越端到端回归式 SfM 模型?
主要发现
- DeepSFM 在 DeMoN、ScanNet、ETH3D 和 Tanks and Temples 数据集上均达到最先进性能,优于传统 SfM(如 COLMAP)和最先进深度学习方法。
- 在 ETH3D 数据集上,DeepSFM 在相同视图数量下将深度误差降低一半,或在仅使用一半输入图像时达到与 COLMAP 相当的误差水平。
- 当通过图像下采样或帧子采样降低输入位姿质量时,DeepSFM 保持稳定性能,而 COLMAP 和 R-MVSNet 显著下降。
- 迭代优化过程约在四轮后收敛,深度和位姿误差持续下降,表明两者之间存在有效的相互改进。
- 消融研究显示,P-CV 模块显著提升了位姿估计性能,尤其在初始阶段深度噪声较大的情况下。
- 相机轨迹和 3D 重建的可视化结果表明,即使在低纹理或反光表面等挑战性场景中,输出也更高质量且更稳定。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。