[论文解读] CBARF: Cascaded Bundle-Adjusting Neural Radiance Fields from Imperfect Camera Poses
CBARF 提出了一种级联的邻近替换策略,通过多阶段捆绑调整(BA)迭代优化神经辐射场(NeRF)中不准确或缺失的相机位姿,显著提升了在存在大范围位姿噪声或位姿不完整情况下的新视角合成质量。该方法在训练过程中无需真实位姿监督,即可在位姿优化和视角合成方面达到当前最优性能。
Existing volumetric neural rendering techniques, such as Neural Radiance Fields (NeRF), face limitations in synthesizing high-quality novel views when the camera poses of input images are imperfect. To address this issue, we propose a novel 3D reconstruction framework that enables simultaneous optimization of camera poses, dubbed CBARF (Cascaded Bundle-Adjusting NeRF).In a nutshell, our framework optimizes camera poses in a coarse-to-fine manner and then reconstructs scenes based on the rectified poses. It is observed that the initialization of camera poses has a significant impact on the performance of bundle-adjustment (BA). Therefore, we cascade multiple BA modules at different scales to progressively improve the camera poses. Meanwhile, we develop a neighbor-replacement strategy to further optimize the results of BA in each stage. In this step, we introduce a novel criterion to effectively identify poorly estimated camera poses. Then we replace them with the poses of neighboring cameras, thus further eliminating the impact of inaccurate camera poses. Once camera poses have been optimized, we employ a density voxel grid to generate high-quality 3D reconstructed scenes and images in novel views. Experimental results demonstrate that our CBARF model achieves state-of-the-art performance in both pose optimization and novel view synthesis, especially in the existence of large camera pose noise.
研究动机与目标
- 解决 NeRF 和 BARF 在三维重建过程中处理不准确或缺失相机位姿的局限性。
- 提升神经辐射场在相机位姿受大范围噪声污染或部分不可用情况下的鲁棒性。
- 开发一种无需训练阶段真实位姿监督的位姿优化框架,从而实现在真实图像集合中部署,尤其适用于位姿估计不可靠的场景。
- 通过级联 BA 和一种新型邻近替换策略,逐步优化相机位姿,从而提升新视角合成质量。
提出的方法
- CBARF 采用从粗到精的紧凑捆绑调整(BA)模块级联结构,逐步优化相机位姿,每一阶段均以前一阶段优化后的位姿作为初始化。
- 提出一种新准则,用于在 BA 后识别估计不佳的相机位姿,依据渲染图像质量并辅以非极大值抑制。
- 邻近替换策略将识别出的不准确位姿替换为邻近视角的位姿,以进一步降低位姿误差并提升场景一致性。
- 该框架使用密度体素网格实现高保真度的三维场景重建与新视角渲染,位姿优化完成后进行。
- 相机位姿优化以自监督方式完成,使用光度损失,训练过程中无真实位姿监督。
- 评估阶段应用普鲁斯特雷斯分析,将优化后的位姿与真实位姿对齐,以准确计算位姿误差。
实验结果
研究问题
- RQ1当初始位姿存在噪声或不准确时,级联捆绑调整框架能否提升 NeRF 中的相机位姿优化性能?
- RQ2在训练过程中无真实位姿监督的情况下,如何识别并纠正不准确的相机位姿?
- RQ3使用邻近相机位姿进行邻近替换在多大程度上能改善位姿优化与新视角合成质量?
- RQ4当 COLMAP 无法为部分图像估计位姿时,该方法在相机位姿缺失场景下的表现如何?
- RQ5该方法在具有挑战性的现实条件下,能否在位姿优化与视角合成两方面均达到当前最优性能?
主要发现
- CBARF 在相机位姿优化方面达到当前最优性能,在大范围位姿噪声条件下,其表现持续优于基线方法 BARF,甚至优于 COLMAP,在 NeRF-synthetic 数据集上表现突出。
- 在 BlendedMVS 数据集上,当 10% 的相机位姿缺失时,CBARF 生成的渲染图像质量优于 BARF,表明其具有更优的隐式位姿优化能力。
- 邻近替换策略通过用邻近视角的位姿替换估计不佳的位姿,有效降低了位姿误差,尤其在 BA 无法收敛的区域效果显著。
- 采用自适应阶段数的级联 BA 设计,相比单阶段 BA 使用过多迭代,能有效防止过拟合并降低计算成本。
- 渲染质量度量指标(如 PSNR、LPIPS)表明,即使输入位姿存在噪声或缺失,CBARF 生成的新视角在视觉和定量上均与真实图像相当。
- 该方法对全局位姿偏移具有鲁棒性,因为普鲁斯特雷斯对齐确保了在缺乏训练监督的情况下仍能准确评估位姿误差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。