[论文解读] NoPe-NeRF: Optimising Neural Radiance Field with No Pose Prior
NoPe-NeRF 提出了一种端到端可微分的方法,用于从无初始位姿的 RGB 序列中联合优化神经辐射场(NeRF)和相机位姿,利用未畸变的单目深度先验,在大范围相机运动下稳定位姿估计。通过显式优化深度图的尺度和偏移参数,并引入帧间 Chamfer 距离损失与基于表面的光度损失,该方法在真实世界室内和室外序列上的新视角合成与位姿精度方面优于当前最先进基线方法。
Training a Neural Radiance Field (NeRF) without pre-computed camera poses is challenging. Recent advances in this direction demonstrate the possibility of jointly optimising a NeRF and camera poses in forward-facing scenes. However, these methods still face difficulties during dramatic camera movement. We tackle this challenging problem by incorporating undistorted monocular depth priors. These priors are generated by correcting scale and shift parameters during training, with which we are then able to constrain the relative poses between consecutive frames. This constraint is achieved using our proposed novel loss functions. Experiments on real-world indoor and outdoor scenes show that our method can handle challenging camera trajectories and outperforms existing methods in terms of novel view rendering quality and pose estimation accuracy. Our project page is https://nope-nerf.active.vision.
研究动机与目标
- 解决在缺乏预计算相机位姿的情况下训练 NeRF 的挑战,尤其是在大范围或动态相机运动下。
- 克服在无初始位姿的 NeRF 训练中因形状-辐射模糊性及缺乏相对位姿约束而导致的不稳定与收敛缓慢问题。
- 通过将单目深度先验整合到 NeRF 优化流程中,提升位姿估计精度与新视角合成质量。
- 通过端到端可微分优化 NeRF 与相机位姿,消除对 SfM 或 SLAM 流程的依赖,直接从原始 RGB 序列进行联合优化。
提出的方法
- 在 NeRF 训练过程中显式优化每个单目深度图的尺度与偏移参数,以校正畸变并生成多视角一致的深度图。
- 引入相邻帧深度图之间的基于 Chamfer 距离的损失,将相对位姿约束注入优化过程。
- 应用基于深度的表面渲染损失,强制 NeRF 表面的光度一致性,进一步正则化位姿估计。
- 将这些新型损失与标准 NeRF 渲染损失结合,以端到端可微分的方式联合优化神经辐射场与相机位姿。
- 利用轻量级单目深度估计作为几何先验,避免对多视角立体匹配或多视角相机参数输入的依赖。
实验结果
研究问题
- RQ1在相机位姿无法预先获取的情况下,单目深度先验是否能有效稳定 NeRF 训练?
- RQ2在 NeRF 优化过程中,如何从原始单目深度预测生成未畸变且多视角一致的深度图?
- RQ3在大范围相机运动下,帧间相对位姿约束在多大程度上能提升联合 NeRF 与位姿优化的准确性和鲁棒性?
- RQ4与标准 NeRF 训练相比,集成基于深度的表面渲染损失是否能显著提升位姿估计与新视角合成质量?
主要发现
- NoPe-NeRF 在 ScanNet 上实现 31.86 的平均 PSNR,在 Tanks and Temples 上实现 26.73,优于 COLMAP+NeRF 及其他 SOTA 方法,新视角合成质量更优。
- 该方法将 ScanNet 上的平均相对位姿误差(RPE)降低至平移方向 0.181,旋转方向 0.031,显著优于基线方法。
- 消融实验表明,若移除尺度/偏移优化,RPE 增加超过 2 倍,证明了深度畸变校正的关键作用。
- 帧间 Chamfer 距离损失($L_{pc}$)与表面光度损失($L_{rgb-s}$)是提升位姿估计性能的主要驱动力,其移除导致 RPE 增加超过 2 倍。
- 单阶段的 NoPe-NeRF 方法优于两阶段的 Ours-r 变体,表明端到端优化结合深度先验比顺序精炼更有效。
- 在低纹理且以旋转为主的挑战性序列中,NoPe-NeRF 避免了 COLMAP 的失败模式,生成无伪影的新视角。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。