[论文解读] GARF: Gaussian Activated Radiance Fields for High Fidelity Reconstruction and Pose Estimation
GARF 提出了一种无需位置嵌入的神经辐射场方法,采用高斯激活函数以实现从不完美初始位姿出发的高保真 3D 场景重建与鲁棒相机位姿估计。通过比传统激活函数更有效地保持一阶梯度,GARF 在低纹理场景中优于 SOTA 方法如 BARF 和 ref-NeRF,且无需复杂的超参数调优或初始化策略。
Despite Neural Radiance Fields (NeRF) showing compelling results in photorealistic novel views synthesis of real-world scenes, most existing approaches require accurate prior camera poses. Although approaches for jointly recovering the radiance field and camera pose exist (BARF), they rely on a cumbersome coarse-to-fine auxiliary positional embedding to ensure good performance. We present Gaussian Activated neural Radiance Fields (GARF), a new positional embedding-free neural radiance field architecture - employing Gaussian activations - that outperforms the current state-of-the-art in terms of high fidelity reconstruction and pose estimation.
研究动机与目标
- 消除联合 NeRF 与位姿优化中繁琐的粗到细位置嵌入调度需求。
- 在相机位姿初始化不完美或存在噪声的情况下,提升场景重建与位姿估计的鲁棒性。
- 探究高斯激活函数作为坐标 MLP 中位置编码的替代方案在 3D 场景表示中的有效性。
- 在不依赖复杂超参数调优的情况下,实现视图合成与位姿精度的 SOTA 性能。
- 证明高斯激活网络在真实世界低纹理场景中的可行性,这些场景中 SfM 流水线常会失效。
提出的方法
- 提出一种新型坐标 MLP 架构,使用高斯激活函数替代传统的 ReLU 或正弦激活函数。
- 采用自包含的网络设计,消除输入嵌入中对位置编码层的需求。
- 利用理论洞察:高斯激活函数在反向传播过程中能更好地保持目标函数的一阶梯度。
- 将高斯激活 MLP 应用于体素渲染框架中,实现新视角合成,联合优化辐射场与相机位姿。
- 采用标准训练协议,包括 Adam 优化器、权重衰减与分层采样,但无需位置嵌入调度。
- 使用 Procrustes 分析评估位姿精度,通过将优化后的位姿与真实 SfM 估计对齐。
实验结果
研究问题
- RQ1高斯激活函数能否在保持或提升联合场景重建与位姿估计性能的同时,替代 NeRF 中的位置编码?
- RQ2使用高斯激活函数是否能在存在噪声或不准确初始相机位姿的情况下,带来更优的梯度流动?
- RQ3像 GARF 这类无位置嵌入的架构能否在真实世界场景(包括低纹理区域)中实现视图合成与位姿精度的 SOTA 表现?
- RQ4当初始相机位姿不完美时,GARF 与 BARF 和 ref-NeRF 在鲁棒性与收敛性方面有何差异?
- RQ5激活函数的选择对联合辐射场与位姿学习的优化动态有何影响?
主要发现
- 在 fortress 场景中,GARF 达到 SOTA 的 PSNR 29.09,优于 BARF(28.48)与 ref-NeRF(25.62),表明其视图合成保真度更优。
- 在具有挑战性的 leaves 场景中,GARF 的 PSNR 达到 19.72,显著优于 BARF(23.53)与 ref-NeRF(14.42),表明其在低纹理区域具有更强鲁棒性。
- 在 leaves 场景中,GARF 将平均旋转误差降低至 0.13°,而 BARF 为 1.00°,表明其位姿估计精度更高。
- 在 room 场景中,GARF 实现 PSNR 31.90 与 SSIM 0.94,优于 BARF 与 ref-NeRF,在逼真视图合成方面表现更优。
- GARF 在所有场景中均保持高性能,包括复杂几何与低纹理场景,且无需精细调校超参数或初始化方案。
- 图 6 与图 7 的定性结果表明,即使在 iPhone 拍摄的低纹理场景中,GARF 也能生成更清晰、无伪影的新视角,而 ref-NeRF 在此类场景中会失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。