[论文解读] NeRF-Det: Learning Geometry-Aware Volumetric Representation for Multi-View 3D Object Detection
NeRF-Det 通过联合训练 NeRF 分支与检测头,利用共享的 MLP,在仅使用 RGB 图像的情况下,提出了一种几何感知的体积化表示方法,用于多视角 3D 目标检测。该方法在无需每场景 NeRF 优化的情况下,实现了最先进性能,在 ScanNet 和 ARKITScenes 上分别将 mAP 提升了 3.9 和 3.1,同时实现了可泛化的新视角合成与深度估计。
We present NeRF-Det, a novel method for indoor 3D detection with posed RGB images as input. Unlike existing indoor 3D detection methods that struggle to model scene geometry, our method makes novel use of NeRF in an end-to-end manner to explicitly estimate 3D geometry, thereby improving 3D detection performance. Specifically, to avoid the significant extra latency associated with per-scene optimization of NeRF, we introduce sufficient geometry priors to enhance the generalizability of NeRF-MLP. Furthermore, we subtly connect the detection and NeRF branches through a shared MLP, enabling an efficient adaptation of NeRF to detection and yielding geometry-aware volumetric representations for 3D detection. Our method outperforms state-of-the-arts by 3.9 mAP and 3.1 mAP on the ScanNet and ARKITScenes benchmarks, respectively. We provide extensive analysis to shed light on how NeRF-Det works. As a result of our joint-training design, NeRF-Det is able to generalize well to unseen scenes for object detection, view synthesis, and depth estimation tasks without requiring per-scene optimization. Code is available at \url{https://github.com/facebookresearch/NeRF-Det}.
研究动机与目标
- 解决仅使用 RGB 图像、无深度传感器时,在室内场景中进行 3D 目标检测的挑战。
- 克服现有方法中依赖模糊 3D 体素表示所导致的隐式几何建模局限性。
- 在不引入每场景优化延迟的前提下,将 NeRF 强大的几何归纳偏置整合到 3D 检测中。
- 在无需为每个场景重新训练的前提下,实现检测、新视角合成和深度估计在未见场景中的泛化能力。
- 通过 NeRF 与检测分支的联合训练范式,利用多视角一致性提升检测性能。
提出的方法
- 在 NeRF 与检测分支之间引入共享 MLP,以实现从 NeRF 到图像特征的梯度流动,从而改善几何感知表征。
- 从高分辨率图像特征图中沿射线采样特征,而非从低分辨率体素特征中采样,以保留空间细节。
- 通过引入空间统计量(均值与方差)和颜色信息作为几何先验,增强 NeRF 在未见场景中的泛化能力。
- 将预测的密度场转换为不透明度场,并调制体素特征,以抑制空旷区域,提升检测准确率。
- 通过多视角一致性损失(光度损失)和可选的深度监督,端到端联合训练 NeRF 与检测分支。
- 在推理阶段移除 NeRF 分支,从而在保留几何感知特征的同时最小化计算开销。
实验结果
研究问题
- RQ1NeRF 是否可在无需每场景优化的前提下,有效集成到 3D 目标检测中,以保持效率?
- RQ2NeRF 与检测分支的联合训练在几何建模与检测性能方面带来了多大提升?
- RQ3图像级几何先验(如均值、方差、颜色)在多大程度上增强了 NeRF 对未见场景的泛化能力?
- RQ4NeRF 分支是否可在无需每场景微调的前提下,泛化至新视角合成与深度估计?
- RQ5光度损失与深度监督在 NeRF 基于几何学习的检测任务中,各自贡献如何?
主要发现
- 在 ScanNet 上,NeRF-Det 实现了 50.1 mAP@0.25 和 24.4 mAP@0.50,优于 SOTA 3.9 mAP。
- 在 ARKITScenes 上,NeRF-Det 实现了 50.0 mAP@0.25 和 24.2 mAP@0.50,优于 SOTA 3.1 mAP。
- 使用图像特征采样而非体素特征采样,使 mAP 提升 0.7,新视角合成的 PSNR 提升 1.58。
- 与仅使用均值特征相比,引入方差与颜色特征后,mAP@0.25 与 mAP@0.50 分别提升 0.7 和 0.6。
- NeRF 分支在未见场景中泛化良好,新视角合成 PSNR 达 20.51,深度估计 RMSE 为 0.756,且无需每场景优化。
- 移除检测分支后,NeRF 性能略有提升(PSNR 20.94 vs 20.51),表明检测分支可能抑制了对 NeRF 有用的低级细节。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。