[论文解读] Panoptic NeRF: 3D-to-2D Label Transfer for Panoptic Urban Scene Segmentation
Panoptic NeRF 提出了一种 3D 到 2D 的标签迁移方法,利用 NeRF 联合优化几何与语义信息,通过使用粗粒度的 3D 边界框原始体和噪声较大的 2D 语义预测,生成高质量、多视角一致的全景分割标签。该方法在 KITTI-360 数据集上实现了最先进性能,通过双语义场与语义引导的几何优化,融合 3D 和 2D 监督信号,在准确率和一致性方面均取得提升。
Large-scale training data with high-quality annotations is critical for training semantic and instance segmentation models. Unfortunately, pixel-wise annotation is labor-intensive and costly, raising the demand for more efficient labeling strategies. In this work, we present a novel 3D-to-2D label transfer method, Panoptic NeRF, which aims for obtaining per-pixel 2D semantic and instance labels from easy-to-obtain coarse 3D bounding primitives. Our method utilizes NeRF as a differentiable tool to unify coarse 3D annotations and 2D semantic cues transferred from existing datasets. We demonstrate that this combination allows for improved geometry guided by semantic information, enabling rendering of accurate semantic maps across multiple views. Furthermore, this fusion process resolves label ambiguity of the coarse 3D annotations and filters noise in the 2D predictions. By inferring in 3D space and rendering to 2D labels, our 2D semantic and instance labels are multi-view consistent by design. Experimental results show that Panoptic NeRF outperforms existing label transfer methods in terms of accuracy and multi-view consistency on challenging urban scenes of the KITTI-360 dataset.
研究动机与目标
- 为解决城市场景中像素级语义分割与实例分割标注的高成本与高劳动强度问题。
- 通过利用噪声较大的 2D 预测作为弱监督信号,提升从粗粒度 3D 边界框原始体到密集 2D 全景标签的标签迁移准确率。
- 通过在 3D 空间中进行推理,确保生成的 2D 标签具备多视角与时空一致性。
- 通过联合优化解决 3D 边界框原始体重叠区域的标签歧义性,并降低 2D 预测中的噪声。
- 实现端到端、完全自动化的标签迁移,无需人工后处理,利用可微分渲染与语义引导实现。
提出的方法
- 该方法采用基于 NeRF 的辐射场,并引入双语义场:一个来自 3D 边界框原始体的固定语义场,另一个来自 2D 预测的可学习语义场。
- 通过固定语义场并利用 2D 语义线索优化几何结构,实现语义引导的几何优化。
- 通过可学习语义场融合 3D 原始体标签与 2D 噪声预测,执行联合几何与语义优化,以解决标签歧义性问题。
- 模型通过组合 3D 监督损失($\mathcal{L}^{\text{3D}}_{\mathbf{s}}$)、2D 监督损失($\mathcal{L}^{\text{2D}}_{\mathbf{S}}$)与光度损失($\mathcal{L}_p$)进行训练,并采用射线掩码提升采样效率。
- 通过体素渲染将 3D 学习的语义场投影到 2D 图像,生成跨视角一致的全景标签。
- 该方法采用一种新颖的采样策略,在输入视角稀疏的情况下提升几何重建质量。
实验结果
研究问题
- RQ1是否可以通过在 3D 空间中联合优化几何与语义,而非在 2D 空间中进行,来提升 3D 到 2D 的标签迁移性能?
- RQ2当仅有稀疏视角可用时,语义引导的几何优化是否能提升重建质量?
- RQ3通过融合粗粒度 3D 边界框原始体与噪声较大的 2D 预测,是否能够解决标签歧义性并降低 2D 预测中的噪声?
- RQ43D 推理是否能天然生成多视角一致的 2D 全景分割标签?
- RQ5与现有的 2D 到 2D 及 3D 到 2D 标签迁移基线方法相比,该方法在准确率与一致性方面表现如何?
主要发现
- Panoptic NeRF 在 KITTI-360 数据集上实现了 mIoU 为 81.4,准确率为 94.5,优于现有的 3D 到 2D 与 2D 到 2D 标签迁移方法。
- 消融实验表明,若移除 2D 监督损失($\mathcal{L}^{\text{2D}}_{\mathbf{S}}$),mIoU 会下降至 70.7,证明其在优化可学习语义场中的关键作用。
- 固定语义场($s_{\beta}$)显著提升了几何质量,若将其移除,深度误差增加且物体边界变得模糊。
- 完整模型在所有组件均启用时,实现了最低的光度损失(5.23)与最高的 mIoU(81.4),证实了完整优化流程的有效性。
- 即使使用如 Deeplab 与 PSPNet 等预训练 2D 模型作为伪真实标签(pseudo GT),Panoptic NeRF 仍表现更优,mIoU 分别达到 79.3 与 75.9,表明其对噪声较大的 2D 输入具有强鲁棒性。
- 该方法实现了跨视角的全局一致实例标注,每个物体通过 3D 边界框原始体被分配唯一的实例 ID。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。