[论文解读] In-Place Scene Labelling and Understanding with Implicit Scene Representation
本文提出 Semantic-NeRF,一种场景特定的神经隐式表示方法,仅使用稀疏或噪声较大的现场标注,即可联合编码三维几何、辐射度和语义信息。通过利用 NeRF 的多视角一致性与平滑性,该方法实现了高质量的 2D 语义标注、标签去噪、超分辨率以及多视角融合,仅需极少监督——在仅 10% 标注像素的情况下达到 88.4% 的 mIoU。
Semantic labelling is highly correlated with geometry and radiance reconstruction, as scene entities with similar shape and appearance are more likely to come from similar classes. Recent implicit neural reconstruction techniques are appealing as they do not require prior training data, but the same fully self-supervised approach is not possible for semantics because labels are human-defined properties. We extend neural radiance fields (NeRF) to jointly encode semantics with appearance and geometry, so that complete and accurate 2D semantic labels can be achieved using a small amount of in-place annotations specific to the scene. The intrinsic multi-view consistency and smoothness of NeRF benefit semantics by enabling sparse labels to efficiently propagate. We show the benefit of this approach when labels are either sparse or very noisy in room-scale scenes. We demonstrate its advantageous properties in various interesting applications such as an efficient scene labelling tool, novel semantic view synthesis, label denoising, super-resolution, label interpolation and multi-view semantic label fusion in visual semantic mapping systems.
研究动机与目标
- 在全量标注不可行的新场景中,实现对 3D 语义场景的准确理解。
- 利用 NeRF 的几何与辐射度先验,提升在稀疏或噪声标注下的语义标注性能。
- 开发一种自监督、场景特定的方法,联合学习几何、外观与语义,无需预训练模型或大规模数据集。
- 展示交互式标注、标签去噪、超分辨率与多视角语义融合等实际应用。
- 证明隐式神经表示可仅通过弱监督有效实现跨视角的语义标签传播。
提出的方法
- 在神经辐射场(NeRF)基础上增加一个语义头,通过单一隐式 3D 表示联合预测几何、辐射度与语义类别概率。
- 使用同一场景的带位姿 RGB 图像与稀疏或噪声语义标签,端到端训练网络,无需几何监督。
- 利用 NeRF 隐式 3D 表示带来的多视角一致性与自相似性,高效实现跨视角的标签传播。
- 通过可微分渲染过程,基于视角间光度一致性监督语义预测。
- 采用多任务损失函数,结合 NeRF 的体素渲染损失、语义交叉熵损失与一致性正则化项。
- 采用单一隐式 MLP 表示整个场景,实现高分辨率、连续的语义标注。
实验结果
研究问题
- RQ1单一隐式神经表示能否联合建模几何、外观与语义,从而在极少监督下实现准确的语义标注?
- RQ2隐式 3D 表示在跨多个视角传播稀疏或噪声语义标签方面的有效性如何?
- RQ3NeRF 的几何与辐射度先验在开放集、真实世界场景中,对提升语义分割性能的贡献程度如何?
- RQ4在无需真实深度监督的情况下,联合表示能否优于基于深度信息的多视角融合方法?
- RQ5标签密度与质量在所提框架中对语义标签传播性能的影响程度如何?
主要发现
- 仅需每类一个标注像素,该方法即可实现 60.2% 的平均交并比(mIoU),证明了从极少监督中实现强大泛化的能力。
- 将标注比例提升至每类 10% 的像素后,mIoU 提升至 88.4%,表明仅需适度标注工作量即可获得显著性能提升。
- 在多视角语义融合任务中,该方法实现 68.0% 的 mIoU,优于贝叶斯融合与平均融合基线方法,即使后者使用真实深度信息。
- 通过利用平滑且一致的隐式表示,可有效实现标签去噪与超分辨率,对低质量或粗糙标签进行优化。
- 该方法可实现高保真新颖视角合成,同时保留语义标签的精细结构与物体边界,适用于多样化的相机位姿。
- 该框架支持交互式标注,模型可识别并请求最具信息量的标签以解决语义模糊性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。