[论文解读] NeRF-SOS: Any-View Self-supervised Object Segmentation on Complex Scenes
NeRF-SOS 提出了一种自监督框架,通过协同对比损失联合利用外观和几何线索,在复杂真实场景中实现任意视角的对象分割。该方法在基于 NeRF 的对象分割任务中达到最先进性能,其分割质量和视角一致性均优于现有的 2D 自监督方法及有监督基线方法。
Neural volumetric representations have shown the potential that Multi-layer Perceptrons (MLPs) can be optimized with multi-view calibrated images to represent scene geometry and appearance, without explicit 3D supervision. Object segmentation can enrich many downstream applications based on the learned radiance field. However, introducing hand-crafted segmentation to define regions of interest in a complex real-world scene is non-trivial and expensive as it acquires per view annotation. This paper carries out the exploration of self-supervised learning for object segmentation using NeRF for complex real-world scenes. Our framework, called NeRF with Self-supervised Object Segmentation NeRF-SOS, couples object segmentation and neural radiance field to segment objects in any view within a scene. By proposing a novel collaborative contrastive loss in both appearance and geometry levels, NeRF-SOS encourages NeRF models to distill compact geometry-aware segmentation clusters from their density fields and the self-supervised pre-trained 2D visual features. The self-supervised object segmentation framework can be applied to various NeRF models that both lead to photo-realistic rendering results and convincing segmentation maps for both indoor and outdoor scenarios. Extensive results on the LLFF, Tank & Temple, and BlendedMVS datasets validate the effectiveness of NeRF-SOS. It consistently surpasses other 2D-based self-supervised baselines and predicts finer semantics masks than existing supervised counterparts. Please refer to the video on our project page for more details:https://zhiwenfan.github.io/NeRF-SOS.
研究动机与目标
- 在无需密集标注或每视角标注的情况下,实现复杂真实世界场景中的自监督 3D 对象分割。
- 克服现有方法依赖昂贵人工标注数据或合成数据进行对象发现的局限性。
- 将 2D 自监督视觉特征与 NeRF 的 3D 几何结构相结合,实现鲁棒且视角一致的分割。
- 开发一种可泛化的框架,适用于室内、室外及以物体为中心的多种 NeRF 变体和场景。
提出的方法
- 提出一种协同对比损失,联合优化外观级别和几何级别监督,以实现对象分割。
- 利用自监督 2D 视觉主干网络(如 DINO-ViT)提取外观特征,并在不同视角间形成紧凑的分割聚类。
- 引入一种几何感知对比损失,利用 NeRF 的密度场将 3D 结构信息注入分割聚类中。
- 采用两阶段训练策略:先预训练 NeRF,再使用对比损失微调分割头,避免优化冲突。
- 在蒸馏后的分割特征空间中应用无监督聚类,生成最终的对象掩码。
- 支持在 vanilla NeRF、NeRF++ 及其他 NeRF 变体上进行端到端训练,覆盖多种数据集。
实验结果
研究问题
- RQ1能否有效利用自监督 2D 视觉特征,在无每视角标注的 NeRF 中实现 3D 对象分割?
- RQ2如何利用 NeRF 的固有 3D 几何结构(通过密度场)提升分割的一致性和准确性?
- RQ3结合外观和几何线索的协同对比损失是否优于单一模态监督在对象分割中的表现?
- RQ4所提出的框架能否在包括无界室外环境在内的多样化真实世界场景中实现泛化?
- RQ5与联合优化 NeRF 和分割损失相比,两阶段训练策略在渲染质量和分割质量方面表现如何?
主要发现
- NeRF-SOS 在 LLFF、BlendedMVS、CO3Dv2 和 Tank & Temples 数据集上,持续优于最先进基于 2D 的自监督对象共分割方法。
- 在 CO3Dv2 数据集上,NeRF-SOS 达到 0.9686 的 mIoU,显著超越有监督的 Semantic-NeRF 基线模型。
- 在 NeRF++ 的无界 Truck 场景中,NeRF-SOS 生成的分割比有监督的 Semantic-NeRF++ 更精细,能正确识别侧后视镜和百叶窗缝隙等微小结构细节。
- 消融实验表明,若移除外观或几何对比损失,分割聚类将出现碎片化或不一致,证实两种组件均不可或缺。
- 联合训练 NeRF 和对比损失会同时降低渲染和分割性能,表明两阶段训练对优化稳定性至关重要。
- 使用 DINO-ViT 作为 2D 主干网络相比 ResNet50 能获得更优的分割质量,表明 ViT 基自监督特征在 3D 场景理解中具有优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。