Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Multi-View Object Segmentation Using Radiance Field Propagation

Xinhang Liu, Jiaben Chen|arXiv (Cornell University)|Oct 2, 2022
Computer Graphics and Visualization Techniques被引用 6
一句话总结

本文提出辐射场传播(RFP),一种利用神经辐射场进行多视角3D物体分割的无监督方法,通过双向光度损失实现自监督语义场学习。RFP在3D场景分割任务中达到当前最优的无监督性能,并可在无需任何标注或先验物体知识的情况下实现单个物体的渲染与编辑。

ABSTRACT

We present radiance field propagation (RFP), a novel approach to segmenting objects in 3D during reconstruction given only unlabeled multi-view images of a scene. RFP is derived from emerging neural radiance field-based techniques, which jointly encodes semantics with appearance and geometry. The core of our method is a novel propagation strategy for individual objects' radiance fields with a bidirectional photometric loss, enabling an unsupervised partitioning of a scene into salient or meaningful regions corresponding to different object instances. To better handle complex scenes with multiple objects and occlusions, we further propose an iterative expectation-maximization algorithm to refine object masks. RFP is one of the first unsupervised approach for tackling 3D real scene object segmentation for neural radiance field (NeRF) without any supervision, annotations, or other cues such as 3D bounding boxes and prior knowledge of object class. Experiments demonstrate that RFP achieves feasible segmentation results that are more accurate than previous unsupervised image/scene segmentation approaches, and are comparable to existing supervised NeRF-based methods. The segmented object representations enable individual 3D object editing operations.

研究动机与目标

  • 解决在无任何标注、3D边界框或类别先验条件下,无监督3D多视角物体分割的挑战。
  • 利用神经辐射场中的3D几何与外观一致性,实现自监督语义场学习。
  • 在存在遮挡和多个物体的复杂场景中,实现准确且一致的3D物体分割。
  • 支持下游应用,如仅使用未标注的多视角图像实现单个3D物体的渲染与编辑。
  • 通过利用3D场景表示与体素渲染,克服2D分割方法的局限性。

提出的方法

  • 该方法采用分层场景表示,将每个物体和背景分别建模为独立的辐射场。
  • 提出一种新颖的辐射场传播策略,将物体区域的外观统计信息传递至非物体区域,以指导语义场学习。
  • 提出一种双向光度损失,以最大化错误渲染图像的误差(来自传播的外观),同时最小化正确渲染图像的误差,从而实现自监督。
  • 采用迭代期望-最大化(EM)算法,以在存在多个物体和遮挡的场景中优化物体掩码。
  • 该方法依赖预训练的特征提取器进行初始化,但训练过程中不使用任何标注数据。
  • 最终输出支持通过学习到的、分割后的NeRF实现自由视角渲染与单个3D物体的编辑。

实验结果

研究问题

  • RQ1能否仅使用未标注的多视角图像和标定相机位姿,在真实场景中实现3D物体分割?
  • RQ2在无任何标注或先验知识的情况下,如何有效利用自监督学习提升3D场景理解能力?
  • RQ3在存在遮挡的复杂场景中,结合双向光度损失的辐射场传播能否提升分割精度?
  • RQ4无监督多视角分割在3D场景理解中,相较于现有无监督2D图像分割方法,性能提升的幅度如何?
  • RQ5所生成的分割NeRF能否支持实际的3D编辑操作,如物体复制、平移与旋转?

主要发现

  • RFP在3D多视角物体分割任务中达到当前最优的无监督性能,在表1的所有指标上均优于先前的无监督方法。
  • 在新视角评估中,RFP取得98.5%的N-Acc与94.1%的N-mIoU,超越所有其他无监督方法。
  • 得益于3D感知的双向光度损失,该方法显著减少了锯齿边缘、孔洞与误检,相比基线方法表现更优。
  • 基于EM的优化方法在存在多个物体的复杂场景中提升了掩码质量,使边界更清晰、更准确。
  • RFP实现了高质量的单个物体渲染与自由视角编辑,包括复制、平移与旋转等操作,且无需人工标注。
  • 消融实验证实,辐射场传播与双向光度损失对实现稳健性能均至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。