Skip to main content
QUICK REVIEW

[论文解读] Neural Groundplans: Persistent Neural Scene Representations from a Single Image

Prafull Sharma, Ayush Tewari|arXiv (Cornell University)|Jul 22, 2022
Advanced Vision and Imaging被引用 8
一句话总结

本文提出神经地基图——一种自监督的、与地面平面对齐的二维条件特征网格,用于从单张图像重建持久的三维场景表征。通过在训练过程中利用多视角视频中的运动线索,该方法实现了静态与动态场景成分的解耦,从而支持新视角合成、三维实例分割、边界框预测以及通过简单启发式方法在动态地基图上实现直观的三维编辑。

ABSTRACT

We present a method to map 2D image observations of a scene to a persistent 3D scene representation, enabling novel view synthesis and disentangled representation of the movable and immovable components of the scene. Motivated by the bird's-eye-view (BEV) representation commonly used in vision and robotics, we propose conditional neural groundplans, ground-aligned 2D feature grids, as persistent and memory-efficient scene representations. Our method is trained self-supervised from unlabeled multi-view observations using differentiable rendering, and learns to complete geometry and appearance of occluded regions. In addition, we show that we can leverage multi-view videos at training time to learn to separately reconstruct static and movable components of the scene from a single image at test time. The ability to separately reconstruct movable objects enables a variety of downstream tasks using simple heuristics, such as extraction of object-centric 3D representations, novel view synthesis, instance-level segmentation, 3D bounding box prediction, and scene editing. This highlights the value of neural groundplans as a backbone for efficient 3D scene understanding models.

研究动机与目标

  • 从单张图像观测中无监督地学习持久的三维场景表征。
  • 利用未标注的多视角视频中的运动作为监督信号,解耦静态背景与可移动的前景物体。
  • 支持下游三维场景理解任务,如新视角合成、实例级分割、三维边界框预测与三维编辑。
  • 开发一种内存高效的、基于二维的神经场景表征,通过二维卷积神经网络实现对三维查询和位移等变处理。
  • 仅使用自监督学习,在复杂的真实世界场景中实现三维对象发现与新视角合成的最先进性能。

提出的方法

  • 提出条件神经地基图:一种与地面平面对齐的二维特征网格,通过可微渲染和在未标注多视角视频上的自监督训练进行学习。
  • 使用从三维到二维的投影机制,将三维点映射到地基图中的特征,通过多层感知机解码器实现三维查询。
  • 通过在训练过程中利用多视角视频数据中的运动线索,分别训练静态与动态场景成分的神经地基图。
  • 对从动态地基图导出的密度图应用连通区域标记,实现无监督的三维实例分割。
  • 通过双线性插值直接操作动态地基图特征,实现三维场景编辑,支持对象删除、插入与刚体变换。
  • 采用基于可微体积渲染的自监督损失,优化几何与外观重建,无需真实标签或实例标签。

实验结果

研究问题

  • RQ1能否仅通过无标注多视角视频的自监督学习,从单张图像重建持久的三维场景表征?
  • RQ2能否在推理阶段利用多视角视频中的运动线索,从单张图像实现静态与动态场景成分的解耦?
  • RQ3二维神经地基图表征能否支持高质量的新视角合成与遮挡区域的几何补全?
  • RQ4能否通过在动态地基图上应用简单启发式方法,实现无需实例标注的三维实例级分割与三维边界框预测?
  • RQ5神经地基图能否通过直接操作特征网格实现直观的三维场景编辑?

主要发现

  • 在 CLEVR 数据集上,该方法在三维对象发现任务中达到最先进性能,在输入视角的调整兰德指数(ARI)上与 uORF 相当(ARI: 0.92),在新视角上的表现更优(NV-ARI: 0.89 vs. 0.86)。
  • 在具有挑战性的 CoSY 数据集上,该方法成功分割出多个汽车实例,并能对部分观测到的物体预测三维边界框,而 uORF 在此类情况下失败。
  • 由于在未畸变的地基图上采用位移等变的二维卷积神经网络处理,该模型在遮挡区域的新视角合成质量优于以往基于像素对齐的方法。
  • 通过在密度图上应用连通区域分析,动态地基图可实现高精度的三维实例分割与三维边界框预测,且无需任何实例级监督。
  • 通过直接操作动态地基图特征,实现三维场景编辑,支持对象删除、插入与刚体变换,利用特征的双线性插值实现。
  • 该方法在三维对象发现任务上优于以往的自监督方法,表明多视角数据中的运动线索可被有效利用,实现从单张图像的解耦。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。