Skip to main content
QUICK REVIEW

[论文解读] Object Scene Representation Transformer

Mehdi S. M. Sajjadi, Daniel Duckworth|arXiv (Cornell University)|Jun 14, 2022
Advanced Vision and Imaging被引用 11
一句话总结

OSRT 提出了一种以 3D 为中心的无监督神经场景表征模型,通过光场参数化和新型 Slot Mixer 解码器,在新颖视图合成的监督下学习到以物体为中心的分解。该方法在物体发现和 3D 一致性方面达到最先进性能,且相比之前的方法快超过 3,000 倍,因为其对每个像素仅需单次遍历渲染,与物体数量无关。

ABSTRACT

A compositional understanding of the world in terms of objects and their geometry in 3D space is considered a cornerstone of human cognition. Facilitating the learning of such a representation in neural networks holds promise for substantially improving labeled data efficiency. As a key step in this direction, we make progress on the problem of learning 3D-consistent decompositions of complex scenes into individual objects in an unsupervised fashion. We introduce Object Scene Representation Transformer (OSRT), a 3D-centric model in which individual object representations naturally emerge through novel view synthesis. OSRT scales to significantly more complex scenes with larger diversity of objects and backgrounds than existing methods. At the same time, it is multiple orders of magnitude faster at compositional rendering thanks to its light field parametrization and the novel Slot Mixer decoder. We believe this work will not only accelerate future architecture exploration and scaling efforts, but it will also serve as a useful tool for both object-centric as well as neural scene representation learning communities.

研究动机与目标

  • 从仅有的 RGB 图像中无监督地学习 3D 一致且以物体为中心的场景表征。
  • 克服先前以物体为中心的 3D 渲染方法中因需数千次解码遍历而产生的计算瓶颈。
  • 在推理时支持比训练时更多物体的场景泛化。
  • 仅使用 L2 损失且无需额外正则化或监督,实现高质量、3D 一致的物体分解。
  • 将以物体为中心的场景表征学习扩展到包含大量物体的复杂多样的场景中。

提出的方法

  • OSRT 使用带有光场参数化的场景表征 Transformer(SRT)主干网络,通过一次前向传播直接从潜在场景表征预测像素值。
  • 一个 Slot Attention 模块将集合嵌入的场景表征转换为以物体为中心的 Slot 场景表征,其中每个槽对应一个物体或背景部分。
  • 新型 Slot Mixer 解码器通过同时处理所有槽,实现高效、单次遍历的任意视图渲染,消除了对逐物体解码步骤的需求。
  • 模型通过像素重建的简单 L2 损失端到端训练,无需额外正则化、深度监督或显式背景建模。
  • 光场公式化确保了场景重建中的空间和 3D 一致性,即使没有显式 3D 监督。
  • 该架构支持学习初始化和随机初始化的槽,从而在具有比训练时更多物体的分布外场景中实现稳健泛化。

实验结果

研究问题

  • RQ1能否仅使用 RGB 图像和新颖视图合成作为监督信号,无监督地学习一种以 3D 为中心、以物体为中心的场景表征?
  • RQ2能否将以物体为中心的 3D 渲染计算成本从数千次解码遍历降低到每个像素仅一次前向传播?
  • RQ3该模型在推理时对训练中未见的更多物体的场景中泛化能力如何?
  • RQ4该模型在不同视图中保持物体分解的 3D 一致性程度如何?
  • RQ5缺乏显式监督(如深度图、实例分割掩码)是否会影响或提升物体发现的质量?

主要发现

  • 在具有挑战性的 MSN-Hard 数据集上,OSRT 达到 0.940 的 FG-ARI 比值,表明其物体分解具有高度的 3D 一致性。
  • 在仅使用 5 张输入视图的情况下,OSRT 的 FG-ARI 比值达到 0.987,表明在有限监督下仍具有极强的 3D 一致性。
  • OSRT 在测试时能有效泛化至包含 7–10 个物体的场景,使用随机槽初始化时,PSNR 达到 33.36,FG-ARI 达到 0.968。
  • 由于 Slot Mixer 解码器的引入,该模型比之前的方法快超过 3,000 倍,实现了与槽数量无关的单次遍历渲染。
  • 在 CLEVR-3D 数据集上,OSRT 在分布内场景中使用学习初始化时,PSNR 达到 40.84,FG-ARI 达到 0.996。
  • 尽管存在掩码渗漏和 Voronoi 网格划分失败等局限性,OSRT 在多样化且复杂的场景中仍保持了强劲性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。