Skip to main content
QUICK REVIEW

[论文解读] Learning Object-Centric Representations of Multi-Object Scenes from Multiple Views

Nanbo Li, Cian Eastwood|arXiv (Cornell University)|Nov 13, 2021
Domain Adaptation and Few-Shot Learning被引用 19
一句话总结

MulMON 提出了一种无监督方法,通过在多个视角间迭代优化潜在对象特征,利用迭代推理和视角预测来解决空间模糊性问题,从而学习准确、以对象为中心的多对象场景表征。该方法在解缠、3D 结构捕捉方面表现更优,并首次实现了从新视角预测外观和分割图的新能力,优于单视角基线模型。

ABSTRACT

Learning object-centric representations of multi-object scenes is a promising approach towards machine intelligence, facilitating high-level reasoning and control from visual sensory data. However, current approaches for unsupervised object-centric scene representation are incapable of aggregating information from multiple observations of a scene. As a result, these "single-view" methods form their representations of a 3D scene based only on a single 2D observation (view). Naturally, this leads to several inaccuracies, with these methods falling victim to single-view spatial ambiguities. To address this, we propose The Multi-View and Multi-Object Network (MulMON) -- a method for learning accurate, object-centric representations of multi-object scenes by leveraging multiple views. In order to sidestep the main technical difficulty of the multi-object-multi-view scenario -- maintaining object correspondences across views -- MulMON iteratively updates the latent object representations for a scene over multiple views. To ensure that these iterative updates do indeed aggregate spatial information to form a complete 3D scene understanding, MulMON is asked to predict the appearance of the scene from novel viewpoints during training. Through experiments, we show that MulMON better-resolves spatial ambiguities than single-view methods -- learning more accurate and disentangled object representations -- and also achieves new functionality in predicting object segmentations for novel viewpoints.

研究动机与目标

  • 解决单视角无监督以对象为中心的方法因遮挡和部分视图导致的空间模糊性问题。
  • 通过聚合静态多对象场景的多个 2D 视图信息,实现准确、解缠的 3D 场景理解。
  • 通过在无显式匹配的情况下保持跨视角的对象对应关系,解决多对象多视角(MOMV)问题。
  • 引入新能力:预测未观测视角下的外观和对象分割图。
  • 通过将新视角预测作为训练信号,确保迭代更新聚合空间信息而非覆盖信息。

提出的方法

  • MulMON 使用空间混合模型和迭代推理,跨多个视角优化潜在对象表征。
  • 在跨视角的‘外层循环’中迭代更新对象表征的后验分布,以前一迭代的后验作为先验。
  • 在每个视角内,通过注意力机制的槽注意力和变分推理执行‘内层循环’迭代,以优化潜在特征。
  • 模型通过变分下界(ELBO)进行训练,其损失函数包含新视角预测的重建损失和鼓励不确定性减少的信息增益项。
  • 通过迭代优化和跨视角共享的槽注意力机制,隐式保持对象对应关系。
  • 该方法利用可微分渲染器,基于当前潜在表征预测查询视角下的观测结果和分割图。

实验结果

研究问题

  • RQ1通过在多个视角间迭代优化,能否通过解决单视角下的空间模糊性来提升以对象为中心的表征准确性?
  • RQ2与单视角基线相比,多对象多视角模型能否实现更优的对象属性与 3D 结构解缠?
  • RQ3该模型能否泛化至预测未观测视角下的外观和对象分割图?
  • RQ4视角数量(T)如何影响多对象设置下的不确定性减少与表征质量?
  • RQ5所提方法是否实现对象间与对象内解缠,从而支持可控的场景操作?

主要发现

  • MulMON 通过利用多视角信息显著降低了空间不确定性,如不确定性随 T 变化的曲线所示,仅经过几次观测后不确定性便迅速下降。
  • 在 CLE-MV 和 CLE-Aug 数据集上,根据 Eastwood 和 Williams 的评估协议,MulMON 学习到的表征比 IODINE 和 GQN 更具解缠性、更紧凑且信息量更丰富。
  • MulMON 有效捕捉了 3D 场景结构(如绕垂直轴旋转),并在操作过程中一致地在不同视角间广播此类信息。
  • 该模型首次实现了多对象多视角问题的可行解决方案,支持如基于新视角查询的物体分割等新功能。
  • 消融实验表明,视角数量(T)是最关键的超参数,即使观测数量较少,性能也能迅速提升。
  • MulMON 同时实现了对象间与对象内解缠,支持对单个对象或单个性质进行操作,而不影响其他对象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。