[论文解读] Learning Multi-Object Dynamics with Compositional Neural Radiance Fields
该论文提出了一种组合式、以物体为中心的动力学模型,利用神经辐射场(NeRFs)和图神经网络(GNNs)从多视角图像中学习多物体场景的动力学。通过使用隐式编码器将每个物体编码为3D感知的潜在向量,并通过组合式NeRF渲染重建场景,该方法实现了稳定、长期的动力学预测,并能泛化到未见的物体数量,在模拟和真实世界实验中均优于非组合式基线模型,适用于刚性与可变形物体。
We present a method to learn compositional multi-object dynamics models from image observations based on implicit object encoders, Neural Radiance Fields (NeRFs), and graph neural networks. NeRFs have become a popular choice for representing scenes due to their strong 3D prior. However, most NeRF approaches are trained on a single scene, representing the whole scene with a global model, making generalization to novel scenes, containing different numbers of objects, challenging. Instead, we present a compositional, object-centric auto-encoder framework that maps multiple views of the scene to a set of latent vectors representing each object separately. The latent vectors parameterize individual NeRFs from which the scene can be reconstructed. Based on those latent vectors, we train a graph neural network dynamics model in the latent space to achieve compositionality for dynamics prediction. A key feature of our approach is that the latent vectors are forced to encode 3D information through the NeRF decoder, which enables us to incorporate structural priors in learning the dynamics models, making long-term predictions more stable compared to several baselines. Simulated and real world experiments show that our method can model and learn the dynamics of compositional scenes including rigid and deformable objects. Video: https://dannydriess.github.io/compnerfdyn/
研究动机与目标
- 为解决从图像观测中学习组合式、多物体动力学的挑战,特别是当泛化到训练时未见的物体数量的场景时。
- 通过使用NeRF作为物体特定潜在向量的解码器,将强3D归纳偏置引入潜在动力学模型。
- 通过NeRF-based重建和在潜在空间中使用自适应邻接矩阵的GNN,实现3D结构约束,提升长期预测的稳定性。
- 通过确保稳定且清晰的图像预测,使潜在空间中的RRT-based规划方法得以有效应用。
- 在模拟和真实世界环境中,展示对未见物体数量及复杂动力学(包括可变形物体)的有效泛化能力。
提出的方法
- 隐式物体编码器将多视角图像映射为一组物体特定的潜在向量,每个向量编码一个独立的3D物体。
- 每个潜在向量参数化一个独立的NeRF,通过从新视角进行组合式渲染实现3D感知的场景重建。
- 图神经网络(GNN)动力学模型在潜在空间中运行,边特征通过边编码器学习,节点更新通过节点传播网络实现。
- 物体之间的邻接矩阵基于模型自身的预测结果估计,从而实现对物体相互作用的自适应建模。
- 该框架使用可微分渲染管道,强制跨视角的3D一致性,从而提升潜在向量质量与3D泛化能力。
- 基于RRT的规划方法在潜在空间中应用,其可行性依赖于长期预测的稳定性。
实验结果
研究问题
- RQ1具有NeRF解码器的组合式、以物体为中心的自编码器能否将动力学预测泛化到训练时未见的物体数量的场景?
- RQ2通过NeRF-based重建引入3D归纳偏置,是否相比基于2D图像的基线方法能提升长期动力学预测的稳定性?
- RQ3在潜在空间中,基于GNN的动力学模型若能获取预测的物体相互作用信息,是否能比非组合式模型实现更准确、更稳定的长期预测?
- RQ4该方法在真实世界场景中,对刚性与可变形物体(包括未见物体数量)的泛化能力如何?
- RQ5与全局场景表示相比,为每个物体使用独立的NeRF是否即使在单物体场景中也能提升性能?
主要发现
- 与非组合式基线相比,该方法在长期预测时间跨度内显著降低了图像重建和预测误差,即使在15步预测后,相对图像误差仍保持较低水平。
- 在长颈鹿和鞋子的真实世界实验中,模型在15步预测中始终保持低图像误差(低于0.05),优于迅速退化的基线模型。
- 该模型能有效泛化到训练时物体数量更少的场景,例如仅包含一只鞋或沙模的场景,而基线模型因分布偏移而失效。
- 即使在绳索的可变形物体实验中,该方法仍保持稳定预测,优于密集GNN和CNN-based解码器变体,展现出对形状变化的鲁棒性。
- 为每个物体使用独立NeRF可实现自适应邻接矩阵学习,即使在单物体场景中也能提升性能,体现了组合式设计的优势。
- 由于实现了稳定且清晰的图像预测,该框架成功支持了潜在空间中的RRT-based规划,验证了其在下游控制任务中的实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。