[论文解读] SORNet: Spatial Object-Centric Representations for Sequential Manipulation
SORNet 是一种基于视觉的框架,通过将标准物体视角作为查询,从 RGB 图像中学习以物体为中心的表征,从而在顺序操作任务中实现对新物体的零样本泛化。它在空间推理任务(如空间关系分类和相对方向回归)中优于最先进方法,并实现了无需微调的现实世界模拟到现实的迁移以及任务规划。
Sequential manipulation tasks require a robot to perceive the state of an environment and plan a sequence of actions leading to a desired goal state. In such tasks, the ability to reason about spatial relations among object entities from raw sensor inputs is crucial in order to determine when a task has been completed and which actions can be executed. In this work, we propose SORNet (Spatial Object-Centric Representation Network), a framework for learning object-centric representations from RGB images conditioned on a set of object queries, represented as image patches called canonical object views. With only a single canonical view per object and no annotation, SORNet generalizes zero-shot to object entities whose shape and texture are both unseen during training. We evaluate SORNet on various spatial reasoning tasks such as spatial relation classification and relative direction regression in complex tabletop manipulation scenarios and show that SORNet significantly outperforms baselines including state-of-the-art representation learning techniques. We also demonstrate the application of the representation learned by SORNet on visual-servoing and task planning for sequential manipulation on a real robot.
研究动机与目标
- 开发一种表示学习框架,支持在无需显式 6D 姿态估计的情况下,进行顺序操作任务中的物体级推理。
- 仅使用标准物体视角作为查询,实现对具有未见形状和纹理的新物体的零样本泛化。
- 学习空间对齐的、可微的嵌入,以支持下游规划和控制中的逻辑与连续空间推理。
- 通过从原始 RGB 输入中提供可扩展、可泛化的以物体为中心的表征,弥合端到端学习与基于模型的规划之间的差距。
- 展示所学表征在真实世界操作任务中的可迁移性,包括视觉伺服控制和开环规划。
提出的方法
- SORNet 使用神经网络从 RGB 图像中提取对象嵌入,条件基于一组标准物体视角,这些视角作为对象查询。
- 该模型在标准视角与输入图像之间采用交叉注意力机制,以关注相关对象区域并生成特定于对象的嵌入。
- 该框架通过对比学习目标端到端训练,以对齐同一对象在不同视角和场景中的嵌入。
- 通过将 SORNet 嵌入与读出头结合,执行空间推理任务(如分类,例如空间谓词)或回归(例如,3D 方向向量)。
- 该方法通过依赖标准视角的语义和空间一致性,而非实例特定的标注,实现对新物体的零样本泛化。
- 该架构设计为对物体数量和场景构成不变,支持场景中任意数量的物体。
实验结果
研究问题
- RQ1基于视觉的模型能否从 RGB 图像中学习到以物体为中心的表征,实现对具有未见形状和纹理的新物体的零样本泛化?
- RQ2所学表征能否同时支持离散的逻辑推理(例如,空间谓词)和连续的空间推理(例如,3D 方向回归)?
- RQ3SORNet 的表征在多大程度上可实现从仿真到真实世界操作的迁移,而无需微调?
- RQ4SORNet 嵌入能否在顺序操作任务的下游规划与控制流程中有效使用?
- RQ5在空间推理基准测试中,SORNet 的性能与最先进场景级表示学习方法相比如何?
主要发现
- SORNet 在复杂桌面操作场景中的空间关系分类和相对方向回归任务中达到最先进性能,优于场景级表示基线方法。
- 该模型在未见的家用物体(包括未见颜色和形状)上实现零样本泛化,在真实世界测试场景中对谓词分类表现出高准确率。
- 在模拟到现实的迁移中,SORNet 在无需任何微调的情况下,能准确预测真实世界场景中的空间谓词,展现出强大的域泛化能力。
- SORNet 在真实机器人上实现了对包含未见物体的顺序操作任务的成功开环规划,仅使用 SORNet 预测的谓词作为状态输入。
- 通过在 SORNet 嵌入上添加简单的 MLP 头,该模型能够通过回归 3D 方向和距离实现有效的视觉伺服控制,实现实时末端执行器运动控制。
- 尽管仅使用 RGB 输入进行训练,所学嵌入仍包含丰富的 3D 空间信息,从而在无显式深度监督的情况下实现度量上有意义的运动引导。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。