[论文解读] A Universal Semantic-Geometric Representation for Robotic Manipulation
本论文提出语义-几何表征(Semantic-Geometric Representation, SGR),一种统一的感知模块,通过集合抽象模块将来自RGB图像的预训练2D语义特征与来自深度点云的3D几何特征相融合。SGR在模拟和真实世界机器人操作任务中均实现了最先进性能,能够泛化至未见过的语义属性(如颜色和形状),在单任务与多任务设置下显著优于R3M、CLIP和PerAct等方法。
Robots rely heavily on sensors, especially RGB and depth cameras, to perceive and interact with the world. RGB cameras record 2D images with rich semantic information while missing precise spatial information. On the other side, depth cameras offer critical 3D geometry data but capture limited semantics. Therefore, integrating both modalities is crucial for learning representations for robotic perception and control. However, current research predominantly focuses on only one of these modalities, neglecting the benefits of incorporating both. To this end, we present $ extbf{Semantic-Geometric Representation} ( extbf{SGR})$, a universal perception module for robotics that leverages the rich semantic information of large-scale pre-trained 2D models and inherits the merits of 3D spatial reasoning. Our experiments demonstrate that SGR empowers the agent to successfully complete a diverse range of simulated and real-world robotic manipulation tasks, outperforming state-of-the-art methods significantly in both single-task and multi-task settings. Furthermore, SGR possesses the capability to generalize to novel semantic attributes, setting it apart from the other methods. Project website: https://semantic-geometric-representation.github.io.
研究动机与目标
- 开发一种统一表征,结合来自2D视觉模型的丰富语义理解与来自深度数据的精确3D空间推理能力。
- 克服当前方法仅依赖2D或3D表征的局限性,这些局限性在复杂真实环境中阻碍了泛化能力。
- 实现对新语义属性(如训练期间未见的颜色或形状)的零样本泛化。
- 构建一种可扩展的、端到端的视觉-运动控制框架,无需针对特定任务进行工程设计,即可适用于多样化操作任务。
- 在多视角与单视角设置下验证SGR的有效性,包括在Franka Emika Panda机器人上的真实世界部署。
提出的方法
- 利用大规模预训练的2D视觉基础模型,从RGB图像中提取语义特征图。
- 将2D语义特征反投影至3D空间,并与通过基于点云的网络(如PointNeXt)提取的3D点云特征进行融合。
- 使用集合抽象(Set Abstraction, SA)模块联合建模2D语义与3D几何之间的跨模态交互,实现联合推理。
- 在RLBench基准上,通过行为克隆方法使用融合后的SGR特征作为输入,训练控制策略。
- 仅在必要时将RGB颜色信息引入几何分支,但表明由于缺乏对彩色点云的预训练,这会降低性能。
- 用随机初始化的编码器替换预训练编码器,以消融分析预训练的重要性,结果证实其在泛化中的关键作用。
实验结果
研究问题
- RQ1一种融合2D语义与3D几何信息的统一表征是否能显著提升机器人操作任务的性能?
- RQ2所提出的SGR模型是否能泛化至新语义属性(如未见过的颜色或形状)?
- RQ3在单视角与多视角相机设置下,SGR的性能表现如何,尤其是在几何理解方面?
- RQ4与从零开始训练相比,大规模数据上的预训练在多大程度上提升了泛化能力?
- RQ5SGR是否能在无需任务特定适配的情况下实现在真实世界部署中的强性能?
主要发现
- 在多任务学习中,SGR在RLBench基准上实现了68.6%的成功率,显著优于R3M(17.6%)、CLIP(30.2%)和PerAct(54.7%)。
- 在单任务学习中,SGR在8项任务上的平均成功率为75.7%,优于相同设置下的CLIP(56.0%)和R3M(38.0%)。
- 在真实世界的Franka Emika Panda机器人上,SGR在存在视觉干扰物的任务中优于强基线方法PerAct,表明其在复杂真实环境中的鲁棒性。
- 在仅使用前向摄像头的单视角设置下,SGR保持了55.3%的平均成功率,优于CLIP(29.7%)和R3M(31.5%),尽管几何信息有所减少。
- 消融研究显示,移除预训练编码器会导致性能显著下降,证实了预训练在泛化中的关键作用。
- 向几何分支添加RGB颜色信息会降低性能,表明当未在彩色点云上进行预训练时,模型对虚假特征较为敏感。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。