Skip to main content
QUICK REVIEW

[论文解读] StructFormer: Learning Spatial Structure for Language-Guided Semantic Rearrangement of Novel Objects

Weiyu Liu, Chris Paxton|arXiv (Cornell University)|Oct 19, 2021
Robot Manipulation and Learning被引用 7
一句话总结

该论文提出 StructFormer,一种基于 Transformer 的模型,通过联合推理空间结构与多对象关系约束,实现对新物体的语言引导语义重排。在模拟复杂排列(如圆形和餐桌布置)中,其成功率达到 58%,相较于基于成对关系的基线模型在复杂结构上提升 52%,并将干扰物的非必要操作减少了 19%。

ABSTRACT

Geometric organization of objects into semantically meaningful arrangements pervades the built world. As such, assistive robots operating in warehouses, offices, and homes would greatly benefit from the ability to recognize and rearrange objects into these semantically meaningful structures. To be useful, these robots must contend with previously unseen objects and receive instructions without significant programming. While previous works have examined recognizing pairwise semantic relations and sequential manipulation to change these simple relations none have shown the ability to arrange objects into complex structures such as circles or table settings. To address this problem we propose a novel transformer-based neural network, StructFormer, which takes as input a partial-view point cloud of the current object arrangement and a structured language command encoding the desired object configuration. We show through rigorous experiments that StructFormer enables a physical robot to rearrange novel objects into semantically meaningful structures with multi-object relational constraints inferred from the language command.

研究动机与目标

  • 使机器人能够将新物体重新排列成复杂且具有语义意义的空间结构,如圆形、线条、塔状结构和餐桌布置。
  • 解决在包含未见过物体和干扰物的非结构化环境中进行语言引导操作的挑战。
  • 开发一种基于多对象关系约束推理而非依赖成对空间关系的规划系统。
  • 创建一种无需特定对象模型或大量重新编程即可跨物体类型和结构泛化的系统。
  • 在仿真和真实机器人上验证该方法,证明其在现实环境中的适用性。

提出的方法

  • StructFormer 使用 Transformer 编码器联合编码当前物体排列的 3D 点云和描述期望配置的结构化语言指令。
  • 该模型根据语言指令中的指代表达(包括直接指代和关系指代)预测需要移动的物体。
  • 一个自回归的 Transformer 解码器为每个选定物体生成目标 3D 姿态,实现物体放置的顺序预测。
  • 该架构在通过程序化生成的 4 种结构(圆形、线条、塔状结构、餐桌布置)数据集上进行训练,使用了 335 种真实世界物体模型。
  • 物体选择与姿态生成是解耦的:物体选择器识别相关物体,姿态生成器规划其空间排列。
  • 系统部署于 Franka Panda 机器人上,采用 RGB-D 感知,使用学习到的抓取策略和 RRT-connect 进行运动规划。

实验结果

研究问题

  • RQ1神经网络能否联合推理多物体空间关系与语言指令,以生成新物体的有效语义重排?
  • RQ2与依赖成对空间关系相比,建模复杂空间结构(如圆形、餐桌布置)在成功率和鲁棒性方面表现如何?
  • RQ3该模型在无需微调的情况下,对新物体和未见过的排列泛化能力有多强?
  • RQ4该系统在重排过程中减少对非目标干扰物的非必要操作有多有效?
  • RQ5该系统是否能在真实世界非结构化环境中于物理机器人上实现可靠性能?

主要发现

  • 在 156 个测试场景中,完整系统在仿真中的成功率为 37%,其中 58/156(37%)成功构建了期望的语义结构。
  • 在需要多物体推理的复杂结构(圆形和餐桌布置)上,StructFormer 相较于 Binary 基线模型成功率达到 52% 的提升(112 个成功结构中的 58 个)。
  • 在较简单结构(线条和塔状结构)上,StructFormer 相较于 Binary 基线模型成功率达到 15% 的提升(额外成功 95 个中的 14 个)。
  • 该模型将平均干扰物操作次数减少了 19%(每次 episode 为 0.17 vs. 0.21),表明在杂乱场景中具有更好的相关性过滤能力。
  • 在真实机器人实验中,系统成功在真实世界的 Franka Panda 机器人上执行了重排任务,尽管失败主要源于物体感知错误和不可达姿态。
  • 物体选择网络在 61% 的场景中正确识别了所有查询物体,在 83% 的场景中正确识别了 70% 的指定物体,表明其在指代表达定位任务中具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。