Skip to main content
QUICK REVIEW

[论文解读] Same Object, Different Grasps: Data and Semantic Knowledge for Task-Oriented Grasping

Adithyavairavan Murali, Weiyu Liu|arXiv (Cornell University)|Nov 12, 2020
Robot Manipulation and Learning参考文献 45被引用 18
一句话总结

本文提出了 TaskGrasp 数据集——涵盖 191 种物体和 56 种任务的 25 万条任务导向抓取数据——并提出 GCNGrasp 框架,一种利用知识图谱和词嵌入中的语义知识的图神经网络方法,以实现对未见过的物体和任务的抓取策略泛化。与不使用语义推理的基线方法相比,该方法在保留任务上的性能提升了 12%,在保留物体上的性能提升了 3.5%。

ABSTRACT

Despite the enormous progress and generalization in robotic grasping in recent years, existing methods have yet to scale and generalize task-oriented grasping to the same extent. This is largely due to the scale of the datasets both in terms of the number of objects and tasks studied. We address these concerns with the TaskGrasp dataset which is more diverse both in terms of objects and tasks, and an order of magnitude larger than previous datasets. The dataset contains 250K task-oriented grasps for 56 tasks and 191 objects along with their RGB-D information. We take advantage of this new breadth and diversity in the data and present the GCNGrasp framework which uses the semantic knowledge of objects and tasks encoded in a knowledge graph to generalize to new object instances, classes and even new tasks. Our framework shows a significant improvement of around 12% on held-out settings compared to baseline methods which do not use semantics. We demonstrate that our dataset and model are applicable for the real world by executing task-oriented grasps on a real robot on unknown objects. Code, data and supplementary video could be found at https://sites.google.com/view/taskgrasp

研究动机与目标

  • 为解决任务导向机器人抓取领域中缺乏大规模、多样化数据集的问题,特别是在物体多样性与任务多样性方面。
  • 通过将物体和任务的语义知识整合到学习框架中,以弥合机器人抓取中的泛化差距。
  • 通过结构化的语义推理,实现对新物体实例、新物体类别及未见任务的鲁棒零样本泛化。
  • 通过资格测试和多数投票机制的质量控制,利用 Amazon Mechanical Turk 扩展人类标注的数据采集规模,用于 3D 任务导向抓取。
  • 通过在真实物理机器人上对未知物体执行任务导向抓取,验证方法在现实世界中的适用性。

提出的方法

  • TaskGrasp 数据集通过 Amazon Mechanical Turk 收集,采用两阶段标注流程:首先评估每种物体的任务适用性,然后为有效的任务-物体对标注 6-DOF 抓取。
  • 每条抓取通过 RGB-D 点云和多个 2D 可视化图像进行标注,以减少在 2D 界面中进行 3D 标注时的歧义。
  • 利用 WordNet 构建知识图谱,以编码物体与任务之间的层次关系和语义关联(例如,mug → container → instrumentality → entity)。
  • GCNGrasp 使用图卷积网络(GCN)在知识图谱上进行推理,将图谱信息与物体的点云特征以及来自预训练语言模型的任务嵌入进行融合。
  • 模型采用多视角点云表示,并端到端学习以预测特定任务的抓取,语义先验显著提升了泛化能力。
  • 通过资格测试和每条抓取由三位标注者独立标注,采用多数投票机制确保标签质量。

实验结果

研究问题

  • RQ1大规模、多样化的任务导向抓取数据集是否能超越稳定抓取,提升机器人抓取的泛化能力?
  • RQ2来自知识图谱和预训练词嵌入的语义知识在多大程度上能提升对新物体和新任务的零样本泛化能力?
  • RQ3在物体与任务之间引入结构化的语义关系,在保留设置下的抓取策略性能上能提升多少?
  • RQ4能否通过质量控制机制,在大规模场景下可靠地利用众包方式收集人类标注的 3D 抓取数据?
  • RQ5学习到的抓取策略是否能无需微调即泛化到真实世界中未知物体的执行?

主要发现

  • TaskGrasp 数据集包含 250,000 条任务导向抓取,涵盖 191 种真实世界物体和 56 种不同任务,其规模和多样性相较以往数据集提升了 10 倍。
  • 与不使用语义知识的基线方法相比,GCNGrasp 在保留任务上实现了 12% 的绝对性能提升,在保留物体类别上实现了 3.5% 的性能提升。
  • 使用基于 WordNet 的层次结构知识图谱和预训练词嵌入显著增强了泛化能力,尤其在零样本设置下表现突出。
  • 通过资格测试和三位标注者冗余标注的标注流程,实现了高标签一致性,性能在三位标注者时趋于饱和。
  • 该框架成功实现了对新物体实例和类别的泛化,真实机器人部署结果证实了其在仿真之外的实际适用性。
  • 消融实验表明,语义知识对泛化至关重要,缺乏语义知识的模型无法超越已见数据的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。