Skip to main content
QUICK REVIEW

[论文解读] Spatial Attention Point Network for Deep-learning-based Robust Autonomous Robot Motion Generation

Hideyuki Ichiwara, Hiroshi Ito|arXiv (Cornell University)|Mar 2, 2021
Robot Manipulation and Learning参考文献 15被引用 11
一句话总结

该论文提出了一种空间注意力点网络(SAPN),通过在RGB图像中自动检测任务关键的空间注意力点(如机器人手和目标物体),实现了鲁棒且可泛化的机器人运动生成,同时对背景、光照和障碍物变化保持不变。该方法采用CNN-LSTM架构,并联合进行图像重建以稳定注意力点,仅需极少微调即可在不同物体位置的抓取和抓取-放置任务中实现超过88%的成功率。

ABSTRACT

Deep learning provides a powerful framework for automated acquisition of complex robotic motions. However, despite a certain degree of generalization, the need for vast amounts of training data depending on the work-object position is an obstacle to industrial applications. Therefore, a robot motion-generation model that can respond to a variety of work-object positions with a small amount of training data is necessary. In this paper, we propose a method robust to changes in object position by automatically extracting spatial attention points in the image for the robot task and generating motions on the basis of their positions. We demonstrate our method with an LBR iiwa 7R1400 robot arm on a picking task and a pick-and-place task at various positions in various situations. In each task, the spatial attention points are obtained for the work objects that are important to the task. Our method is robust to changes in object position. Further, it is robust to changes in background, lighting, and obstacles that are not important to the task because it only focuses on positions that are important to the task.

研究动机与目标

  • 为解决基于深度学习的机器人运动生成中高数据需求的挑战,特别是当物体位置变化时。
  • 通过实现对未见过的位置的泛化,减少对每种物体位置都进行大量训练数据的依赖。
  • 通过仅关注任务相关的空间特征,提高对背景杂乱、光照变化和障碍物的鲁棒性。
  • 开发一种运动生成模型,仅使用极少标注数据即可在多样化的真实场景中实现泛化。

提出的方法

  • 该模型采用三部分架构:用于特征提取的编码器(CNN),用于时间建模的循环模块(LSTM),以及用于运动预测的解码器。
  • 通过网络内的注意力机制,自动在图像中识别空间注意力点,如机器人手和目标物体等关键位置。
  • 与运动生成任务并行训练一个联合图像重建头,通过强制空间特征的一致性来稳定注意力点检测。
  • 使用真实世界的RGB图像和来自真实LBR iiwa 7R1400机器人的对应机器人运动轨迹,进行端到端训练。
  • 注意力机制确保仅聚焦于任务相关区域(如物体、手部),忽略无关背景和障碍物。
  • 通过学习与绝对位置无关的空间关系,使模型能够泛化到未教授的物体位置。

实验结果

研究问题

  • RQ1深度学习模型能否在仅使用极少训练数据的情况下,实现对不同物体位置的鲁棒机器人运动生成?
  • RQ2空间注意力机制在环境变化下如何提升机器人运动生成的泛化能力?
  • RQ3联合图像重建在多大程度上能提高空间注意力点检测的稳定性和准确性?
  • RQ4当面对训练期间未见过的背景、光照和障碍物变化时,模型能否保持高性能?
  • RQ5在任务执行过程中,模型内部的LSTM状态如何反映物体和目标位置的变化?

主要发现

  • 在所有测试情境下,包括未教授的位置,该模型在抓取任务中实现了88.5% ± 5.8%的任务成功率。
  • 在抓取-放置任务中,情境(ii)的成功率稳定保持在93.5% ± 4.5%,情境(iii)和(iv)的成功率分别为88.0% ± 5.9%,表明对位置和环境变化具有鲁棒性。
  • 在所有情境中,空间注意力点均成功定位在机器人手和目标物体上,即使物体被放置在未教授的位置。
  • 模型对背景、光照和障碍物变化表现出强适应性,注意力点保持稳定且任务相关。
  • 内部LSTM状态会动态响应物体和目标位置的变化,证实了模型适应新空间构型的能力。
  • 联合图像重建显著提升了注意力点的稳定性,表现为在各种输入条件下空间定位的一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。