Skip to main content
QUICK REVIEW

[论文解读] Simultaneous Multi-View Object Recognition and Grasping in Open-Ended Domains

Hamidreza Kasaei, Sha Luo|arXiv (Cornell University)|Jun 3, 2021
Domain Adaptation and Few-Shot Learning被引用 6
一句话总结

该论文提出了一种带有增强记忆的深度学习架构,可在开放环境中联合执行多视角物体识别与抓取预测。通过融合视觉Transformer与抓取网络的RGB和深度特征,该方法实现了通过元主动学习进行持续的少样本学习,仅需每类少于五个样本即可实现95%的识别准确率和91%的抓取成功率,适用于杂乱场景。

ABSTRACT

To aid humans in everyday tasks, robots need to know which objects exist in the scene, where they are, and how to grasp and manipulate them in different situations. Therefore, object recognition and grasping are two key functionalities for autonomous robots. Most state-of-the-art approaches treat object recognition and grasping as two separate problems, even though both use visual input. Furthermore, the knowledge of the robot is fixed after the training phase. In such cases, if the robot encounters new object categories, it must be retrained to incorporate new information without catastrophic forgetting. In order to resolve this problem, we propose a deep learning architecture with an augmented memory capacity to handle open-ended object recognition and grasping simultaneously. In particular, our approach takes multi-views of an object as input and jointly estimates pixel-wise grasp configuration as well as a deep scale- and rotation-invariant representation as output. The obtained representation is then used for open-ended object recognition through a meta-active learning technique. We demonstrate the ability of our approach to grasp never-seen-before objects and to rapidly learn new object categories using very few examples on-site in both simulation and real-world settings. A video of these experiments is available online at: https://youtu.be/n9SMpuEkOgk

研究动机与目标

  • 解决在动态、以人为中心的环境中,机器人持续、开放地识别和抓取新物体类别所带来的挑战。
  • 通过实现无需完整微调的增量知识获取,克服深度学习中的灾难性遗忘问题。
  • 通过交互式、非专家用户指导,使机器人能够仅使用极少量现场样本学习新物体类别。
  • 同时预测稳定抓取配置与尺度-旋转不变的物体表征,适用于孤立物体和杂乱物体。
  • 开发一个统一框架,将深度学习与元主动学习相结合,实现在资源受限机器人系统中的高效、实时适应。

提出的方法

  • 以物体的多个RGB-D视角作为输入,通过视觉Transformer处理RGB图像以提取纹理特征。
  • 通过最大熵方法处理深度图像以提取几何特征,并使用专用抓取网络预测像素级抓取配置。
  • 将RGB和深度特征表示拼接,形成全局、尺度与旋转不变的物体表征。
  • 采用元主动学习,仅使用每类3–5个标注样本即可实现新物体类别的快速少样本分类。
  • 在合成数据集上端到端训练整个网络,以优化抓取与识别的联合性能。
  • 将全局表征作为下游开放领域学习头的输入,支持持续类别学习且遗忘极少。

实验结果

研究问题

  • RQ1单一深度学习架构能否在开放、真实的世界环境中同时实现准确的3D物体识别与稳定抓取预测?
  • RQ2机器人在不产生灾难性遗忘的前提下,仅使用少量现场样本学习新物体类别,其有效性如何?
  • RQ3RGB与深度数据的多视角融合在杂乱场景和物体堆叠场景中,能在多大程度上提升鲁棒性?
  • RQ4元主动学习能否实现实时机器人应用中,来自非专家用户的快速、交互式知识获取?
  • RQ5在数据有限的情况下,该方法与最先进方法相比,在抓取成功率和识别准确率方面表现如何?

主要发现

  • 该方法在使用每类平均少于五个训练样本的情况下,对未见过的物体类别实现了95%的识别准确率。
  • 在包含超过15个物体的高度杂乱场景中,机器人在10次真实世界实验中有9次成功完成清桌任务,成功率90%。
  • 在物体堆叠抓取任务中,该方法在仿真环境中实现了92%的成功率(23/25次试验),在真实世界实验中达到90%(9/10次试验)。
  • 无论在仿真还是真实世界环境中,抓取网络对稳定抓取配置的预测成功率均超过91%,即使在复杂杂乱环境中也表现良好。
  • 失败案例主要源于物体位置不可达,或出现同时抓取多个物体(如同时抓取物体及其支撑结构)的非预期抓取。
  • 由于采用以物体为中心的抓取预测与不变特征表征,系统对视角变化和相机位姿变化表现出强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。