Skip to main content
QUICK REVIEW

[论文解读] Learning to Identify Object Instances by Touch: Tactile Recognition via Multimodal Matching

Justin Lin, Roberto Calandra|arXiv (Cornell University)|Mar 8, 2019
Tactile and Sensory Interactions参考文献 23被引用 6
一句话总结

本文提出一种基于视觉与触觉的深度学习方法,用于跨模态实例识别,机器人通过匹配触觉传感器数据(来自GelSight传感器)与视觉图像来识别物体实例。通过在98种物体上进行自监督、自主的数据采集,该模型在匹配触觉与视觉观测方面实现了高准确率,即使对于新物体也表现优异,且在相同任务上超越了人类表现。

ABSTRACT

Much of the literature on robotic perception focuses on the visual modality. Vision provides a global observation of a scene, making it broadly useful. However, in the domain of robotic manipulation, vision alone can sometimes prove inadequate: in the presence of occlusions or poor lighting, visual object identification might be difficult. The sense of touch can provide robots with an alternative mechanism for recognizing objects. In this paper, we study the problem of touch-based instance recognition. We propose a novel framing of the problem as multi-modal recognition: the goal of our system is to recognize, given a visual and tactile observation, whether or not these observations correspond to the same object. To our knowledge, our work is the first to address this type of multi-modal instance recognition problem on such a large-scale with our analysis spanning 98 different objects. We employ a robot equipped with two GelSight touch sensors, one on each finger, and a self-supervised, autonomous data collection procedure to collect a dataset of tactile observations and images. Our experimental results show that it is possible to accurately recognize object instances by touch alone, including instances of novel objects that were never seen during training. Our learned model outperforms other methods on this complex task, including that of human volunteers.

研究动机与目标

  • 解决在视觉感知因遮挡或光照不良而不可靠时,仅通过触觉识别物体实例的挑战。
  • 将跨模态实例识别建模为同一物体的触觉与视觉观测之间的二元匹配任务。
  • 利用机器人自主抓取物体并记录配对的视觉与触觉数据,实现大规模自监督数据采集。
  • 评估仅依靠触觉传感是否能够实现准确且可泛化的物体实例识别,包括对未见过的物体。
  • 将所学习模型的性能与人类志愿者在相同触觉-视觉匹配任务上的表现进行比较。

提出的方法

  • 系统在机器人的夹爪手指上安装两个GelSight触觉传感器,以在抓握过程中捕获高分辨率的表面形变图像。
  • 训练一个卷积神经网络(CNN),以判断给定的视觉图像与触觉读数对是否对应同一物体实例。
  • 正样本训练对通过将单个物体的所有触觉读数与对应图像配对生成;所有跨物体对均视为负样本。
  • 数据集通过机器人对98种不同物体重复抓握的方式自主采集,实现无需人工标注类别标签的自监督学习。
  • 通过在已见和未见物体上进行少样本分类(K=1,5)对模型进行评估,性能通过测试集上的准确率衡量。
  • 通过一项包含11名志愿者的受控实验,收集人类基线性能,任务为相同的5-shot分类任务。

实验结果

研究问题

  • RQ1当与视觉观测配对时,机器人是否能仅通过触觉传感准确识别物体实例?
  • RQ2自监督学习方法在未在训练中见过的新物体实例上,其泛化能力在多大程度上有效?
  • RQ3在相同识别任务中,基于触觉-视觉匹配训练的深度学习模型性能与人类表现相比如何?
  • RQ4GelSight传感器提供的高分辨率触觉成像是否能实现与视觉数据的可靠跨模态匹配?
  • RQ5当在训练数据中未出现的物体上进行测试时,模型是否仍能保持高准确率?

主要发现

  • 即使在训练期间未见过的新物体上,该模型在仅使用触觉数据的情况下,识别物体实例的准确率也显著高于随机猜测水平。
  • 在5-shot分类任务中,该模型在训练物体和测试物体上均保持高准确率,图8中的红蓝条形图显示了对未见实例的一致性能表现。
  • 该模型在相同的5-shot触觉-视觉匹配任务中表现优于人类志愿者,表明其在有限数据下具备更优的泛化能力和模式识别能力。
  • 自监督数据采集流程实现了大规模、低成本的数据获取,无需人工标注标签,支持模型的可扩展训练。
  • 该系统表明,当与深度学习结合时,触觉传感能够实现稳健且可泛化的实例识别,即使在遮挡或光照变化等挑战性条件下亦然。
  • 结果验证了将触觉传感作为机器人操作中物体实例识别主要模态的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。