[论文解读] Slip Detection with Combined Tactile and Visual Information
该论文提出了一种基于深度学习的滑移检测方法,通过融合触觉(GelSight传感器)和视觉(外部摄像头)数据,提升了机器人抓握的稳定性。该模型在94种日常物体的1,102次抓握数据上进行训练,对10种未见过的测试物体实现了88.03%的滑移检测准确率,表明多模态融合优于单传感器方法,尤其在光滑或易滑物体上,视觉提供了触觉传感之外的关键运动线索。
Slip detection plays a vital role in robotic manipulation and it has long been a challenging problem in the robotic community. In this paper, we propose a new method based on deep neural network (DNN) to detect slip. The training data is acquired by a GelSight tactile sensor and a camera mounted on a gripper when we use a robot arm to grasp and lift 94 daily objects with different grasping forces and grasping positions. The DNN is trained to classify whether a slip occurred or not. To evaluate the performance of the DNN, we test 10 unseen objects in 152 grasps. A detection accuracy as high as 88.03% is achieved. It is anticipated that the accuracy can be further improved with a larger dataset. This method is beneficial for robots to make stable grasps, which can be widely applied to automatic force control, grasping strategy selection and fine manipulation.
研究动机与目标
- 通过在物体操作过程中检测滑移,提升机器人抓握的稳定性。
- 通过结合触觉与视觉模态,解决单传感器滑移检测的局限性,特别是针对光滑或低摩擦物体。
- 开发一种无需预先了解物体物理参数的数据驱动端到端滑移检测系统。
- 证明触觉与视觉信息具有互补性,视觉在滑溜或无特征物体上提供了关键线索,而此时触觉信号存在歧义。
提出的方法
- 使用机器人夹爪上安装的GelSight触觉传感器和外部摄像头的图像序列,训练一个深度神经网络(DNN)以分类抓握稳定性。
- DNN处理来自两个传感器的6帧输入序列,实现对初始提升阶段运动的时序建模。
- GelSight传感器的触觉数据捕捉高分辨率表面形变和标记位移,用于相对运动估计。
- 外部摄像头的视觉数据捕捉物体相对于夹爪的运动,当触觉信号微弱或模糊时提供线索。
- 模型在94种多样化日常物体的1,102次抓握上进行训练,涵盖不同的抓握力和位置。
- 消融实验对比了多模态模型与单传感器基线模型(仅GelSight和仅摄像头)的性能。
实验结果
研究问题
- RQ1深度神经网络能否有效融合触觉与视觉信息,实现比单传感器方法更准确的滑移检测?
- RQ2多模态模型的性能与仅触觉或仅视觉模型相比如何,特别是在光滑或易滑物体上?
- RQ3该模型能否在不预先了解物体物理属性的情况下泛化到未见物体?
- RQ4触觉与视觉数据的融合是否能实现比传统阈值方法更早检测到滑移的前兆?
主要发现
- 多模态DNN在10种未见测试物体上实现了88.03%的滑移检测准确率,显著优于单传感器基线模型。
- 该模型检测滑移的时间早于作者先前工作中基于阈值的方法,后者仅达到71%的准确率。
- 对于光滑无特征物体(如变阻器),仅GelSight传感器因标记位移极小而无法检测滑移,但外部摄像头捕捉到了物体运动,从而实现了正确分类。
- 该模型成功区分了实际滑移(物体与传感器表面之间的相对运动)与由凝胶表面拉伸引起的表观运动,表现出对传感器伪影的鲁棒性。
- 触觉与视觉数据的融合被证明具有互补性:视觉为滑溜或光滑物体提供了关键线索,此时触觉信号微弱;而触觉数据则有助于解决视觉运动中的歧义。
- 结果表明,DNN学会了在不同模态间整合空间和时间模式,以推断抓握稳定性,即使在复杂条件下也表现良好。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。