Skip to main content
QUICK REVIEW

[论文解读] Tactile Pose Estimation and Policy Learning for Unknown Object Manipulation

Tarik Keleştemur, Robert Platt|arXiv (Cornell University)|Mar 21, 2022
Robot Manipulation and Learning被引用 11
一句话总结

本文提出了一种基于触觉的位姿估计与策略学习框架,用于在无先前形状或尺寸知识的情况下操作未知物体。该方法在离散贝叶斯滤波中使用学习到的触觉观测模型,实现了精确的2毫米位置和1度方向的位姿估计,使深度强化学习策略在仿真和真实世界中的开瓶任务中均取得了81%的成功率。

ABSTRACT

Object pose estimation methods allow finding locations of objects in unstructured environments. This is a highly desired skill for autonomous robot manipulation as robots need to estimate the precise poses of the objects in order to manipulate them. In this paper, we investigate the problems of tactile pose estimation and manipulation for category-level objects. Our proposed method uses a Bayes filter with a learned tactile observation model and a deterministic motion model. Later, we train policies using deep reinforcement learning where the agents use the belief estimation from the Bayes filter. Our models are trained in simulation and transferred to the real world. We analyze the reliability and the performance of our framework through a series of simulated and real-world experiments and compare our method to the baseline work. Our results show that the learned tactile observation model can localize the pose of novel objects at 2-mm and 1-degree resolution for position and orientation, respectively. Furthermore, we experiment on a bottle opening task where the gripper needs to reach the desired grasp state.

研究动机与目标

  • 仅使用触觉反馈,无需事先了解物体形状或尺寸,实现对未知物体的精确位姿估计。
  • 开发一种可泛化至新物体的鲁棒触觉观测模型,适用于仿真环境并能成功迁移到真实世界。
  • 利用贝叶斯滤波生成的信念状态训练操作策略,提升在非结构化环境中的任务表现。
  • 仅使用触觉传感实现对新物体的高精度操作(2毫米,1度)。
  • 在模拟环境中训练的策略实现最小化领域随机化条件下的真实世界迁移。

提出的方法

  • 离散贝叶斯滤波将学习到的触觉观测模型与确定性运动模型结合,以估计夹爪相对于未知物体的位姿。
  • 触觉观测模型是一个深度神经网络,其在带有夹爪视觉-触觉传感器的仿真环境中生成的合成触觉图像上进行训练。
  • 仿真中的触觉图像增强使用真实传感器背景图像,并添加高斯噪声,以提升仿真到真实世界的迁移性能。
  • 策略通过深度强化学习进行训练,以贝叶斯滤波生成的信念状态作为输入,动作定义为末端执行器的增量运动。
  • 系统使用TACTO仿真器生成像素级触觉差异,并利用真实传感器背景图像对合成触觉数据进行校准。
  • 在线求解逆运动学以在真实UR5机器人上执行动作,训练 episode 基于信念到目标的误差进行终止。

实验结果

研究问题

  • RQ1学习到的触觉观测模型能否实现对未知物体位姿的亚厘米级和亚度级精度估计?
  • RQ2基于信念状态在仿真数据上训练的策略在真实世界操作任务中泛化能力如何?
  • RQ3该系统能否在不进行大量领域随机化的情况下实现在真实世界操作中的高成功率?
  • RQ4在触觉操作策略学习中,使用信念估计与使用循环网络相比有何影响?
  • RQ5该框架能否在不重新训练的情况下处理跨不同类别的多个新物体?

主要发现

  • 学习到的触觉观测模型在仿真中对新物体的位姿估计实现了2毫米位置和1度方向的分辨率。
  • 在真实世界开瓶任务中,策略在五种不同瓶子上均取得了81%的成功率,且未事先知晓其模型信息。
  • 真实世界中的平均 episode 长度为7.09步,部分瓶子成功所需步数高达8.57步。
  • 失败案例主要由于夹爪完全闭合,导致错误的触觉观测和信念漂移,策略无法从中恢复。
  • 与使用循环网络进行策略学习的基线方法相比,该方法表现更优,证明了信念状态输入的优势。
  • 系统仅使用一张真实传感器背景图像进行触觉增强,即成功实现了从仿真到真实世界的迁移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。