Skip to main content
QUICK REVIEW

[论文解读] Contextual Reinforcement Learning of Visuo-tactile Multi-fingered Grasping Policies

Visak Kumar, Tucker Hermans|arXiv (Cornell University)|Nov 20, 2019
Robot Manipulation and Learning被引用 12
一句话总结

本文提出一种基于视觉-触觉感知的上下文强化学习方法,用于多指机器人抓取,其中通过3D包围框关键点表示物体形状与尺寸,指尖接触信号用于弥合仿真到现实的差距。策略在仿真环境中完全训练,且利用人类示范作为先验,无需微调即可泛化至未见过的物体形状,并实现实世界部署。

ABSTRACT

Using simulation to train robot manipulation policies holds the promise of an almost unlimited amount of training data, generated safely out of harm's way. One of the key challenges of using simulation, to date, has been to bridge the reality gap, so that policies trained in simulation can be deployed in the real world. We explore the reality gap in the context of learning a contextual policy for multi-fingered robotic grasping. We propose a Grasping Objects Approach for Tactile (GOAT) robotic hands, learning to overcome the reality gap problem. In our approach we use human hand motion demonstration to initialize and reduce the search space for learning. We contextualize our policy with the bounding cuboid dimensions of the object of interest, which allows the policy to work on a more flexible representation than directly using an image or point cloud. Leveraging fingertip touch sensors in the hand allows the policy to overcome the reduction in geometric information introduced by the coarse bounding box, as well as pose estimation uncertainty. We show our learned policy successfully runs on a real robot without any fine tuning, thus bridging the reality gap.

研究动机与目标

  • 通过基于仿真训练并实现实世界部署,解决多指机器人抓取中的仿真到现实泛化差距问题。
  • 利用人类手部运动示范作为先验,降低抓取策略的高维搜索空间。
  • 通过使用3D包围框关键点而非原始视觉特征表示物体,提升在多样化物体形状上的泛化能力。
  • 通过整合指尖传感器的触觉反馈,克服现实部署中几何与位姿估计的不确定性。
  • 通过上下文策略学习,实现单一策略在无需微调的情况下跨多种物体形状的零样本部署。

提出的方法

  • 使用人类手部抓取的RGB视频,通过最先进的姿态估计方法估计3D手部姿态,进而提取示范轨迹作为仿真环境中的奖励塑造信号。
  • 使用包围长方体八个顶点的3D坐标表示物体几何与尺寸,作为策略网络中的上下文变量。
  • 将二值化的指尖接触信号作为状态观测的一部分,提供抓取质量与物体交互的实时反馈。
  • 在仿真环境中,基于视觉与触觉状态的组合,使用基于深度确定性策略梯度(DDPG)的上下文强化学习策略进行训练。
  • 利用上下文变量(包围框)使策略能够泛化至训练期间未见过的新物体形状。
  • 在真实机器人上部署最终策略,使用基于RGB的姿态估计算法获取视觉输入,同时利用BioTac触觉传感器获取接触反馈。

实验结果

研究问题

  • RQ1在仿真环境中训练的单一强化学习策略,是否能在不进行微调的情况下,泛化至未见过的现实世界多指抓取物体形状?
  • RQ2作为上下文变量,包围框关键点表示在视觉-触觉抓取中,对实现多样化物体几何泛化的效果如何?
  • RQ3触觉反馈在多大程度上提升了对位姿估计误差和形状不匹配的鲁棒性,从而改善仿真到现实的迁移性能?
  • RQ4将人类示范轨迹作为奖励先验,对仿真中抓取任务的样本效率与策略性能提升有多大帮助?
  • RQ5通过条件化于物体上下文与触觉反馈,单一策略是否能够学习多种抓取方式(如精密抓取与力量抓取)?

主要发现

  • 所提出的策略在仿真中完全训练后,无需任何微调,即可在真实世界中成功抓取多种未见过的物体形状,包括圆锥体和圆柱体。
  • 包围框关键点上下文与触觉接触信号的结合,使策略能够适应显著偏离长方体近似的物体形状。
  • 该策略在真实机器人上的性能与一种手工设计的基于模型的抓取规划器相当,证明了其强大的仿真到现实泛化能力。
  • 基于人类示范的奖励塑造显著提升了仿真训练中的样本效率与策略收敛速度。
  • 该方法通过仅改变物体上下文即可实现单一策略在多种抓取方式上的零样本部署,无需重新训练或修改网络结构。
  • 触觉反馈对鲁棒性至关重要,因为它使策略能够在视觉位姿估计不准确或包围框对物体几何表示不佳时,仍能检测并维持接触。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。