Skip to main content
QUICK REVIEW

[论文解读] TossingBot: Learning to Throw Arbitrary Objects with Residual Physics

Andy Zeng, Shuran Song|arXiv (Cornell University)|Mar 27, 2019
Robot Manipulation and Learning被引用 15
一句话总结

TossingBot 提出了一种端到端的深度强化学习系统,通过视觉观测(RGB-D)联合优化任意刚性物体的抓取与投掷策略。通过将基于物理的弹道控制器与深度学习预测释放速度的残差相结合,该系统实现了每小时500次以上的平均抓取次数,投掷准确率达85%,并能泛化到其可达范围外的新物体和目标位置。

ABSTRACT

We investigate whether a robot arm can learn to pick and throw arbitrary objects into selected boxes quickly and accurately. Throwing has the potential to increase the physical reachability and picking speed of a robot arm. However, precisely throwing arbitrary objects in unstructured settings presents many challenges: from acquiring reliable pre-throw conditions (e.g. initial pose of object in manipulator) to handling varying object-centric properties (e.g. mass distribution, friction, shape) and dynamics (e.g. aerodynamics). In this work, we propose an end-to-end formulation that jointly learns to infer control parameters for grasping and throwing motion primitives from visual observations (images of arbitrary objects in a bin) through trial and error. Within this formulation, we investigate the synergies between grasping and throwing (i.e., learning grasps that enable more accurate throws) and between simulation and deep learning (i.e., using deep networks to predict residuals on top of control parameters predicted by a physics simulator). The resulting system, TossingBot, is able to grasp and throw arbitrary objects into boxes located outside its maximum reach range at 500+ mean picks per hour (600+ grasps per hour with 85% throwing accuracy); and generalizes to new objects and target locations. Videos are available at https://tossingbot.cs.princeton.edu

研究动机与目标

  • 使机械臂能够在其运动学可达范围外,可靠地抓取并投掷任意刚性物体至远处目标。
  • 解决在非结构化环境中物体属性(质量分布、摩擦力、形状、空气动力学特性)差异带来的挑战。
  • 通过试错学习协同的抓取与投掷策略,无需依赖固定的预投掷条件。
  • 通过视觉感知联合优化抓取质量与释放速度,以提升投掷准确率。
  • 探究在物理模拟基础上引入残差学习,如何提升真实世界操作任务中的泛化能力与性能。

提出的方法

  • 使用深度神经网络,从料箱的RGB-D图像中预测密集的像素级抓取概率及其对应的投掷释放速度。
  • 采用基于物理的控制器,根据目标位置和物体几何形状估算理想的弹道释放速度($\hat{v}$)。
  • 应用残差学习:最终释放速度为 $v = \hat{v} + \delta$,其中 $\delta$ 是由深度网络预测的、用于补偿物体特定动力学特性的校正量。
  • 通过试错法训练端到端策略,奖励函数通过投掷准确率进行形状设计(抓取成功 = 投掷准确)。
  • 利用视觉外观和几何线索,隐式学习质量分布和空气动力学行为等物理先验知识。
  • 使用特征可视化分析内部表征,表明网络在无显式监督的情况下学习到了基于形状的聚类。

实验结果

研究问题

  • RQ1机器人能否仅通过视觉观测和试错,在非结构化环境中学习抓取并投掷任意刚性物体?
  • RQ2与独立优化相比,联合学习抓取与投掷策略在性能上有多大提升?
  • RQ3基于物理的控制器在多大程度上能通过数据驱动的残差项得到增强,以补偿未建模的动力学特性?
  • RQ4通过任务特定交互学习到的深度特征,能否隐式编码质量分布和空气动力学等物理属性?
  • RQ5该系统在训练期间未见过的新物体和目标位置上的泛化能力如何?

主要发现

  • TossingBot 实现了每小时500次以上的平均抓取次数(MPPH),投掷准确率达85%,展示了对任意刚性物体的高速、可靠操作能力。
  • 该系统能泛化到其最大可达范围外的新物体和目标位置,表明策略具有强大的泛化能力。
  • 投掷性能与抓取质量密切相关,联合训练显著提升了抓取稳定性和投掷准确率。
  • 残差物理方法($v = \hat{v} + \delta$)优于仅使用纯物理或纯学习的基线方法,表现出更高的准确率和更强的鲁棒性。
  • 特征可视化显示,深度网络在无显式监督的情况下学习到了基于形状和物理先验的表征,有效按几何和动力学特性对物体进行聚类。
  • 与 ImageNet 预训练特征相比,所学特征在此任务上更具信息量,表明任务特定交互能实现更相关的语义理解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。