Skip to main content
QUICK REVIEW

[论文解读] Grasping with Chopsticks: Combating Covariate Shift in Model-free Imitation Learning for Fine Manipulation

Liyiming Ke, Jingqiang Wang|arXiv (Cornell University)|Nov 13, 2020
Robot Manipulation and Learning参考文献 31被引用 4
一句话总结

该论文提出了一种非交互式、无需模型的模仿学习方法,通过噪声注入和以物体为中心的状态转换来减少使用筷子进行精细操作时的协变量偏移,从而提升策略的泛化能力。该方法将真实机器人平台上的成功率从37.3%提升至80%,接近专家水平的82.6%。

ABSTRACT

Billions of people use chopsticks, a simple yet versatile tool, for fine manipulation of everyday objects. The small, curved, and slippery tips of chopsticks pose a challenge for picking up small objects, making them a suitably complex test case. This paper leverages human demonstrations to develop an autonomous chopsticks-equipped robotic manipulator. Due to the lack of accurate models for fine manipulation, we explore model-free imitation learning, which traditionally suffers from the covariate shift phenomenon that causes poor generalization. We propose two approaches to reduce covariate shift, neither of which requires access to an interactive expert or a model, unlike previous approaches. First, we alleviate single-step prediction errors by applying an invariant operator to increase the data support at critical steps for grasping. Second, we generate synthetic corrective labels by adding bounded noise and combining parametric and non-parametric methods to prevent error accumulation. We demonstrate our methods on a real chopstick-equipped robot that we built, and observe the agent's success rate increase from 37.3% to 80%, which is comparable to the human expert performance of 82.6%.

研究动机与目标

  • 解决在无需交互式专家反馈或环境模型的情况下,基于无模型模仿学习在精细操作中出现的协变量偏移问题。
  • 仅使用专家演示数据,在低数据、高精度操作任务中提升策略的泛化能力。
  • 开发一种可扩展的非交互式方法,增强数据支持并纠正策略学习中的误差累积。
  • 在配备驱动筷子的现实机器人系统上验证该方法,用于抓取小型、易滑物体。
  • 通过使用简单工具和极少的专家交互,实现人类水平的精细操作性能。

提出的方法

  • 将状态数据转换为以物体为中心的坐标系,以增加关键抓取状态附近的样本密度,从而改善局部策略的学习效果。
  • 在训练过程中通过在状态中添加高斯噪声实施噪声注入,生成合成的校正标签以提升策略的鲁棒性。
  • 结合参数化方法(行为克隆)与非参数化方法(k-NN),以在未见状态处更准确地匹配动作分布。
  • 采用混合集成策略,根据邻居距离阈值在行为克隆与k-NN之间动态切换,以平衡准确性与鲁棒性。
  • 使用加权损失函数,结合位置、旋转和开合角度误差,采用均方误差和旋转差异度量进行优化。
  • 采用定制的PID控制器与校准方法,将末端执行器误差从10 mm降低至4 mm,从而提升基线性能。

实验结果

研究问题

  • RQ1在无需交互式专家反馈或环境模型的情况下,能否有效缓解无模型模仿学习中的协变量偏移?
  • RQ2在状态空间中引入噪声如何提升精细操作任务中的策略泛化能力?
  • RQ3以物体为中心的数据转换在关键抓取区域在多大程度上增强了数据支持?
  • RQ4与仅使用行为克隆相比,参数化与非参数化方法的结合是否能更有效地匹配未见状态下的动作分布?
  • RQ5所提出的方法是否能在真实世界中使用筷子进行精细操作时,实现与人类专家相当的性能?

主要发现

  • 所提方法将真实机器人系统在抓取小型立方体和球形物体时的成功率从37.3%提升至80%,接近人类专家的82.6%表现。
  • 在最具挑战性的物体(小球)上,该智能体实现了60%的成功率,而朴素的行为克隆基线仅达到12%。
  • 消融实验表明,噪声注入与数据转换均对缓解协变量偏移和提升策略鲁棒性具有显著贡献。
  • 状态分布的可视化显示,使用所提方法后,策略的状态分布与专家分布的差异显著减小。
  • 噪声注入方法在模拟的MuJoCo环境中也表现出良好的泛化能力,表明其在真实测试平台之外也具备可迁移性。
  • 该方法避免了交互式数据采集,通过消除演示过程中实时校正的需求,显著降低了专家负担。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。