Skip to main content
QUICK REVIEW

[论文解读] Goal-conditioned dual-action imitation learning for dexterous dual-arm robot manipulation

Hee‐Cheol Kim, Yoshiyuki Ohmura|arXiv (Cornell University)|Mar 18, 2022
Robot Manipulation and Learning参考文献 66被引用 9
一句话总结

本文提出了一种面向灵巧双臂操作的目标条件双动作模仿学习(GC-DA)方法,结合基于轨迹的全局动作以实现稳定长距离运动,以及基于反应的局部动作以实现精确的物体交互。该方法通过根据与目标的距离切换动作类型,减少了误差累积,成功在通用机器人上实现了真实世界中的香蕉剥皮任务。

ABSTRACT

Long-horizon dexterous robot manipulation of deformable objects, such as banana peeling, is a problematic task because of the difficulties in object modeling and a lack of knowledge about stable and dexterous manipulation skills. This paper presents a goal-conditioned dual-action (GC-DA) deep imitation learning (DIL) approach that can learn dexterous manipulation skills using human demonstration data. Previous DIL methods map the current sensory input and reactive action, which often fails because of compounding errors in imitation learning caused by the recurrent computation of actions. The method predicts reactive action only when the precise manipulation of the target object is required (local action) and generates the entire trajectory when precise manipulation is not required (global action). This dual-action formulation effectively prevents compounding error in the imitation learning using the trajectory-based global action while responding to unexpected changes in the target object during the reactive local action. The proposed method was tested in a real dual-arm robot and successfully accomplished the banana-peeling task. Data from this and related works are available at: https://sites.google.com/view/multi-task-fine.

研究动机与目标

  • 解决香蕉等缺乏精确模型的易变形物体在长时序、高变化场景下的灵巧操作挑战,需具备自适应技能。
  • 克服长序列中因反复预测反应式动作而导致的误差累积问题。
  • 通过基于任务上下文区分全局轨迹动作与局部反应动作,提升数据效率与鲁棒性。
  • 实现目标条件策略学习,使两种动作类型均基于子任务目标进行条件化,以提升泛化能力与稳定性。
  • 在真实双臂机器人上实现复杂、多子任务的香蕉剥皮任务。

提出的方法

  • 提出双动作框架:全局动作生成端到端轨迹以实现稳定运动,局部动作生成基于状态差的反应式动作以实现精确操作。
  • 使用学习到的动作类型分类器(ATC)根据视觉和传感输入判断当前状态是否需要全局或局部动作。
  • 将全局与局部动作均基于子任务目标定义的终点状态进行条件化,以提升策略鲁棒性与泛化能力。
  • 采用视觉Transformer结合自注意力滚动机制,计算注意力图以突出显示相关输入特征(如物体、目标、当前状态)用于动作预测。
  • 应用图像增强(亮度、对比度、色调、饱和度、随机擦除)与基于注意力的特征加权,以提升模型泛化能力并减少过拟合。
  • 使用人类示范进行模型训练,并对模糊过渡进行重新标注,以细化动作类型边界并提升策略学习效果。

实验结果

研究问题

  • RQ1与纯反应式动作策略相比,双动作模仿学习框架是否能有效减少长时序灵巧操作任务中的误差累积?
  • RQ2将子任务目标同时用于全局与局部动作的条件化,是否能提升复杂操作任务中策略的鲁棒性与成功率?
  • RQ3混合动作策略(在基于轨迹的动作与反应式动作间切换)是否能有效实现对香蕉等易变形、形状多变物体的操作?
  • RQ4该方法在通用双臂机器人上的真实世界部署中,对高物理交互性与物体多样性的任务是否具有有效性?
  • RQ5基于注意力的特征加权与数据增强在模仿学习中对操作任务策略泛化能力的提升程度如何?

主要发现

  • 所提出的GC-DA方法成功在双臂机器人上实现了真实世界香蕉剥皮,完成了不同形状与大小香蕉的全任务流程。
  • 通过在末端执行器远离目标时使用基于轨迹的全局动作,接近目标时切换为反应式局部动作,有效减少了误差累积。
  • 对859个轨迹(抓取:369个,右指伸展:288个,左指伸展:202个)的人工重新标注确认,动作类型切换发生在有意义的任务边界上。
  • 模型在动作类型分类上表现优异,283个标注示范中,有2087个被正确分类用于抓取子任务。
  • 评分标准显示,机器人在60%的剥皮子任务中达到完整剥皮(得分1),40%实现部分剥皮(得分0.5),表明其在精细操作中表现强劲但尚未完美。
  • 注意力可视化结果表明,模型聚焦于目标状态、物体与当前机器人状态等关键特征,支持注意力机制的可解释性与有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。