Skip to main content
QUICK REVIEW

[论文解读] End-to-End Affordance Learning for Robotic Manipulation

Yiran Geng, Boshi An|arXiv (Cornell University)|Sep 26, 2022
Robot Manipulation and Learning被引用 4
一句话总结

该论文提出了一种端到端强化学习框架,直接从训练过程中的接触交互中学习视觉可操作性,无需人工定义的动作原语或单独的数据收集。通过使用接触频率来预测可操作性图,并将其整合到策略学习和奖励塑造中,该方法在八种不同的操作任务中实现了最先进(SOTA)的成功率,包括多阶段和多智能体场景,并展现出强大的现实世界迁移能力。

ABSTRACT

Learning to manipulate 3D objects in an interactive environment has been a challenging problem in Reinforcement Learning (RL). In particular, it is hard to train a policy that can generalize over objects with different semantic categories, diverse shape geometry and versatile functionality. Recently, the technique of visual affordance has shown great prospects in providing object-centric information priors with effective actionable semantics. As such, an effective policy can be trained to open a door by knowing how to exert force on the handle. However, to learn the affordance, it often requires human-defined action primitives, which limits the range of applicable tasks. In this study, we take advantage of visual affordance by using the contact information generated during the RL training process to predict contact maps of interest. Such contact prediction process then leads to an end-to-end affordance learning framework that can generalize over different types of manipulation tasks. Surprisingly, the effectiveness of such framework holds even under the multi-stage and the multi-agent scenarios. We tested our method on eight types of manipulation tasks. Results showed that our methods outperform baseline algorithms, including visual-based affordance methods and RL methods, by a large margin on the success rate. The demonstration can be found at https://sites.google.com/view/rlafford/.

研究动机与目标

  • 为解决在多样化物体类别、形状和功能下训练通用机器人操作策略的挑战。
  • 克服依赖人工定义的动作原语和独立数据收集的两阶段可操作性学习方法的局限性。
  • 从原始强化学习交互数据中实现可操作性表征的端到端学习,提升策略的泛化能力和鲁棒性。
  • 支持复杂操作场景,如多阶段任务(例如,抓取与放置)和多智能体协作(例如,双臂推动),而无需特定任务的标注。
  • 通过数字孪生设置,实现在真实世界环境中的有效迁移。

提出的方法

  • 利用强化学习交互中的接触频率作为视觉可操作性的代理,端到端地在策略训练期间学习接触图。
  • 将预测的可操作性图作为额外观测,引导智能体注意力集中于高概率交互点。
  • 引入基于可操作性的奖励塑造(最大点奖励,MPR),以鼓励智能体聚焦于最优交互位置。
  • 采用多任务策略网络,包含共享编码器和任务特定头,实现可操作性和操作策略的联合学习。
  • 应用最大点观测(MPO)机制,从可操作性图中提取并监督最具潜力的交互点。
  • 采用统一的接触表征,支持智能体到物体(A2O)和物体到物体(O2O)的交互,实现更广泛的任务覆盖。

实验结果

研究问题

  • RQ1是否能够从强化学习交互数据中以端到端方式有效学习可操作性表征,而无需人工定义的原语或专用数据收集?
  • RQ2端到端可操作性学习在复杂操作任务(如多阶段和多智能体场景)中的成功率提升效果如何?
  • RQ3关键组件(MPO、MPR 和 E2E 训练)对整体性能和鲁棒性的贡献是什么?
  • RQ4所学习的可操作性表征是否能泛化到未见过的物体,并成功迁移到真实世界机器人系统?
  • RQ5基于接触的可操作性学习框架与现有两阶段可操作性学习和标准强化学习基线在多样化任务中的表现相比如何?

主要发现

  • 在双臂推动任务的测试集中,所提方法取得了 93.8% 的成功率,显著优于次佳基线(MAPPO 的 7.8%),甚至超过多任务强化学习基线(56.3% 的测试成功率)。
  • 在双臂推动任务中,无 MPO 的消融实验(Ours w/o MPO)在训练集上达到 96.3%,测试集上达到 100%,表明 MPO 在复杂多智能体设置中对学习稳定性至关重要。
  • 无 E2E 训练的消融实验(Ours w/o E2E)仅取得 55.9% 的训练成功率和 50.0% 的测试成功率,证明端到端联合学习对性能至关重要。
  • 在关门任务中,该方法在训练集上达到 83.9%,测试集上达到 78.5%,优于所有基线,包括标准强化学习和 Where2Act。
  • 无 MPR 的消融实验(Ours w/o MPR)在双臂推动任务中取得 95.9% 的训练成功率和 96.3% 的测试成功率,表明 MPR 虽非核心但仍有显著益处,且其重要性低于 MPO 和 E2E。
  • 该方法通过数字孪生设置成功迁移到真实世界机器人系统,在未见过的物体上成功执行,验证了其鲁棒性和泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。