Skip to main content
QUICK REVIEW

[论文解读] Asymmetric self-play for automatic goal discovery in robotic manipulation

OpenAI OpenAI, Matthias Plappert|arXiv (Cornell University)|Jan 13, 2021
Reinforcement Learning in Robotics参考文献 57被引用 21
一句话总结

本文提出非对称自博弈(asymmetric self-play),使单一目标条件策略能够在无需人类提供目标或课程设计的情况下,自动发现并解决多样化的机器人操作任务。通过训练两名智能体——Alice负责提出具有挑战性的目标,Bob负责解决这些目标——该方法隐式地生成课程,从而实现对未见过的任务(如堆叠积木和摆餐具)的零样本泛化,仅依赖稀疏奖励和从Alice轨迹中进行行为克隆。

ABSTRACT

We train a single, goal-conditioned policy that can solve many robotic manipulation tasks, including tasks with previously unseen goals and objects. We rely on asymmetric self-play for goal discovery, where two agents, Alice and Bob, play a game. Alice is asked to propose challenging goals and Bob aims to solve them. We show that this method can discover highly diverse and complex goals without any human priors. Bob can be trained with only sparse rewards, because the interaction between Alice and Bob results in a natural curriculum and Bob can learn from Alice's trajectory when relabeled as a goal-conditioned demonstration. Finally, our method scales, resulting in a single policy that can generalize to many unseen tasks such as setting a table, stacking blocks, and solving simple puzzles. Videos of a learned policy is available at https://robotics-self-play.github.io.

研究动机与目标

  • 训练单一目标条件策略,使其能够解决大量此前未见过的机器人操作任务。
  • 通过自动生成多样化且具挑战性的目标分布,消除对人工设计目标或奖励塑形的依赖。
  • 通过利用目标设定智能体Alice的轨迹作为示范,提升样本效率并实现稀疏奖励下的高效学习。
  • 将方法扩展至涉及多样化物体和配置的复杂、类真实世界操作任务。
  • 实现对包含未见过目标和此前未遇物体的保留任务的零样本泛化。

提出的方法

  • 在共享机器人环境中,使用共享初始状态,联合训练两名强化学习智能体——Alice(目标设定者)和Bob(目标求解者)。
  • Alice通过操作环境中的物体来提出目标,而Bob则从相同初始状态尝试解决相同目标。
  • Bob通过结合稀疏密集奖励与行为克隆(BC)进行训练,其示范数据来自Alice的轨迹,并重新标注为条件目标示范。
  • 每轮训练采用多目标设置,即Alice提出5个目标,Bob依次解决直至失败,以促进策略泛化。
  • 通过交互自然形成课程:随着Bob能力提升,目标逐步变得更加复杂,且次优示范被过滤掉。
  • 对行为克隆损失进行截断,以稳定训练并防止优化器每步更新过大。

实验结果

研究问题

  • RQ1在机器人操作中,非对称自博弈是否能在无任何人类先验知识的情况下,生成多样化且具挑战性的目标分布?
  • RQ2通过非对称自博弈训练的单一目标条件策略,是否能实现对包含新颖目标和物体的未见任务的零样本泛化?
  • RQ3通过行为克隆利用Alice的轨迹作为示范,是否能显著提升稀疏奖励下的样本效率与学习稳定性?
  • RQ4与单目标训练相比,每轮训练使用多个目标在策略泛化能力和训练稳定性方面有何差异?
  • RQ5非对称自博弈框架中的哪些组件(如BC、示范过滤、课程机制)对成功实现零样本泛化至关重要?

主要发现

  • 非对称自博弈框架使单一策略能够实现对10余种未见操作任务的零样本泛化,包括堆叠积木、摆餐具以及解决简单拼图等任务。
  • 若无非对称自博弈(无ABC),Bob在所有保留任务上均完全失败,表明ABC对学习至关重要。
  • 对行为克隆损失进行截断可提升训练稳定性并加速学习,尤其在抓取-放置和堆叠任务中效果显著。
  • 在行为克隆过程中过滤次优示范可减少训练不稳定性并提升性能,尤其在复杂任务(如翻转任务)中表现更优。
  • 每轮使用多个目标的训练方式相比单目标基线,能实现更快且更稳定的训练,表明重复暴露带来的内部记忆优势。
  • 在计算资源增加后,该方法可推广至复杂、多样的物体与配置,展现出强大的鲁棒性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。