Skip to main content
QUICK REVIEW

[论文解读] It Takes Four to Tango: Multiagent Selfplay for Automatic Curriculum Generation

Yuqing Du, Pieter Abbeel|arXiv (Cornell University)|Feb 22, 2022
Reinforcement Learning in Robotics被引用 4
一句话总结

本文提出课程自博弈(CuSP),一种对称的多智能体自博弈框架,通过使用两个离策略学生和两个最大化遗憾的目标生成器,自动生成多样化、逐步提升难度且持续回顾的目标。CuSP通过极小化最大遗憾优化,在探索与防止灾难性遗忘之间实现平衡,从而在零样本泛化到分布外目标方面优于先前方法。

ABSTRACT

We are interested in training general-purpose reinforcement learning agents that can solve a wide variety of goals. Training such agents efficiently requires automatic generation of a goal curriculum. This is challenging as it requires (a) exploring goals of increasing difficulty, while ensuring that the agent (b) is exposed to a diverse set of goals in a sample efficient manner and (c) does not catastrophically forget previously solved goals. We propose Curriculum Self Play (CuSP), an automated goal generation framework that seeks to satisfy these desiderata by virtue of a multi-player game with four agents. We extend the asymmetric curricula learning in PAIRED (Dennis et al., 2020) to a symmetrized game that carefully balances cooperation and competition between two off-policy student learners and two regret-maximizing teachers. CuSP additionally introduces entropic goal coverage and accounts for the non-stationary nature of the students, allowing us to automatically induce a curriculum that balances progressive exploration with anti-catastrophic exploitation. We demonstrate that our method succeeds at generating an effective curricula of goals for a range of control tasks, outperforming other methods at zero-shot test-time generalization to novel out-of-distribution goals.

研究动机与目标

  • 为解决高效训练通用强化学习智能体以解决各种任务的挑战。
  • 自动生成兼顾渐进难度与多样性的目标课程,同时防止灾难性遗忘。
  • 通过引入对称化多智能体框架,克服先前方法的局限性(如依赖判别器或非对称自博弈中的样本效率低下)。
  • 实现样本高效、可扩展的动态课程生成,能够根据智能体的学习进度自适应调整。
  • 通过双重视角、非对称的目标生成器,在目标生成中同时体现合作(支架式支持)与竞争(挑战性)机制。

提出的方法

  • CuSP采用对称的四智能体设置:两名离策略的目标条件学生(Alice 和 Bob),以及两名基于遗憾最大化的智能体目标生成器(G_A 和 G_B),每个生成器与一名学生对齐。
  • 每个目标生成器通过极小化最大遗憾目标进行优化:G_A 的奖励为 Alice 与 Bob 的回报差值(R^A - R^B),以鼓励其提出对 Bob 挑战性高但对 Alice 可行的目标。
  • 该设计形成动态平衡:G_A 在提升 Bob 难度的同时支持 Alice 的学习,反之亦然,从而确保目标的多样性与可行性。
  • 框架引入熵正则化以促进目标空间的覆盖,并显式考虑学生策略的非平稳性,以防止遗忘。
  • 该方法在自博弈循环中运行,学生从教师生成的目标中学习,而教师则根据相对表现进行自适应调整,从而实现自主的课程推进。
  • 目标生成被限制在预设的目标空间内,允许整合人类先验知识以确保安全性和有效性。

实验结果

研究问题

  • RQ1对称的多智能体自博弈框架能否在目标条件强化学习中有效生成兼顾渐进难度与目标多样性的课程?
  • RQ2如何将自博弈扩展至非零和设置,以在课程生成中同时支持合作与竞争?
  • RQ3基于极小化最大遗憾的目标生成,在保持样本效率的同时,能在多大程度上缓解灾难性遗忘?
  • RQ4CuSP 与先前方法(如非对称自博弈(ASP)和基于 GAN 的目标生成)相比,在零样本泛化到分布外目标方面表现如何?
  • RQ5在 CuSP 框架中,多个智能体的交互会涌现出何种行为或技能?

主要发现

  • CuSP 在零样本泛化到分布外目标方面优于基线方法,展示了在多个控制环境中的卓越泛化能力。
  • 该方法成功维持了对先前已解决目标的性能,表明通过持续重新暴露和动态课程调整,有效缓解了灾难性遗忘。
  • CuSP 生成了多样化且逐步提升难度的课程,目标空间覆盖度因熵正则化和对称教师动态而增强。
  • 框架支持在无显式奖励塑形的情况下涌现出特定任务技能,表明自博弈动态有助于复杂行为的发现。
  • 实验结果表明,CuSP 在样本效率和未见目标上的性能方面均优于 ASP 和其他课程学习基线方法。
  • 消融研究证实,对称设计与基于遗憾的目标函数对性能至关重要,任一组件的移除均导致性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。