[论文解读] Variational Automatic Curriculum Learning for Sparse-Reward Cooperative Multi-Agent Problems
本文提出变分自动课程学习(VACL),一种基于变分推断的课程学习框架,用于稀疏奖励下的合作多智能体强化学习。通过将训练目标分解为策略优化与任务分布更新,VACL 利用任务扩展与实体进展自动生成分层训练课程,在仅使用单台桌面计算机的情况下,实现了在 100 个智能体的简单传播环境中的 98% 覆盖率,并复现了躲藏与搜寻环境中如斜坡使用等复杂行为。
We introduce a curriculum learning algorithm, Variational Automatic Curriculum Learning (VACL), for solving challenging goal-conditioned cooperative multi-agent reinforcement learning problems. We motivate our paradigm through a variational perspective, where the learning objective can be decomposed into two terms: task learning on the current task distribution, and curriculum update to a new task distribution. Local optimization over the second term suggests that the curriculum should gradually expand the training tasks from easy to hard. Our VACL algorithm implements this variational paradigm with two practical components, task expansion and entity progression, which produces training curricula over both the task configurations as well as the number of entities in the task. Experiment results show that VACL solves a collection of sparse-reward problems with a large number of agents. Particularly, using a single desktop machine, VACL achieves 98% coverage rate with 100 agents in the simple-spread benchmark and reproduces the ramp-use behavior originally shown in OpenAI's hide-and-seek project. Our project website is at https://sites.google.com/view/vacl-neurips-2021.
研究动机与目标
- 解决在大规模智能体数量下,稀疏奖励环境中训练合作多智能体策略的挑战。
- 开发一种可扩展的、自动化的课程学习框架,逐步适应任务难度。
- 利用变分推断统一在任务配置与智能体/物体数量上的课程生成。
- 在无需奖励塑形的情况下,实现在复杂多智能体环境中样本高效、高性能的学习。
- 仅使用单台桌面计算机,复现躲藏与搜寻环境中如斜坡使用等涌现行为。
提出的方法
- 将多智能体强化学习(MARL)目标表述为变分推断问题,将其分解为策略改进与任务分布更新两项。
- 使用斯蒂尔变分梯度下降(SVGD)在课程学习过程中高效地将任务分布扩展至完整任务空间。
- 引入实体进展机制,逐步增加智能体或物体数量,利用大系统更难训练的归纳偏置。
- 对离散变量(如智能体数量)应用连续松弛,实现端到端可微的课程学习。
- 采用两阶段训练循环,交替进行当前任务上的策略优化与通过变分提议更新实现的课程更新。
- 在同质智能体间共享目标条件策略,通过 PPO 的离策略深度强化学习进行训练。
实验结果
研究问题
- RQ1能否利用变分推断框架推导出适用于合作多智能体强化学习的合理课程学习算法?
- RQ2如何在多智能体环境中自动地在任务配置与智能体数量上生成课程学习?
- RQ3此类课程是否能实现在稀疏奖励、高维多智能体设置下的样本高效训练?
- RQ4所提出方法是否能复现合作多智能体环境中如斜坡使用等复杂涌现行为?
- RQ5该方法是否能在仅使用单台桌面计算机和稀疏奖励的情况下,扩展至 100+ 个智能体?
主要发现
- VACL 仅使用稀疏奖励和单台桌面计算机,在 100 个智能体的简单传播基准中实现了 98% 的覆盖率。
- 该方法成功复现了 OpenAI 的躲藏与搜寻项目中观察到的斜坡使用行为,展示了复杂协调的涌现。
- 在锁与返回挑战中,VACL 的成功率超过 90%,显著优于所有基线方法(在相同训练预算下均未超过 15%)。
- 在 MPE 和基于 MuJoCo 的躲藏与搜寻环境中的多个基准上,VACL 在训练速度和最终性能方面均显著优于所有基线方法。
- 任务扩展与实体进展的结合实现了无需人工设计的高效分层课程学习。
- 对离散变量的连续松弛使得在智能体数量上实现无缝课程学习成为可能,实现了不同系统规模下的统一训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。