[论文解读] Discovering General Reinforcement Learning Algorithms with Adversarial Environment Design
本文提出 GROOVE,一种通过对抗性环境设计来元训练策略优化器,以发现通用强化学习算法的方法。通过引入算法遗憾(AR)作为新型度量以指导课程学习,GROOVE 在未见过的环境(如 Atari)上显著提升了零样本泛化能力,其在鲁棒性和迁移性能方面均优于先前方法(如 LPG)。
The past decade has seen vast progress in deep reinforcement learning (RL) on the back of algorithms manually designed by human researchers. Recently, it has been shown that it is possible to meta-learn update rules, with the hope of discovering algorithms that can perform well on a wide range of RL tasks. Despite impressive initial results from algorithms such as Learned Policy Gradient (LPG), there remains a generalization gap when these algorithms are applied to unseen environments. In this work, we examine how characteristics of the meta-training distribution impact the generalization performance of these algorithms. Motivated by this analysis and building on ideas from Unsupervised Environment Design (UED), we propose a novel approach for automatically generating curricula to maximize the regret of a meta-learned optimizer, in addition to a novel approximation of regret, which we name algorithmic regret (AR). The result is our method, General RL Optimizers Obtained Via Environment Design (GROOVE). In a series of experiments, we show that GROOVE achieves superior generalization to LPG, and evaluate AR against baseline metrics from UED, identifying it as a critical component of environment design in this setting. We believe this approach is a step towards the discovery of truly general RL algorithms, capable of solving a wide range of real-world environments.
研究动机与目标
- 解决元学习强化学习算法在应用于未见环境时的泛化差距问题。
- 探究元训练分布的特性如何影响策略元优化(PMO)中的泛化性能。
- 开发一种自动生成信息丰富且具挑战性的课程的方法,用于元训练优化器。
- 提出算法遗憾(AR)作为 PMO 环境设计中任务信息量的代理度量。
- 证明 GROOVE 相较于现有方法(如 LPG)在零样本迁移至分布外环境(如 Atari)方面具有更优表现。
提出的方法
- 提出一种基于 Meta-UPOMDP 框架的新型策略元优化(PMO)公式,用于建模元优化器、环境策展人与智能体之间的交互。
- 引入算法遗憾(AR),一种专为 PMO 设计的新型遗憾近似方法,用于衡量元学习优化器与最优基线在特定任务上的性能差距。
- 采用对抗性课程生成机制,其中关卡策展人通过基于梯度的更新规则被训练以最大化元学习优化器的遗憾。
- 采用两阶段训练循环:在元训练阶段,智能体在动态策展的环境中进行训练,元优化器根据智能体回报和 AR 进行更新。
- 利用基于 JAX 的 GROOVE 高效实现,将元训练时间缩短至单张 V100 GPU 上仅 3 小时,显著提升学术可及性。
- 将无监督环境设计(UED)的思想拓展至元强化学习场景,扩展 PLR 以支持元优化与环境策展。

实验结果
研究问题
- RQ1元训练分布的特性如何影响元学习强化学习优化器的泛化性能?
- RQ2算法遗憾(AR)能否作为识别 PMO 中信息丰富且具挑战性环境的有效代理度量?
- RQ3通过 AR 实现的对抗性环境策展是否能生成比标准或随机课程设计更鲁棒、更具泛化能力的强化学习优化器?
- RQ4GROOVE 在零样本泛化至分布外环境(如 Atari)方面与 LPG 相比表现如何?
- RQ5AR 中的对抗性智能体对元训练课程质量有何影响?
主要发现
- GROOVE 在仅于网格世界环境进行元训练后,即在 Atari 游戏上实现了显著提升的分布外泛化能力,其在人类归一化回报方面大幅优于 LPG。
- 算法遗憾(AR)被识别为 PMO 环境设计中的关键组件,在 Min-Atar 上优于基线 UED 度量,而后者在先前任务中无法超越随机采样。
- 消融实验表明,若无 AR,PLR 和 LPG 均表现不足,且 AR 中的对抗性智能体对有效课程生成至关重要。
- GROOVE 展现出更强的鲁棒性,能够应对分布内挑战(如困难的网格世界关卡),表明其具备更强的泛化能力。
- 该方法将元训练时间缩短至单张 V100 GPU 上仅 3 小时,相比原始 LPG 实现提速 10 倍,显著促进学术普及。
- GROOVE 与 LPG 在 JAX 中的开源发布降低了计算门槛,为通用强化学习算法发现的未来研究提供了支持。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。