[论文解读] Robust Reinforcement Learning using Adversarial Populations
本文提出对抗种群鲁棒性(RAP),一种在每次滚动训练中使用随机初始化的对抗种群来训练强化学习智能体的方法,显著提升了对动态扰动的鲁棒性。与在新扰动下失效的单对抗者方法不同,RAP通过暴露智能体于多样化的对抗动力学,使策略泛化能力更强,在不需专家调校不确定性集的情况下,鲁棒性优于领域随机化。
Reinforcement Learning (RL) is an effective tool for controller design but can struggle with issues of robustness, failing catastrophically when the underlying system dynamics are perturbed. The Robust RL formulation tackles this by adding worst-case adversarial noise to the dynamics and constructing the noise distribution as the solution to a zero-sum minimax game. However, existing work on learning solutions to the Robust RL formulation has primarily focused on training a single RL agent against a single adversary. In this work, we demonstrate that using a single adversary does not consistently yield robustness to dynamics variations under standard parametrizations of the adversary; the resulting policy is highly exploitable by new adversaries. We propose a population-based augmentation to the Robust RL formulation in which we randomly initialize a population of adversaries and sample from the population uniformly during training. We empirically validate across robotics benchmarks that the use of an adversarial population results in a more robust policy that also improves out-of-distribution generalization. Finally, we demonstrate that this approach provides comparable robustness and generalization as domain randomization on these benchmarks while avoiding a ubiquitous domain randomization failure mode.
研究动机与目标
- 解决单对抗者鲁棒强化学习的局限性,即在标准策略参数化下无法泛化到新的对抗扰动。
- 探究对抗种群是否能更好地近似混合纳什均衡,并在连续控制任务中提升鲁棒性。
- 对比RAP在鲁棒性与泛化性能方面与领域随机化的差异,尤其关注其是否能避免领域随机化的常见失效模式。
- 探索对抗种群是否可作为手工地设计领域随机化的更可扩展、更自动化的替代方案。
- 理解在模拟机器人基准测试中,对抗种群规模、训练稳定性与策略鲁棒性之间的权衡。
提出的方法
- 该方法引入一组随机对抗者,每个对抗者独立初始化,并在每次训练滚动中均匀采样。
- 在训练过程中,智能体学习一种策略,以在从种群中抽取的最坏情况对抗扰动下最大化其期望回报。
- 对抗种群与智能体在极小极大框架下联合训练,其中智能体旨在最大化性能,而每个对抗者则旨在最小化性能。
- 该方法使用标准深度强化学习算法(如SAC),并利用包含多个对抗动力学样本的共享环境交互批次。
- 对抗者策略被参数化为随机策略(如高斯分布),并通过策略梯度方法进行训练,以生成多样化且具有挑战性的扰动。
- 该方法通过基于种群的训练端到端学习对抗分布,避免了对专家定义的不确定性集的需求。
实验结果
研究问题
- RQ1使用单个对抗者是否能在不同动力学变化下始终提升强化学习策略的鲁棒性?
- RQ2与单个对抗者相比,对抗种群是否能更好地近似混合纳什均衡?
- RQ3对抗种群规模如何影响策略鲁棒性与训练稳定性?
- RQ4在分布外设置下,RAP是否能在无需专家调校不确定性分布的情况下,泛化能力优于领域随机化?
- RQ5RAP的鲁棒性是源于对混合策略的更好近似,还是源于对抗挑战的更高多样性?
主要发现
- RAP在所有测试的MuJoCo环境中均提升了鲁棒性,其中在Hopper及其他领域中,三名和五名对抗者取得了最佳性能。
- 单对抗者方法在面对新对抗者时无法泛化,表明当策略遭遇未见过的扰动模式时,其存在可被利用。
- 随着对抗种群规模增加,鲁棒性单调提升至三名对抗者,之后性能趋于平稳或略有下降,表明多样性与训练效率之间存在权衡。
- RAP在无需仔细调校不确定性分布的情况下,实现了与领域随机化相当或更优的鲁棒性,避免了领域随机化常见的失效模式。
- 该方法展现出更优的分布外泛化能力,通过RAP训练的策略在训练期间未见过的动态扰动下仍能保持性能。
- 使用对抗种群可使策略更难被利用,并对持续性方向力(如来自北方或南方的风)更具鲁棒性,而单对抗者策略则会适应固定模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。