[论文解读] Curriculum in Gradient-Based Meta-Reinforcement Learning
本文提出元主动域随机化(Meta-ADR),一种课程学习方法,通过在基于梯度的元强化学习中优化任务分布,以应对元过拟合问题并提升泛化能力。通过使用判别器识别困难任务,并训练SVPG粒子以提出多样化且具有挑战性的任务集合,Meta-ADR相较于均匀随机任务采样,在导航与运动基准测试中显著提升了适应稳定性和性能。
Gradient-based meta-learners such as Model-Agnostic Meta-Learning (MAML) have shown strong few-shot performance in supervised and reinforcement learning settings. However, specifically in the case of meta-reinforcement learning (meta-RL), we can show that gradient-based meta-learners are sensitive to task distributions. With the wrong curriculum, agents suffer the effects of meta-overfitting, shallow adaptation, and adaptation instability. In this work, we begin by highlighting intriguing failure cases of gradient-based meta-RL and show that task distributions can wildly affect algorithmic outputs, stability, and performance. To address this problem, we leverage insights from recent literature on domain randomization and propose meta Active Domain Randomization (meta-ADR), which learns a curriculum of tasks for gradient-based meta-RL in a similar as ADR does for sim2real transfer. We show that this approach induces more stable policies on a variety of simulated locomotion and navigation tasks. We assess in- and out-of-distribution generalization and find that the learned task distributions, even in an unstructured task space, greatly improve the adaptation performance of MAML. Finally, we motivate the need for better benchmarking in meta-RL that prioritizes extit{generalization} over single-task adaption performance.
研究动机与目标
- 为解决基于梯度的元强化学习对任务分布的敏感性问题,该问题会导致元过拟合、适应能力薄弱和训练不稳定。
- 通过学习任务课程而非依赖固定分布的随机采样,提升元强化学习中的泛化能力。
- 缓解元测试梯度更新后出现的负面适应和性能下降问题。
- 揭示当前元强化学习基准测试中的缺陷,尤其是由于任务采样非均匀导致的评估偏差。
- 倡导更优的基准测试实践,优先关注分布外泛化能力,而非分布内适应性能。
提出的方法
- Meta-ADR使用判别器基于预适应和后适应轨迹估计任务难度,并以此作为代理奖励。
- 判别器的奖励信号用于训练SVPG(带策略梯度的软演员评论家)粒子,以提出对元学习器最具挑战性的多样化新任务。
- 该算法迭代地从所学课程中采样并评估任务,重点关注导致最高适应难度的任务。
- 该方法用基于代理适应性能和难度反馈演化的课程替代均匀随机任务采样。
- 通过梯度更新端到端优化任务分布,使元学习器能够更稳健地适应更广泛的任务。
- 该方法受主动域随机化(ADR)启发,但针对元强化学习进行了改进,通过学习任务课程以提升元泛化能力。
实验结果
研究问题
- RQ1任务分布的选择如何影响元强化学习性能,特别是在元过拟合和适应稳定性方面?
- RQ2通过学习任务课程,是否能在基于梯度的元强化学习中实现超越均匀随机采样的泛化能力提升?
- RQ3Meta-ADR在元测试推理期间在多大程度上减少了元强化学习智能体的负面适应?
- RQ4基准测试环境中非均匀任务采样在多大程度上导致了报告的学习曲线和性能指标的偏差?
- RQ5当前元强化学习基准测试实践对评估真实泛化能力有何影响?
主要发现
- 与均匀随机任务采样相比,Meta-ADR在多个模拟运动与导航任务中显著提升了适应性能和稳定性。
- 所学课程减少了元过拟合,策略在元测试梯度步骤后表现出更少的性能下降和更少的负面适应实例。
- 在Humanoid-Direct-2D基准中,Meta-ADR实现了更强的最终性能,并显著降低了任务间的性能方差,尤其在分布外设置下表现更优。
- 对运动速度任务的评估表明,均匀采样倾向于选择较简单任务(如v_t = 0),导致学习曲线呈现误导性的单调趋势,无法反映真实泛化能力。
- 分布外任务中速度略偏离零(如v_t = 0.5)的性能优于分布内任务中更高运动速度的任务,表明当前基准任务设计存在根本性缺陷。
- 本研究证明,任务分布是元强化学习中的关键超参数,通过Meta-ADR学习该分布可生成更稳健、更具泛化能力的策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。