Skip to main content
QUICK REVIEW

[论文解读] Evolutionarily-Curated Curriculum Learning for Deep Reinforcement Learning Agents

Michael Cerny Green, Benjamin Sergent|arXiv (Cornell University)|Jan 16, 2019
Reinforcement Learning in Robotics参考文献 12被引用 4
一句话总结

本文提出演化校准课程学习(ECCL),一种利用演化算法生成训练地图以最大化DQN智能体损失的方法,从而迫使其面对并克服自身弱点。该方法加速了训练过程并提升了泛化能力,经演化课程训练的智能体即使在显著更长的训练时间后,性能仍优于在随机地图上训练的智能体。

ABSTRACT

In this paper we propose a new training loop for deep reinforcement learning agents with an evolutionary generator. Evolutionary procedural content generation has been used in the creation of maps and levels for games before. Our system incorporates an evolutionary map generator to construct a training curriculum that is evolved to maximize loss within the state-of-the-art Double Dueling Deep Q Network architecture with prioritized replay. We present a case-study in which we prove the efficacy of our new method on a game with a discrete, large action space we made called Attackers and Defenders. Our results demonstrate that training on an evolutionarily-curated curriculum (directed sampling) of maps both expedites training and improves generalization when compared to a network trained on an undirected sampling of maps.

研究动机与目标

  • 解决深度强化学习训练中暴力随机采样效率低下的问题。
  • 通过定向、自适应的课程生成,提升深度强化学习智能体的泛化能力并加速收敛。
  • 开发一种方法,通过演化生成的训练内容动态识别并针对网络弱点。
  • 在具有大离散动作空间的自定义游戏环境中,评估演化校准课程的有效性。

提出的方法

  • 演化算法生成使智能体损失最大化的游戏地图,表明其具有高难度或网络弱点。
  • 损失通过带优先经验回放的双Dueling DQN计算,确保训练的稳定与高效。
  • 训练课程根据智能体的表现动态更新,聚焦于暴露学习缺陷的地图。
  • 系统在训练智能体与基于智能体损失演化新地图之间交替进行,形成反馈回路。
  • 演化生成器具有通用性,仅需游戏参数和损失函数,无需领域特定调优。
  • 混合训练条件通过结合演化地图与随机生成地图来测试泛化能力,揭示对地图来源的过拟合风险。

实验结果

研究问题

  • RQ1演化生成器能否生成一种能加速深度强化学习训练的课程?
  • RQ2与随机采样相比,在演化校准地图上训练是否能提升泛化能力?
  • RQ3当智能体在演化地图与随机生成地图的混合组合上训练时,会发生什么?
  • RQ4智能体能否学会区分演化地图与构造性地图,这种能力是否损害性能?
  • RQ5演化生成器基于损失的适应度函数如何影响课程质量与智能体性能?

主要发现

  • 在1,600张地图后,完全基于演化课程训练的网络达到峰值分数22.14,显著优于随机训练的网络。
  • 即使在6,800张地图后,随机训练的网络分数也未超过20.83,表明在随机采样下泛化能力差。
  • 混合网络在演化与构造性地图的组合上训练,峰值分数为20.22,且持续保持高损失(10–14),表明泛化能力差。
  • 混合网络学会了区分地图来源,导致对测试集性能下降,出现过拟合。
  • 完全网络在初始50张地图后仅在演化地图上训练,能有效泛化到随机生成的测试地图,展现出强大的迁移学习能力。
  • 演化生成器的适应度函数(基于智能体损失)有效识别并针对网络弱点,提升了训练效率与性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。