[论文解读] Deep Surrogate Assisted Generation of Environments
本文提出 DSAGE,一种样本高效的质量多样性(QD)算法,利用深度代理模型预测在新生成环境中的智能体行为,显著加速了多样且高质量环境的发现。在 Maze 和 Mario 两个基准领域中,DSAGE 在生成能激发强化学习与规划智能体多样化行为的环境方面,优于当前最先进的 QD 方法。消融实验表明,通过辅助行为数据和档案下采样,性能得到提升。
Recent progress in reinforcement learning (RL) has started producing generally capable agents that can solve a distribution of complex environments. These agents are typically tested on fixed, human-authored environments. On the other hand, quality diversity (QD) optimization has been proven to be an effective component of environment generation algorithms, which can generate collections of high-quality environments that are diverse in the resulting agent behaviors. However, these algorithms require potentially expensive simulations of agents on newly generated environments. We propose Deep Surrogate Assisted Generation of Environments (DSAGE), a sample-efficient QD environment generation algorithm that maintains a deep surrogate model for predicting agent behaviors in new environments. Results in two benchmark domains show that DSAGE significantly outperforms existing QD environment generation algorithms in discovering collections of environments that elicit diverse behaviors of a state-of-the-art RL agent and a planning agent. Our source code and videos are available at https://dsagepaper.github.io/.
研究动机与目标
- 解决质量多样性(QD)算法在跨环境生成多样化智能体行为时的高样本成本问题。
- 通过利用能够预测智能体性能而无需完整模拟的深度代理模型,提升环境生成的样本效率。
- 实现可扩展的、交互式的测试集,基于先前的执行轨迹使智能体行为多样化。
- 证明代理辅助的 QD 方法在发现行为多样化环境方面可超越传统 QD 方法。
提出的方法
- DSAGE 集成一个基于模拟智能体轨迹训练的深度代理模型,用于预测在新、未见环境中的智能体行为。
- 该算法使用 QD 优化器(例如 CMA-ME)在代理模型预测的引导下探索行为空间。
- 从代理模型预测的档案中通过下采样选择表现最佳的候选环境子集,并通过完整模拟进行评估。
- 利用新收集的模拟数据对代理模型进行微调,实现迭代改进并减少对昂贵模拟的依赖。
- 使用辅助行为数据(例如路径长度、重复访问次数)以增强代理模型的预测准确性和泛化能力。
- 该方法应用于两个基准领域:一个包含 ACCEL 强化学习智能体的 Maze 领域,以及一个包含 A* 规划智能体的 Mario 领域。
实验结果
研究问题
- RQ1深度代理模型是否能显著减少在 QD 优化中生成多样化环境所需的昂贵智能体模拟次数?
- RQ2在环境生成中,整合辅助行为数据如何提升代理模型的性能?
- RQ3从代理模型预测的档案中进行下采样,是否能带来比直接模拟所有候选环境更好的行为多样性?
- RQ4DSAGE 在不同领域中发现多样化智能体行为方面,与最先进 QD 算法相比表现如何?
- RQ5代理辅助的 QD 是否能有效扩展到具有涌现智能体行为的复杂、随机性环境?
主要发现
- 在 Maze 和 Mario 基准领域中,DSAGE 在发现多样化智能体行为方面优于最先进 QD 算法。
- 在 Maze 领域中,DSAGE 即使在更少的完整模拟下,也实现了更高的行为多样性,涵盖迷宫探索和重复访问等指标。
- 在 Mario 领域中,DSAGE 生成的关卡激发了更广泛的行为范围,如跳跃频率和击败敌人的次数,优于基线 QD 方法。
- 消融实验表明,使用辅助行为数据和下采样可提升代理模型性能,从而实现对行为空间更优的覆盖。
- 代理模型显著减少了所需完整模拟的次数,DSAGE 仅用传统 QD 方法所需样本的一小部分,即实现了高质量结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。