Skip to main content
QUICK REVIEW

[论文解读] Benchmarking Quality-Diversity Algorithms on Neuroevolution for Reinforcement Learning

Manon Flageat, Bryan Lim|arXiv (Cornell University)|Nov 4, 2022
Reinforcement Learning in Robotics被引用 7
一句话总结

本文为强化学习领域中的深度神经进化质量-多样性(QD)算法提出了一套标准化基准测试套件,包含六个复杂度各异的机器人控制环境。该研究提出考虑高维搜索空间与环境随机性的度量方法,揭示了标准QD算法(如MAP-Elites)因‘幸运’解而出现性能下降,而随机搜索在面对随机性时反而产生更鲁棒的策略。

ABSTRACT

We present a Quality-Diversity benchmark suite for Deep Neuroevolution in Reinforcement Learning domains for robot control. The suite includes the definition of tasks, environments, behavioral descriptors, and fitness. We specify different benchmarks based on the complexity of both the task and the agent controlled by a deep neural network. The benchmark uses standard Quality-Diversity metrics, including coverage, QD-score, maximum fitness, and an archive profile metric to quantify the relation between coverage and fitness. We also present how to quantify the robustness of the solutions with respect to environmental stochasticity by introducing corrected versions of the same metrics. We believe that our benchmark is a valuable tool for the community to compare and improve their findings. The source code is available online: https://github.com/adaptive-intelligent-robotics/QDax

研究动机与目标

  • 为解决强化学习领域中深度神经进化QD算法缺乏标准化基准测试的问题。
  • 形式化定义能够应对高维神经网络搜索空间与环境随机性双重挑战的评估度量标准。
  • 实现QD神经进化在机器人控制任务中公平比较与可复现的进展。
  • 通过考虑适应度与行为描述符偏差方差的校正度量,量化解决方案在环境随机性下的鲁棒性。
  • 揭示现有QD算法在随机环境中的局限性,特别是其倾向于选择‘幸运’高分但不稳定的策略。

提出的方法

  • 该基准测试在Brax模拟器中定义了两个任务——单向与全向运动,在六个环境(Hopper, Walker, Half-Cheetah, Ant, Humanoid, Hexapod)中进行。
  • 针对每个环境指定行为描述符(BDs)与适应度函数,档案单元格数量基于BD维度与子划分(如30², 5⁴, 100²)。
  • 作者提出标准QD度量(覆盖度、QD得分、最大适应度、档案轮廓)的校正版本,通过多次评估每个个体以应对环境随机性。
  • 正式建立QD得分与档案轮廓曲线下的面积之间的关系,表明其与归一化适应度在档案中积分成正比。
  • 通过衡量适应度经随机方差校正后覆盖度与QD得分的下降程度,量化鲁棒性,即‘损失’度量。
  • 该基准测试在QDax库中实现,并公开发布,以支持可复现性与社区范围的评估。

实验结果

研究问题

  • RQ1标准QD算法(如MAP-Elites与CVT-MAP-Elites)在形态与环境复杂度逐步增加的多种机器人控制任务中表现如何?
  • RQ2环境随机性在多大程度上降低深度神经进化强化学习中QD生成策略的性能与鲁棒性?
  • RQ3考虑随机方差的校正度量能否揭示标准度量所忽略的QD算法潜在缺陷?
  • RQ4为何某些QD算法倾向于选择在单次评估中表现优异但平均表现差的‘幸运’解?
  • RQ5当将随机性鲁棒性作为优先目标时,随机搜索与QD算法的性能相比如何?

主要发现

  • MAP-Elites与CVT-MAP-Elites虽实现高覆盖度与QD得分,但在校正后覆盖度与QD得分上分别损失80%,表明其在随机性下鲁棒性差。
  • 尽管缺乏优化偏差,随机搜索仍产生更鲁棒的解决方案,表现为显著更低的损失度量,表明其避免了对幸运评估的过拟合。
  • 校正后的最大适应度度量因依赖单一个体,其方差高于其他校正度量,凸显对个体异常值的敏感性。
  • CVT-MAP-Elites算法因Voronoi剖分计算成本较高,比标准MAP-Elites耗时更长,但性能差异微小。
  • 档案轮廓曲线下方面积与QD得分在数学上成正比,验证了在使用归一化适应度时,该面积可作为性能代理指标。
  • 该基准测试揭示,标准QD度量无法检测由随机性引起的性能退化,因此必须使用校正度量以实现可靠评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。