[论文解读] Policy Optimization by Genetic Distillation
本文提出遗传策略优化(GPO),一种新颖的遗传算法,用于实现样本高效的深度强化学习。GPO 通过模仿学习在状态空间中实现有效的策略交叉,并使用策略梯度方法进行变异,相较于最先进(SOTA)的策略梯度方法,在 MuJoCo 运动控制任务中展现出更优的性能和更高的样本效率。
Genetic algorithms have been widely used in many practical optimization problems. Inspired by natural selection, operators, including mutation, crossover and selection, provide effective heuristics for search and black-box optimization. However, they have not been shown useful for deep reinforcement learning, possibly due to the catastrophic consequence of parameter crossovers of neural networks. Here, we present Genetic Policy Optimization (GPO), a new genetic algorithm for sample-efficient deep policy optimization. GPO uses imitation learning for policy crossover in the state space and applies policy gradient methods for mutation. Our experiments on MuJoCo tasks show that GPO as a genetic algorithm is able to provide superior performance over the state-of-the-art policy gradient methods and achieves comparable or higher sample efficiency.
研究动机与目标
- 解决将遗传算法应用于深度强化学习时的挑战,即参数空间交叉会严重损害神经网络性能。
- 通过结合进化搜索与基于梯度的学习方法,提升深度策略优化的样本效率。
- 设计一种在状态空间而非参数空间中操作的交叉机制,以保持策略性能。
- 通过用基于策略梯度的变异替代随机参数扰动,提升遗传多样性与学习效率。
- 证明混合遗传算法可在连续控制任务中达到或超越领先策略梯度方法的性能。
提出的方法
- 利用模仿学习在状态空间中执行策略交叉,其中子代策略模仿表现更优的父代在状态空间中的访问分布。
- 基于回合回报设计适应度函数,以选择高性能的策略对进行交叉,从而在遗传过程中实现自然选择。
- 采用策略梯度方法(如 A2C)进行变异,其中子代策略通过在环境共享批次样本上进行梯度下降来更新。
- 在变异过程中实现相似策略之间的数据共享,以提升样本效率并降低梯度估计的方差。
- 维护一个策略种群,通过标准遗传算法框架中的选择、交叉和变异算子,在多代中持续演化。
- 将遗传算子整合到强化学习循环中,每代通过轨迹滚动评估,并通过策略梯度更新进行改进。
实验结果
研究问题
- RQ1尽管参数空间交叉存在不稳定性,遗传算法是否仍能有效应用于连续控制任务中的深度策略优化?
- RQ2与参数空间交叉相比,通过模仿学习实现的状态空间交叉是否能保持或提升策略性能?
- RQ3基于策略梯度的变异是否能提供比随机参数扰动更优的学习信号和遗传多样性?
- RQ4基于模仿学习的交叉与基于策略梯度的变异相结合,如何影响样本效率和最终性能?
- RQ5结合基于适应度的选择与数据共享的遗传算法框架,在多大程度上提升了鲁棒性与可扩展性?
主要发现
- 在 MuJoCo 运动控制任务(包括 Walker2D 和 HalfCheetah)中,GPO 的最终性能优于最先进策略梯度方法(如 A2C 和 SAC)。
- 在 Walker2D 和 HalfCheetah 的坡道变体任务中,GPO 显著优于基线方法,表明其具备更强的探索能力与鲁棒性。
- 消融实验表明,所有组件(状态空间交叉、基于适应度的选择、变异过程中的数据共享)的组合可实现最高性能,GPO 的归一化性能为 1.0,而单策略基线仅为 0.33。
- 变异过程中的数据共享机制带来最大个体收益,性能从单策略基线的 0.33 提升至 0.83(Base+M),凸显其在样本效率中的关键作用。
- 增加种群规模可进一步提升 GPO 性能,证明其具备良好的可扩展性,适合并行化处理。
- 使用 GPO 训练的最终策略集成展现出比单策略更高的鲁棒性,表现为在最终代中整个种群性能更加一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。