Skip to main content
QUICK REVIEW

[论文解读] Improving Evolutionary Strategies with Generative Neural Networks

Louis Faury, Clément Calauzènes|arXiv (Cornell University)|Jan 31, 2019
Metaheuristic Optimization Algorithms Research参考文献 27被引用 4
一句话总结

本文提出使用双射生成神经网络(GNN)来构建高度灵活、可微分的进化策略(ES)搜索分布,克服了高斯等固定参数分布的局限性。该方法引入了一种定制的训练算法,使GNN能够加速收敛,并在多种优化场景(包括多峰和强化学习目标)中超越最先进ES算法。

ABSTRACT

Evolutionary Strategies (ES) are a popular family of black-box zeroth-order optimization algorithms which rely on search distributions to efficiently optimize a large variety of objective functions. This paper investigates the potential benefits of using highly flexible search distributions in classical ES algorithms, in contrast to standard ones (typically Gaussians). We model such distributions with Generative Neural Networks (GNNs) and introduce a new training algorithm that leverages their expressiveness to accelerate the ES procedure. We show that this tailored algorithm can readily incorporate existing ES algorithms, and outperforms the state-of-the-art on diverse objective functions.

研究动机与目标

  • 解决进化策略中固定参数搜索分布(如高斯分布)的局限性,这些局限性限制了探索与利用的平衡。
  • 探究由生成神经网络生成的高度灵活、可学习的搜索分布是否能提升优化效率。
  • 开发一种新型训练算法,以实现在ES框架内对基于GNN的搜索分布进行有效优化。
  • 证明所提方法可无缝集成至现有ES算法(如CMA-ES和xNES)中。
  • 在合成函数、多峰函数以及强化学习目标函数上评估该方法,展示其性能的持续提升。

提出的方法

  • 使用双射生成神经网络(GNN)建模ES中的搜索分布,实现高度灵活、非参数化的分布,同时具备可计算且可微分的对数概率。
  • 设计一种定制优化算法,将得分函数估计器(REINFORCE)适配用于训练GNN以优化ES目标,解决标准梯度更新中的不稳定性问题。
  • 利用自然梯度框架稳定训练过程,确保在搜索分布集中时仍能实现可靠更新。
  • 将基于GNN的搜索分布作为即插即用的扩展模块集成至现有ES算法(如CMA-ES、xNES)中,保留其核心更新机制。
  • 使用蒙特卡洛采样近似期望目标值及其梯度,实现基于ES目标的GNN端到端训练。
  • 将该方法应用于合成目标函数和强化学习任务,通过滚动(rollouts)直接策略搜索评估性能。

实验结果

研究问题

  • RQ1由GNN生成的灵活、非参数化搜索分布是否能提升进化策略的收敛速度和全局优化性能?
  • RQ2为何标准优化方法难以有效训练用于ES目标的GNN?如何通过定制化算法解决此问题?
  • RQ3在高度多峰或复杂景观中,基于GNN的搜索分布在多大程度上能超越标准参数化分布(如高斯分布)?
  • RQ4该方法在不同问题维度和目标函数结构(包括存在较差局部极小值的情况)下的可扩展性如何?
  • RQ5GNN-ES框架是否可有效应用于现实世界的强化学习任务,特别是在直接策略搜索设置中?

主要发现

  • 在Rosenbrock函数上,GNN-CMA-ES在10,000次函数评估时的性能目标值约为CMA-ES的10倍,表明在优化初期阶段实现了显著加速。
  • 在多峰的Rastrigin函数上,由于该函数具有高阶多峰性和平坦的全局结构,GNN-CMA-ES表现劣于CMA-ES,此时高斯分布的对称性提供了优势。
  • 在Styblinski、Griewank和Beale函数上,GNN-CMA-ES始终找到比CMA-ES更低的极小值,其中在d=4的Styblinski函数上改进达50%,在d=4的Beale函数上改进达80%。
  • 在所有测试的多峰景观中,GNN-xNES均优于xNES,在20个随机种子下平均最小值更低,尤其在全局结构更优的函数上表现更佳。
  • 在Mujoco的Swimmer和InvertedDoublePendulum任务的强化学习实验中,GNN-xNES发现高奖励策略的速度显著快于xNES,且在5个随机种子下均表现出一致的性能提升。
  • 所提方法成功将现有ES算法作为即插即用模块集成,表明基于GNN的搜索分布可灵活整合至成熟框架中,无需对架构进行大规模重构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。