Skip to main content
QUICK REVIEW

[论文解读] Learning adaptive differential evolution algorithm from optimization experiences by policy gradient

Jianyong Sun, Xin Liu|arXiv (Cornell University)|Feb 6, 2021
Metaheuristic Optimization Algorithms Research参考文献 55被引用 4
一句话总结

本文提出了一种基于强化学习的自适应差分进化(LDE)算法,通过策略梯度与LSTM控制器从优化经验中学习最优控制参数(F, CR, N)。该方法将参数控制建模为马尔可夫决策过程,在CEC’13和CEC’17测试集上实现了具有竞争力的性能,证明了基于经验的自适应参数调优在进化计算中的有效性。

ABSTRACT

Differential evolution is one of the most prestigious population-based stochastic optimization algorithm for black-box problems. The performance of a differential evolution algorithm depends highly on its mutation and crossover strategy and associated control parameters. However, the determination process for the most suitable parameter setting is troublesome and time-consuming. Adaptive control parameter methods that can adapt to problem landscape and optimization environment are more preferable than fixed parameter settings. This paper proposes a novel adaptive parameter control approach based on learning from the optimization experiences over a set of problems. In the approach, the parameter control is modeled as a finite-horizon Markov decision process. A reinforcement learning algorithm, named policy gradient, is applied to learn an agent (i.e. parameter controller) that can provide the control parameters of a proposed differential evolution adaptively during the search procedure. The differential evolution algorithm based on the learned agent is compared against nine well-known evolutionary algorithms on the CEC'13 and CEC'17 test suites. Experimental results show that the proposed algorithm performs competitively against these compared algorithms on the test suites.

研究动机与目标

  • 解决差分进化中选择最优控制参数(F, CR, N)的挑战,这些参数通常具有问题特异性且难以手动调优。
  • 通过基于实时反馈在搜索过程中实现动态、自适应的参数调整,克服固定或启发式参数控制的局限性。
  • 开发一种能够从多个问题的历史优化经验中学习的参数控制器,而非依赖单次运行的在线反馈。
  • 通过强化学习发现稳定且可泛化的参数策略,提升差分进化的鲁棒性、效率与性能。
  • 通过学习在何时使用较高或较低的F和CR值来实现探索与开发的自适应平衡,基于搜索进度与问题特征。

提出的方法

  • 将自适应参数控制问题建模为有限时域马尔可夫决策过程(MDP),其中状态表示优化进度,动作为参数设置。
  • 使用长短期记忆(LSTM)循环神经网络作为策略网络,编码历史优化状态并生成控制参数(F, CR, N)。
  • 使用策略梯度强化学习算法训练LSTM策略,以基于收敛质量与多样性度量最大化累积奖励。
  • 从CEC’13测试集的训练中收集优化经验,用于在部署到未见问题前预训练控制器。
  • 将训练好的控制器集成到标准DE框架中,允许在搜索过程的每代中动态更新参数。
  • 将状态特征(如适应度范围、种群多样性、收敛速率)定义为LSTM的输入,以指导自适应参数选择。

实验结果

研究问题

  • RQ1强化学习智能体能否基于多个问题的优化经验,自适应地控制DE参数(F, CR, N)?
  • RQ2经策略梯度训练的LSTM控制器是否在收敛速度与解质量方面优于传统的固定或启发式参数控制策略?
  • RQ3所学参数策略在不同问题类型上的泛化能力如何,特别是在未见过的CEC’17基准函数上的表现?
  • RQ4在特定问题集(如CEC’13)上进行训练,对控制器在不同或更高维问题上的性能有何影响?
  • RQ5基于经验的学习是否能实现比仅依赖在线反馈的方法更稳定、更鲁棒的参数自适应?

主要发现

  • 所提出的LDE算法在CEC’13和CEC’17测试集上与九种知名进化算法相比表现出具有竞争力的性能,展现出强大的泛化能力与鲁棒性。
  • 经策略梯度训练的LSTM控制器成功学习到根据问题特征与搜索进度动态调整F和CR值,以实现探索与开发的平衡。
  • 在30D问题上训练控制器需要大量计算资源,消耗显著的CPU/GPU时间,表明存在较高的训练成本与可扩展性挑战。
  • 该控制器在与训练集特征不相关的任务上表现有限,表明泛化能力受限于训练数据的相似性。
  • 由于LSTM策略网络的推理开销,LDE算法的时间复杂度高于基线DE变体。
  • 尽管计算成本较高,LDE方法仍优于多种最先进算法,表明基于经验的自适应参数控制在进化计算中具有重要价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。