Skip to main content
QUICK REVIEW

[论文解读] Combining Evolution and Deep Reinforcement Learning for Policy Search: a Survey

Olivier Sigaud|arXiv (Cornell University)|Mar 26, 2022
Reinforcement Learning in Robotics被引用 5
一句话总结

本综述系统性地对45种结合深度强化学习(RL)与进化策略(ES)用于策略搜索的近期算法进行了分类与统一。它根据进化在其中所起的作用——如策略优化、动作选择、多样性促进或超参数/形态调优——对方法进行组织,提出一个通用框架以阐明相互作用机制,并为新型混合机制提供思路。

ABSTRACT

Deep neuroevolution and deep Reinforcement Learning have received a lot of attention in the last years. Some works have compared them, highlighting theirs pros and cons, but an emerging trend consists in combining them so as to benefit from the best of both worlds. In this paper, we provide a survey of this emerging trend by organizing the literature into related groups of works and casting all the existing combinations in each group into a generic framework. We systematically cover all easily available papers irrespective of their publication status, focusing on the combination mechanisms rather than on the experimental results. In total, we cover 45 algorithms more recent than 2017. We hope this effort will favor the growth of the domain by facilitating the understanding of the relationships between the methods, leading to deeper analyses, outlining missing useful comparisons and suggesting new combinations of mechanisms.

研究动机与目标

  • 提供对近期结合深度强化学习与进化策略用于策略搜索的算法的全面、系统性综述。
  • 基于混合架构中进化功能角色对现有方法进行分类。
  • 在统一的通用框架下整合多样化方法,以阐明交互机制与设计模式。
  • 识别当前研究中的空白,突出缺失的比较,并建议新的机制组合。
  • 通过支持对混合RL-ES算法的更深入分析与基准测试,为未来研究提供支持。

提出的方法

  • 将45个2017年以后的算法根据进化优化的目的划分为五类:策略进化、动作选择、多样性促进、超参数调优与形态进化。
  • 引入一个通用模板,以说明深度RL(含经验回放与梯度更新)与深度神经进化(含基于种群的适应度评估)之间的交互。
  • 对每种算法分析其关键机制:演员注入、评论家梯度添加、代理适应度、软更新与缓冲区过滤。
  • 强调机制层面的交互,而非实验结果,聚焦于进化与RL组件如何结合。
  • 涵盖已发表与预印本工作,优先考虑方法论清晰性而非性能评估。
  • 该框架支持识别新型混合机制,如组合选择策略、改进的突变或在单一架构中引入软更新。

实验结果

研究问题

  • RQ1不同形式的进化优化(如策略搜索、动作选择、多样性、超参数调优)如何影响混合RL-ES算法的设计?
  • RQ2当前混合算法中,深度RL与进化组件之间的主导交互机制是什么?
  • RQ3哪些进化与RL机制的组合最为常见,其共享的设计模式是什么?
  • RQ4哪些组合尚未被充分探索,但可能带来性能提升?
  • RQ5本综述提出的通用框架如何支持设计新型、更高效的混合算法?

主要发现

  • 综述识别出45种近期结合深度RL与进化策略的算法,重点在于机制而非性能指标。
  • 进化最常用于优化策略(如通过GA、CEM、ES)以及改善探索或多样性,尤其在连续控制任务中。
  • 关键交互机制包括演员注入(进化策略更新)、评论家梯度添加与代理适应度计算。
  • 多个算法将RL启发的组件整合到ES中,如信任区域更新(如tres)或基于优势的梯度估计(如zoac),从而提升稳定性和样本效率。
  • 该框架揭示,结合机制(如软更新、改进的探索与超参数调优)仍处于研究不足但极具前景的阶段,适合未来开发。
  • 综述指出,尽管存在大量组合,但跨方法的系统性比较仍缺失,为基准驱动的研究创造了机遇。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。