[论文解读] ERL-Re$^2$: Efficient Evolutionary Reinforcement Learning with Shared State Representation and Individual Policy Representation
ERL-Re² 提出了一种新颖的进化强化学习框架,通过双尺度表征将深度强化学习与进化算法统一:共享的非线性状态表征用于通用特征学习,个体的线性策略表征用于高效的行为级进化。通过在具有新型交叉与突变操作的线性策略空间中实现策略优化,并集成一种策略扩展的价值函数近似器(PeVFA),ERL-Re² 在连续控制任务中实现了最先进性能,同时提升了样本效率与收敛速度。
Deep Reinforcement Learning (Deep RL) and Evolutionary Algorithms (EA) are two major paradigms of policy optimization with distinct learning principles, i.e., gradient-based v.s. gradient-free. An appealing research direction is integrating Deep RL and EA to devise new methods by fusing their complementary advantages. However, existing works on combining Deep RL and EA have two common drawbacks: 1) the RL agent and EA agents learn their policies individually, neglecting efficient sharing of useful common knowledge; 2) parameter-level policy optimization guarantees no semantic level of behavior evolution for the EA side. In this paper, we propose Evolutionary Reinforcement Learning with Two-scale State Representation and Policy Representation (ERL-Re$^2$), a novel solution to the aforementioned two drawbacks. The key idea of ERL-Re$^2$ is two-scale representation: all EA and RL policies share the same nonlinear state representation while maintaining individual} linear policy representations. The state representation conveys expressive common features of the environment learned by all the agents collectively; the linear policy representation provides a favorable space for efficient policy optimization, where novel behavior-level crossover and mutation operations can be performed. Moreover, the linear policy representation allows convenient generalization of policy fitness with the help of the Policy-extended Value Function Approximator (PeVFA), further improving the sample efficiency of fitness estimation. The experiments on a range of continuous control tasks show that ERL-Re$^2$ consistently outperforms advanced baselines and achieves the State Of The Art (SOTA). Our code is available on https://github.com/yeshenpy/ERL-Re2.
研究动机与目标
- 解决个体智能体独立学习状态表征所导致的策略学习低效与冗余问题。
- 克服进化算法中参数级进化所存在的语义行为进化缺失与策略坍塌风险。
- 通过共享表征实现跨策略的价值函数泛化,提升进化强化学习中的样本效率。
- 通过在非线性参数空间之外的线性策略表征空间中操作,实现高效的行为级策略进化。
- 通过协同结合深度强化学习与进化算法,在连续控制基准测试中实现最先进性能。
提出的方法
- 引入双尺度表征:所有智能体共同学习的共享非线性状态表征 $Z_{\phi}$,以及个体的线性策略表征 $W$。
- 通过从所有智能体中提取的价值函数最大化统一梯度方向,优化共享状态表征 $Z_{\phi}$。
- 直接在直线性策略表征空间中执行进化操作(交叉与突变),以实现语义级的行为进化。
- 提出一种策略扩展的价值函数近似器(PeVFA)$\mathbb{Q}_{\theta}(s,a,W)$,采用单步TD学习方式以离策略方式训练,实现高效的适应度估计。
- 将PeVFA与进化及深度强化学习智能体集成,实现跨策略的价值估计泛化,提升样本效率。
- 通过将遗传算子替换为策略群体上的均值与协方差更新,支持与多种进化策略(如CEM)的灵活集成。
实验结果
研究问题
- RQ1在进化学习与强化学习智能体之间共享非线性状态表征,是否能提升特征学习效率并减少冗余?
- RQ2在直线性策略空间中进行行为级进化,是否相比参数级进化能带来更稳定有效的策略优化?
- RQ3PeVFA的离策略训练是否能实现在多样化策略群体中高效且泛化的适应度估计?
- RQ4ERL-Re²中深度强化学习与进化算法的协同是否在连续控制任务中优于现有最先进方法?
- RQ5该双尺度表征框架在复杂控制环境中在多大程度上提升了样本效率与收敛速度?
主要发现
- ERL-Re² 在MuJoCo基准套件的多种连续控制任务中均实现了最先进性能。
- 共享状态表征显著提升了特征学习效率,消除了冗余的、策略特异的表征。
- 线性策略表征实现了有效的行为级交叉与突变,降低了参数级进化中常见的策略坍塌风险。
- 离策略PeVFA训练实现了高效的适应度估计,降低了样本复杂度,提升了整体学习效率。
- ERL-Re² 在包括Swimmer与Humanoid在内的多种环境中,优于先进基线方法(如ERL及其他混合RL-EA方法)。
- 该方法在高维动作空间中表现出强大的泛化能力与稳定性,而传统进化方法在该场景下往往表现不佳。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。