[论文解读] Neural Architecture Evolution in Deep Reinforcement Learning for Continuous Control
该论文提出了一种名为行为者-评论家神经演化(Actor-Critic Neuroevolution, ACN)的方法,通过一种基于蒸馏的新型突变算子,在连续控制任务中联合演化神经网络架构与策略。通过将离策略深度强化学习与神经演化相结合,ACN 发现了高性能、样本效率高的网络架构——通常比人工设计的架构更小且更有效,同时仅带来相对于固定架构标准训练的微小计算开销。
Current Deep Reinforcement Learning algorithms still heavily rely on handcrafted neural network architectures. We propose a novel approach to automatically find strong topologies for continuous control tasks while only adding a minor overhead in terms of interactions in the environment. To achieve this, we combine Neuroevolution techniques with off-policy training and propose a novel architecture mutation operator. Experiments on five continuous control benchmarks show that the proposed Actor-Critic Neuroevolution algorithm often outperforms the strong Actor-Critic baseline and is capable of automatically finding topologies in a sample-efficient manner which would otherwise have to be found by expensive architecture search.
研究动机与目标
- 解决深度强化学习在连续控制任务中对人工设计神经网络架构的依赖问题。
- 实现在训练过程中在线、样本高效的架构搜索,而非预训练或事后搜索。
- 开发一种稳定的遗传算子,用于演化网络拓扑,避免灾难性遗忘或性能崩溃。
- 将神经演化与使用共享全局回放缓冲区的离策略行为者-评论家训练相结合。
- 证明演化得到的架构可在更少环境交互下超越或匹配固定架构的性能。
提出的方法
- ACN 使用遗传算法演化一个由行为者和评论家网络组成的种群,每个网络具有不同的拓扑结构和参数。
- 提出一种基于知识蒸馏的新型突变算子,通过从全局回放缓冲区采样的状态,利用均方误差(MSE)损失将知识从父代传递给子代,从而扩展网络拓扑。
- 突变过程首先通过增加层或节点来提升网络容量,然后通过父代网络的知识蒸馏稳定性能。
- 对种群中所有个体应用基于TD3的离策略训练,通过共享的全局回放缓冲区提升样本效率。
- 使用锦标赛选择法根据适应度(即环境交互中的累积回报)选择下一代的父代。
- 该方法支持在线架构演化,即在训练过程中修改网络拓扑,而无需重新初始化策略或价值函数。
实验结果
研究问题
- RQ1是否可以在深度强化学习训练过程中,对连续控制任务的神经网络架构进行在线演化?
- RQ2基于知识蒸馏的突变算子是否能稳定行为者-评论家网络在拓扑变化过程中的性能?
- RQ3演化得到的架构是否可在极少额外环境交互下超越或匹配人工设计的架构?
- RQ4将神经演化与离策略强化学习结合,对样本效率和最终性能有何影响?
- RQ5在不同连续控制环境中演化出的架构模式是什么?是否与已知的最优设计一致?
主要发现
- ACN 在全部五个连续控制基准任务(HalfCheetah、Ant、Walker2d、Humanoid 和 Hopper)上,性能均优于或匹配使用固定架构的TD3。
- 在 Humanoid 任务中,ACN 实现了显著的性能提升,可能归因于其在架构和参数空间中的探索性。
- ACN 找到的最佳架构通常比默认的TD3架构更小——例如,HalfCheetah 中为 [80, 80, 88],而TD3默认为 [600, 450]——但仍能实现更优或相当的性能。
- 在 Ant 任务中,ACN 发现了一个仅含一层、含276个单元的架构,仅为TD3默认架构的一半大小,但性能相当。
- 该方法仅带来微小的计算开销,因为共享的回放缓冲区和演化得到的架构减少了所需的总环境交互次数。
- 实验表明,在训练过程中重新初始化优化器和目标网络(如ACN中所做)不会损害性能,甚至可能提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。