Skip to main content
QUICK REVIEW

[论文解读] ES-ENAS: Combining Evolution Strategies with Neural Architecture Search at No Extra Cost for Reinforcement Learning.

Xingyou Song, Krzysztof Choromański|arXiv (Cornell University)|Jan 19, 2021
Reinforcement Learning in Robotics参考文献 49被引用 9
一句话总结

ES-ENAS 提出了一种新颖的强化学习神经架构搜索(NAS)方法,通过将进化策略(ES)与高效NAS(ENAS)相结合,利用插入ES中心聚合器中的控制器,在无需额外成本的情况下实现参数共享。该方法在连续控制任务中实现了超过90%的模型压缩,从而实现了在资源受限的移动机器人平台上的高效部署。

ABSTRACT

We introduce ES-ENAS, a simple neural architecture search (NAS) algorithm for the purpose of reinforcement learning (RL) policy design, by combining Evolutionary Strategies (ES) and Efficient NAS (ENAS) in a highly scalable and intuitive way. Our main insight is noticing that ES is already a distributed blackbox algorithm, and thus we may simply insert a model controller from ENAS into the central aggregator in ES and obtain weight sharing properties for free. By doing so, we bridge the gap from NAS research in supervised learning settings to the reinforcement learning scenario through this relatively simple marriage between two different lines of research, and are one of the first to apply controller-based NAS techniques to RL. We demonstrate the utility of our method by training combinatorial neural network architectures for RL problems in continuous control, via edge pruning and weight sharing. We also incorporate a wide variety of popular techniques from modern NAS literature, including multiobjective optimization and varying controller methods, to showcase their promise in the RL field and discuss possible extensions. We achieve >90% network compression for multiple tasks, which may be special interest in mobile robotics with limited storage and computational resources.

研究动机与目标

  • 通过将基于控制器的NAS方法适配到强化学习场景,弥合监督学习NAS与强化学习之间的差距。
  • 通过参数共享,在强化学习中实现高效的神经架构搜索,利用进化策略的分布式特性。
  • 在强化学习策略中实现显著的模型压缩,以支持在移动和资源受限的机器人系统中的部署。
  • 探索将现代NAS技术(如多目标优化和不同控制器方法)整合到强化学习中的可行性。
  • 展示将ES与ENAS结合用于连续控制任务中组合神经架构训练的可行性和可扩展性。

提出的方法

  • 将ENAS中的控制器集成到进化策略的中心聚合器中,实现无需额外计算成本的参数共享。
  • 利用ES的分布式、黑箱特性作为基础,通过控制器自然地引入架构搜索。
  • 采用边缘剪枝和参数共享技术,训练专为连续控制任务设计的组合神经网络架构。
  • 将现代NAS技术(如多目标优化和多样化控制器架构)适配到强化学习场景中。
  • 利用ES固有的可扩展性,高效地在大规模搜索空间中进行训练与搜索。
  • 在保持ES原有简洁性和可并行性的同时,通过控制器集成引入架构搜索能力。

实验结果

研究问题

  • RQ1能否有效扩展进化策略,使其在强化学习中支持神经架构搜索,且计算开销最小?
  • RQ2如何在不增加额外计算成本的前提下,自然地将参数共享整合到基于ES的强化学习训练中?
  • RQ3在监督学习中开发的基于控制器的NAS技术,在多大程度上可被适配到强化学习中?
  • RQ4在强化学习策略中,使用所提出的ES-ENAS框架可实现多大程度的模型压缩?
  • RQ5当应用于强化学习架构搜索时,现代NAS技术(如多目标优化和多样化控制器)表现如何?

主要发现

  • ES-ENAS通过结合ES与ENAS,实现了强化学习中有效的神经架构搜索,借助内置的参数共享实现了显著的效率提升。
  • 该方法在连续控制任务中实现了神经网络架构超过90%的压缩,显著降低了模型大小和计算需求。
  • 将ENAS风格的控制器集成到ES中过程自然且无额外开销,同时保持了原始ES框架的可扩展性。
  • 该方法支持在强化学习场景中应用先进的NAS技术,如多目标优化和多样化控制器设计。
  • 该框架在移动机器人领域展现出强大的部署潜力,尤其适用于存储和计算资源受限的场景。
  • 结果表明,基于控制器的NAS可成功从监督学习迁移至强化学习,仅需极少修改。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。