Skip to main content
QUICK REVIEW

[论文解读] Sample-Efficient Automated Deep Reinforcement Learning

Jörg K. H. Franke, Gregor Köhler|arXiv (Cornell University)|Sep 3, 2020
Reinforcement Learning in Robotics参考文献 39被引用 4
一句话总结

本文提出样本高效自动强化学习(SEARL),一种基于种群的自动强化学习框架,通过共享经验回放,在离策略深度强化学习中联合优化超参数与神经网络架构。通过在并行训练多个智能体的同时实现动态超参数自适应与架构演化,SEARL 相较于随机搜索和PBT将环境交互次数减少高达10倍,实现了更优或相当的性能,且样本效率显著提升。

ABSTRACT

Despite significant progress in challenging problems across various domains, applying state-of-the-art deep reinforcement learning (RL) algorithms remains challenging due to their sensitivity to the choice of hyperparameters. This sensitivity can partly be attributed to the non-stationarity of the RL problem, potentially requiring different hyperparameter settings at various stages of the learning process. Additionally, in the RL setting, hyperparameter optimization (HPO) requires a large number of environment interactions, hindering the transfer of the successes in RL to real-world applications. In this work, we tackle the issues of sample-efficient and dynamic HPO in RL. We propose a population-based automated RL (AutoRL) framework to meta-optimize arbitrary off-policy RL algorithms. In this framework, we optimize the hyperparameters and also the neural architecture while simultaneously training the agent. By sharing the collected experience across the population, we substantially increase the sample efficiency of the meta-optimization. We demonstrate the capabilities of our sample-efficient AutoRL approach in a case study with the popular TD3 algorithm in the MuJoCo benchmark suite, where we reduce the number of environment interactions needed for meta-optimization by up to an order of magnitude compared to population-based training.

研究动机与目标

  • 为解决深度强化学习(RL)中超参数优化(HPO)的高样本复杂度问题,该问题限制了其在真实场景中的部署。
  • 通过在训练阶段实现动态超参数自适应,克服强化学习的非平稳性问题。
  • 在计算开销最小的前提下,将神经架构搜索(NAS)集成到基于梯度的深度强化学习中。
  • 设计一种公平的自动强化学习评估协议,充分考虑实际的环境交互成本。
  • 证明通过共享经验实现超参数与架构的联合优化,可显著提升样本效率。

提出的方法

  • 一种基于种群的进化框架,可同时训练多个具有不同超参数与架构的强化学习智能体。
  • 在种群中共享经验回放记忆,通过重用收集到的经验提升样本效率。
  • 可演化的神经网络在训练过程中保留已学习的权重,同时动态调整深度、宽度和激活函数。
  • 通过进化突变实现动态超参数调优,支持配置调度而非静态设置。
  • 联合优化离策略强化学习算法(如TD3、DQN)及其算法与架构超参数。
  • 同步进化循环确保种群成员之间的协调性,同时最小化冗余的环境交互。

实验结果

研究问题

  • RQ1在强化学习智能体种群中共享经验回放,是否能显著减少元优化所需的环境交互次数?
  • RQ2在训练过程中动态调整超参数是否能相比静态配置提升最终性能?
  • RQ3能否以极低的计算成本,有效将神经架构演化集成到基于梯度的深度强化学习中?
  • RQ4与随机搜索和基于种群的训练(PBT)相比,SEARL在样本效率和最终性能方面表现如何?
  • RQ5SEARL能否在不同强化学习算法和环境中泛化,包括基于策略和离策略设置?

主要发现

  • 在MuJoCo基准测试中,SEARL相较随机搜索和PBT将元优化所需环境交互次数减少高达一个数量级(10倍)。
  • 在5个MuJoCo环境中的4个环境中,SEARL的性能与最佳随机搜索和PBT配置相当或更优。
  • 共享经验回放的使用使SEARL能够以接近单个智能体训练的样本成本完成自动强化学习,几乎可视为‘零成本’的环境交互开销。
  • SEARL发现了能随训练阶段自适应调整的高效超参数调度,有效应对强化学习问题的非平稳性。
  • 该框架在其他算法中也表现出良好的泛化能力,在5个Atari环境中,除一个外,所有环境中SEARL在调优Rainbow DQN时均优于最佳随机搜索配置。
  • 该框架仅需单个TD3训练两倍的环境交互次数,即可同时完成超参数与架构的优化,展现出极强的样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。