Skip to main content
QUICK REVIEW

[论文解读] Online Hyper-parameter Tuning in Off-policy Learning via Evolutionary Strategies

Yunhao Tang, Krzysztof Choromański|arXiv (Cornell University)|Jun 13, 2020
Reinforcement Learning in Robotics参考文献 38被引用 5
一句话总结

本文提出在线超参数调优进化策略(OHT-ES),一种利用进化策略实现实时调整离策略强化学习中超参数的框架。通过在训练过程中应用ES动态调优n步回报和学习率等关键超参数,OHT-ES在多种连续控制基准测试中均实现了相对于静态超参数和先前方法的一致性能提升。

ABSTRACT

Off-policy learning algorithms have been known to be sensitive to the choice of hyper-parameters. However, unlike near on-policy algorithms for which hyper-parameters could be optimized via e.g. meta-gradients, similar techniques could not be straightforwardly applied to off-policy learning. In this work, we propose a framework which entails the application of Evolutionary Strategies to online hyper-parameter tuning in off-policy learning. Our formulation draws close connections to meta-gradients and leverages the strengths of black-box optimization with relatively low-dimensional search spaces. We show that our method outperforms state-of-the-art off-policy learning baselines with static hyper-parameters and recent prior work over a wide range of continuous control benchmarks.

研究动机与目标

  • 解决离策略强化学习对超参数选择的不稳定性与敏感性问题。
  • 开发一种适用于离策略算法的在线、实时超参数自适应方法,其中元梯度方法不适用。
  • 利用进化策略的优势,实现离策略设置下低维、黑箱超参数优化。
  • 通过在训练过程中动态调整n步回报和学习率等超参数,提升样本效率与训练稳定性。
  • 与静态及先前的自适应基线相比,在多样化连续控制环境中实现一致的性能提升。

提出的方法

  • 该方法使用进化策略(ES)在训练过程中实时优化n步回报和学习率等超参数。
  • 将超参数视为紧凑搜索空间内的可调变量,从而实现高效的ES优化。
  • 该框架与底层离策略算法无关,可与现有算法(如TD3和SAC)无缝集成。
  • ES更新基于环境提供的性能反馈,使用累积回报导出的代理目标进行优化。
  • 该方法避免对强化学习目标进行反向传播,因此适用于具有代理目标(如Bellman误差)的算法。
  • 该方法支持离散与连续超参数,实验聚焦于n步回报和学习率。

实验结果

研究问题

  • RQ1进化策略能否有效应用于离策略强化学习中的在线超参数调优?
  • RQ2通过ES实现的在线超参数自适应是否能在离策略算法中持续提升性能,优于静态超参数?
  • RQ3在样本效率与性能方面,OHT-ES与端到端基于ES的策略优化方法(ES-RL)相比如何?
  • RQ4调整n步回报与学习率对连续控制任务中训练稳定性和最终性能有何影响?
  • RQ5OHT-ES能否在多样化的离策略算法与基准环境之间实现泛化?

主要发现

  • 在13个模拟运动任务中,OHT-ES显著优于使用静态超参数的离策略基线方法,且在均值、中位数和最佳性能比等指标上均表现出性能提升。
  • 早期训练中,自适应n步回报(n=5)表现最佳,但通过OHT-ES实现的在线调优超越了该基线,并在长期训练中保持更优进展。
  • 在DMWalkerRun任务中,采用n步调优的OHT-ES取得757±7的平均性能,优于静态TD3基线(274±200),甚至超过SAC(23±1)。
  • 在Ant任务中,采用n步调优的OHT-ES取得2273±1107的性能,而表现最佳的基线(TD3)为3968±801,表明OHT-ES可与强基线持平或超越。
  • 在Ant任务中,采用学习率自适应的OHT-ES取得3526±1162的性能,优于TD3基线(3968±801)和ES-RL基线(2289±181)。
  • 在HalfCheetah任务中,采用n步调优的OHT-ES取得10758±397的性能,超过表现最佳的基线(SAC: 11451±406),表明其在任务间具有强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。