Skip to main content
QUICK REVIEW

[论文解读] Quantity vs. Quality: On Hyperparameter Optimization for Deep Reinforcement Learning

Lars Hertel, Pierre Baldi|arXiv (Cornell University)|Jul 29, 2020
Advanced Bandit Algorithms Research参考文献 34被引用 4
一句话总结

本文研究深度强化学习中的超参数优化,比较基于数量的方法(如 Successive Halving)与基于质量的方法(通过重复实验和贝叶斯优化)。结果表明,使用噪声鲁棒获取函数(qNEI)的贝叶斯优化优于所有其他方法,而剪枝和重复评估在不同随机种子下并未提升性能。

ABSTRACT

Reinforcement learning algorithms can show strong variation in performance between training runs with different random seeds. In this paper we explore how this affects hyperparameter optimization when the goal is to find hyperparameter settings that perform well across random seeds. In particular, we benchmark whether it is better to explore a large quantity of hyperparameter settings via pruning of bad performers, or if it is better to aim for quality of collected results by using repetitions. For this we consider the Successive Halving, Random Search, and Bayesian Optimization algorithms, the latter two with and without repetitions. We apply these to tuning the PPO2 algorithm on the Cartpole balancing task and the Inverted Pendulum Swing-up task. We demonstrate that pruning may negatively affect the optimization and that repeated sampling does not help in finding hyperparameter settings that perform better across random seeds. From our experiments we conclude that Bayesian optimization with a noise robust acquisition function is the best choice for hyperparameter optimization in reinforcement learning tasks.

研究动机与目标

  • 评估深度强化学习中的超参数优化是否应优先探索大量配置(数量)还是通过重复实验提升测量质量。
  • 评估不同随机种子下的性能变异性对超参数选择和优化结果的影响。
  • 确定在高观测噪声条件下,模型无关方法(如随机搜索和 Successive Halving)与模型相关贝叶斯优化方法中,哪种更有效。
  • 调查对每个超参数设置进行重复评估是否能提高在不同随机种子下超参数选择的鲁棒性。
  • 识别在深度强化学习任务中实现跨随机种子一致性能的最有效超参数优化策略。

提出的方法

  • 采用具有噪声鲁棒获取函数的贝叶斯优化,特别是 qNEI(拟牛顿期望改进),以建模超参数评估中的不确定性。
  • 比较四种主要的超参数优化策略:随机搜索、Successive Halving(ASHA),以及使用期望改进(EI)和下置信界(LCB)的贝叶斯优化,均包含和不包含重复评估。
  • 将这些方法应用于在两个连续控制任务上调整 PPO2:CartPole 平衡和倒立摆摆动上,超参数包括学习率对数和熵系数对数。
  • 对每个超参数配置进行重复评估(K=1, 3, 5),以估计真实期望奖励,性能在15次超参数优化运行中取平均。
  • 采用固定计算预算,每轮评估25、50和100个智能体,并报告在每种最佳配置下20次训练运行中的中位数和平均奖励。
  • 使用箱线图和统计摘要分析结果,以比较不同方法和任务下的分布性能。

实验结果

研究问题

  • RQ1在不同随机种子下存在高方差的情况下,通过 Successive Halving 剪枝超参数配置是否能带来优于贝叶斯优化的性能?
  • RQ2增加每个超参数设置的重复评估次数是否能提高深度强化学习中超参数选择的鲁棒性和准确性?
  • RQ3当观测因随机种子变化而存在噪声时,贝叶斯优化中的不同获取函数(如 EI 与 LCB 与 qNEI)表现如何?
  • RQ4当目标是找到在不同随机种子下具有泛化能力的设置时,模型无关与模型相关超参数优化方法之间是否存在显著性能差异?
  • RQ5在贝叶斯优化中,重复评估是否能改善选择在不同随机种子下实现高平均性能的超参数?

主要发现

  • 使用噪声鲁棒 qNEI 获取函数的贝叶斯优化(BoTorch-qNEI)在 CartPole 和倒立摆任务上均实现了最高的中位数和平均性能。
  • 在倒立摆摆动上任务中,BoTorch-qNEI 在100次评估后实现了平均奖励 -387.3,显著优于所有其他方法,包括 GPyOpt-LCB(-442.4)和 Random Search x5(-444.6)。
  • 在计算预算匹配的情况下,单次评估的随机搜索优于三次或五次重复的随机搜索,表明重复无法提升性能。
  • Successive Halving(ASHA)未优于贝叶斯优化,且在高方差下表现不一致。
  • 重复评估未提升贝叶斯优化性能,因为 GPyOpt-EI x3 和 GPyOpt-LCB x3 与单次评估版本相比无优势。
  • BoTorch-qNEI 的结果分布始终更优,且与其他方法重叠更少,尤其是在50次和100次评估后,表明其具有更强的鲁棒性和可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。