Skip to main content
QUICK REVIEW

[论文解读] Single-partition adaptive Q-learning

João Pedro Araújo, Mário A. T. Figueiredo|arXiv (Cornell University)|Jul 14, 2020
Reinforcement Learning in Robotics参考文献 31被引用 4
一句话总结

本文提出单分区自适应Q-learning(SPAQL),一种改进的无模型强化学习算法,通过使用单一分区结构在学习过程中自适应地划分状态-动作空间,同时学习一个时不变策略。通过结合上界置信度(UCB)与玻尔兹曼探索,并采用自动调优的温度参数,SPAQL在收敛速度和样本效率方面优于自适应Q-learning(AQL),所需智能体数量和训练迭代次数更少,尤其在长时域任务中表现更优。

ABSTRACT

This paper introduces single-partition adaptive Q-learning (SPAQL), an algorithm for model-free episodic reinforcement learning (RL), which adaptively partitions the state-action space of a Markov decision process (MDP), while simultaneously learning a time-invariant policy (i. e., the mapping from states to actions does not depend explicitly on the episode time step) for maximizing the cumulative reward. The trade-off between exploration and exploitation is handled by using a mixture of upper confidence bounds (UCB) and Boltzmann exploration during training, with a temperature parameter that is automatically tuned as training progresses. The algorithm is an improvement over adaptive Q-learning (AQL). It converges faster to the optimal solution, while also using fewer arms. Tests on episodes with a large number of time steps show that SPAQL has no problems scaling, unlike AQL. Based on this empirical evidence, we claim that SPAQL may have a higher sample efficiency than AQL, thus being a relevant contribution to the field of efficient model-free RL methods.

研究动机与目标

  • 解决无模型强化学习在连续状态-动作空间中的样本效率低下和高内存开销问题。
  • 通过实现更快收敛和降低分区复杂度,改进自适应Q-learning(AQL)。
  • 通过结合UCB与玻尔兹曼探索策略并动态调节温度,平衡探索与利用。
  • 开发一种可高效扩展至长时域 episodic 任务的时不变策略学习方法。
  • 减少对人工超参数调优的依赖,特别是奖励缩放参数ξ。

提出的方法

  • SPAQL使用单一自适应分区结构,初始时以一个球体覆盖整个状态-动作空间,仅在必要时才进行分裂。
  • 在训练过程中,采用上界置信度(UCB)与玻尔兹曼探索的混合策略,以平衡探索与利用。
  • 玻尔兹曼探索中的温度参数通过循环调度动态调整,以提升学习效率。
  • 算法基于轨迹长度H和置信度水平δ自动调优奖励缩放参数ξ,尽管实验表明较低的ξ值更优。
  • 通过固定数量的评估轨迹N执行分区更新,每个球体的半径根据Q值方差和置信度边界进行调整。
  • 通过学习时不变策略避免逐时间步分区,从而降低内存和计算开销。

实验结果

研究问题

  • RQ1单分区自适应Q-learning算法是否能在连续MDP的episodic任务中实现比AQL更快的收敛速度和更高的样本效率?
  • RQ2结合UCB与玻尔兹曼探索并采用自适应温度调优,对学习性能和超参数敏感性有何影响?
  • RQ3与AQL相比,SPAQL在具有大量时间步的长时域任务中可扩展性如何?
  • RQ4奖励缩放参数ξ能否被有效调优或完全消除而不损害收敛保证?
  • RQ5使用时不变策略是否能降低分区复杂度,同时保持或提升性能?

主要发现

  • SPAQL的收敛速度优于AQL,且在达到相当或更优性能时所需智能体数量(即分区单元)显著更少。
  • 在具有拉普拉斯勘探函数的石油勘探问题中,尽管AQL的奖励缩放参数更高,SPAQL在累积奖励上仍优于AQL。
  • SPAQL对奖励缩放参数ξ的敏感度低于AQL,表明其更具鲁棒性,且更适用于自动调优。
  • 该算法在长轨迹(最长H=5)中保持稳定性能,展现出AQL无法实现的可扩展性。
  • 实证结果表明,将ξ设置为低于H/3的非零值可获得最优性能,而数值约为80则过度且适得其反。
  • ξ的理论表达式常产生大于H的值,与实证发现矛盾,提示需重新设计奖励项,使其上限受H约束。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。