[论文解读] Ensuring Monotonic Policy Improvement in Entropy-regularized Value-based Reinforcement Learning
该论文提出了一种新颖的基于熵正则化的值函数强化学习算法,通过推导出一种可扩展的、考虑熵的策略改进下界,确保了单调策略改进。通过使用期望优势函数,结合可调节的插值系数 ζ 动态调整更新幅度,该方法抑制了策略振荡,在离散和连续控制任务中均实现了稳定、平滑的学习。
This paper aims to establish an entropy-regularized value-based reinforcement learning method that can ensure the monotonic improvement of policies at each policy update. Unlike previously proposed lower-bounds on policy improvement in general infinite-horizon MDPs, we derive an entropy-regularization aware lower bound. Since our bound only requires the expected policy advantage function to be estimated, it is scalable to large-scale (continuous) state-space problems. We propose a novel reinforcement learning algorithm that exploits this lower-bound as a criterion for adjusting the degree of a policy update for alleviating policy oscillation. We demonstrate the effectiveness of our approach in both discrete-state maze and continuous-state inverted pendulum tasks using a linear function approximator for value estimation.
研究动机与目标
- 解决近似值函数强化学习中策略振荡的关键问题,该问题会损害真实应用场景中的可靠性。
- 克服先前策略改进下界在大规模或连续状态空间中不可行的局限性。
- 通过聚焦于特定算法类别,开发一种实用且可扩展的方法,以确保熵正则化值函数强化学习中的单调策略改进。
- 设计一种算法,基于一种新颖且可计算的下界,利用可调节的插值系数动态调整策略更新的激进程度。
- 在使用线性函数逼近的离散状态迷宫和连续状态倒立摆任务中,验证该方法的有效性。
提出的方法
- 推导出一种新的策略改进下界,明确考虑无限时域马尔可夫决策过程中的熵正则化,从而提供更紧密且实用的保证。
- 仅使用期望策略优势函数作为下界输入,使其计算高效,并可扩展至大规模或连续状态空间。
- 引入一个动态插值系数 ζ ∈ [0,1],用于控制策略更新的程度,初始时保持保守,并仅在优势函数显示出可测量改进时才增加。
- 将策略更新表述为当前策略与贪婪策略的凸组合,其中 ζ 根据下界进行调整,以确保单调改进。
- 使用线性函数逼近 Q 函数,并通过 Tikhonov 正则化求解最小二乘贝尔曼更新,以稳定学习过程。
- 在离散和连续控制环境中应用该方法,使用经验贝尔曼算子和随机特征逼近实现高效的函数估计。
实验结果
研究问题
- RQ1能否为熵正则化的值函数强化学习推导出一种在连续状态空间中可扩展的策略改进下界?
- RQ2通过使用基于下界的可调节插值系数 ζ 动态调整策略更新幅度,是否能在实践中实现单调策略改进?
- RQ3与现有的保守策略迭代和 SPI-CVI 方法相比,该方法在抑制振荡和提升学习稳定性方面表现如何?
- RQ4即使采样有限且值函数近似存在误差,该方法是否仍能保持单调改进?
- RQ5该方法在使用线性函数逼近的离散和高维连续控制任务中是否均有效?
主要发现
- 所提出的 MI-CVI 算法在政策振荡方面显著优于 CVI 以及 SPI-CVI 的近似和精确版本,在 p=0.05 的显著性水平下具有统计显著性。
- MI-CVI 展现出平滑且单调的学习进展,ζ 从 0 逐渐增加至 1,表明其在时间上保持了稳定且一致的策略改进。
- 在倒立摆任务中,尽管使用了相同的函数逼近和采样设置,MI-CVI 的平均振荡值仍低于 E-SPI-CVI 和 CVI。
- 精确的 SPI-CVI 版本由于 δ 和 ΔA 的低估导致 ζ 值过大,从而引发极端振荡;而近似版本则因 ζ 几乎为零而过于保守。
- MI-CVI 的优势在于能够通过基于可靠、考虑熵的下界调节 ζ,实现保守性与激进性的平衡。
- 即使每轮迭代仅使用 200 步和总共 30 轮迭代,该方法仍能保持单调改进,表明其对采样和近似误差具有强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。