QUICK REVIEW
[论文解读] Average-reward model-free reinforcement learning: a systematic review and literature mapping
Vektor Dewanto, George Dunn|arXiv (Cornell University)|Oct 18, 2020
Reinforcement Learning in Robotics参考文献 106被引用 17
一句话总结
本文对平均奖励无模型强化学习进行了系统性综述与文献映射,通过引入表格值迭代之外的策略迭代与函数逼近方法,扩展了先前的研究。研究识别出关键的研究空白,如函数逼近设置下策略迭代的不成熟发展,以及探索与值函数逼近的挑战,为该领域提供了全面的分类体系与未来研究方向。
ABSTRACT
Reinforcement learning is important part of artificial intelligence. In this paper, we review model-free reinforcement learning that utilizes the average reward optimality criterion in the infinite horizon setting. Motivated by the solo survey by Mahadevan (1996a), we provide an updated review of work in this area and extend it to cover policy-iteration and function approximation methods (in addition to the value-iteration and tabular counterparts). We present a comprehensive literature mapping. We also identify and discuss opportunities for future work.
研究动机与目标
- 提供对平均奖励无模型强化学习的更新且全面的综述,超越1996年Mahadevan的综述。
- 将研究范围扩展至包括策略迭代与函数逼近方法,而不仅限于值迭代与表格方法。
- 通过分类图与表格系统性地映射现有文献,以阐明方法之间的关系。
- 识别并讨论开放的研究问题,特别是探索、值函数逼近以及在非遍历MDP中的适用性方面的问题。
- 通过突出尚未充分探索的领域(如批量学习、分布视角与多链MDP),为未来研究提供指导。
提出的方法
- 本文开展系统性文献综述,聚焦于无模型、无限时域、平均奖励强化学习,且状态与动作空间为有限集。
- 将现有工作分类为值迭代与策略迭代方案,并分别分析表格与函数逼近设置下的情况。
- 作者提出了四个文献映射(分类体系),展示基于增益逼近、值函数逼近与动作值逼近的方法间关系。
- 引入并分析平均奖励Q-learning、RVI类算法以及具有资格迹的演员-评论家方法的关键方程。
- 方法包括对策略梯度方法中三种优势逼近选择的对比分析,并讨论资格迹在演员-评论家学习中的作用。
- 利用动态规划与马尔可夫决策过程的理论基础,为强化学习方法提供上下文背景。
实验结果
研究问题
- RQ1为何在平均奖励无模型强化学习中,策略迭代方法的研究远少于值迭代方法,特别是在函数逼近设置下?
- RQ2后向视角资格迹如何与演员-评论家方法中基于梯度更新的动量产生有意义的关联?
- RQ3在平均奖励强化学习中,哪些基函数对值函数逼近最为有效,且其选择如何影响性能?
- RQ4在策略梯度算法中,三种可用的优势逼近方法中哪一种最有利于样本效率与收敛性?
- RQ5平均奖励强化学习能否扩展至多链MDP或连续状态空间,其理论基础为何?
主要发现
- 在平均奖励强化学习中,策略迭代方法相比值迭代方法显著研究不足,尤其是在函数逼近设置下。
- 基于值迭代的方法(如平均奖励Q-learning)对探索敏感,且需仔细处理最优增益偏移以稳定学习过程。
- 演员-评论家方法中的资格迹与SGD中的动量相似,暗示时序信用分配与优化动力学之间存在更深层联系。
- 优势逼近方法的选择显著影响策略梯度方法的性能,尽管在所有环境中并无单一方法始终最优。
- 目前尚无适用于多链MDP的无模型平均奖励强化学习方法,且在连续状态空间上的研究也极为有限,表明存在重大开放挑战。
- 本文指出,折扣奖励方法常被用作平均奖励强化学习的代理,但会引入现有文献未解决的近似误差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。