Skip to main content
QUICK REVIEW

[论文解读] Conservative Exploration in Reinforcement Learning

Evrard Garcelon, Mohammad Ghavamzadeh|arXiv (Cornell University)|Feb 8, 2020
Advanced Bandit Algorithms Research参考文献 30被引用 8
一句话总结

本文在平均奖励和有限时域MDP中引入了强化学习中的保守探索,提出了两种乐观算法,保证(以高概率)智能体的累积性能始终不低于基线策略。该方法在不牺牲遗憾性能的前提下实现安全学习,理论遗憾界表明保守探索不会阻碍学习效率。

ABSTRACT

While learning in an unknown Markov Decision Process (MDP), an agent should trade off exploration to discover new information about the MDP, and exploitation of the current knowledge to maximize the reward. Although the agent will eventually learn a good or optimal policy, there is no guarantee on the quality of the intermediate policies. This lack of control is undesired in real-world applications where a minimum requirement is that the executed policies are guaranteed to perform at least as well as an existing baseline. In this paper, we introduce the notion of conservative exploration for average reward and finite horizon problems. We present two optimistic algorithms that guarantee (w.h.p.) that the conservative constraint is never violated during learning. We derive regret bounds showing that being conservative does not hinder the learning ability of these algorithms.

研究动机与目标

  • 为解决在线强化学习中缺乏性能保证的问题,特别是在现实应用中,中间策略必须满足最低性能标准。
  • 在MDP中形式化保守探索,将先前从 bandits 扩展到具有状态动态的序列决策问题。
  • 开发算法,保证(以高概率)在整个学习过程中,智能体的性能至少与给定基线策略相当。
  • 分析遗憾界,表明保守探索不会损害学习效率。

提出的方法

  • 提出一种保守约束:智能体策略的累积奖励至少为基线策略奖励的 (1−α) 倍,以确保性能安全。
  • 通过在 UCRL2 中引入保守置信区间,设计两种乐观算法——CUCRL2 用于平均奖励 MDP,以及其在有限时域问题中的变体。
  • 使用简化的 Bernstein 风格置信区间来处理奖励和转移概率,以平衡探索与安全。
  • 引入依赖状态的置信区间边界,考虑系统动态演化,确保随时间推移的安全性。
  • 采用基于阈值的保守条件,将智能体的期望累积奖励与基线策略进行比较,并根据置信水平 δ 进行调整。
  • 应用理论分析推导遗憾界,其增长速率与标准 UCRL2 相似,证明保守探索不会阻碍学习效率。

实验结果

研究问题

  • RQ1如何在 MDP 中定义一种保守探索条件,以确保智能体在学习过程中策略性能永不劣于基线策略?
  • RQ2在具有状态转移的在线强化学习中,为强制实施此类保守约束,需要哪些算法修改?
  • RQ3能否在不显著增加遗憾的情况下实现保守探索,相比标准探索算法?
  • RQ4为同时保持安全性和学习效率,价值估计的置信区间需要如何调整?
  • RQ5在平均奖励 MDP 中,保守探索可获得哪些理论保证(如遗憾界)?

主要发现

  • 在合成实验中,所提出的 CUCRL2 算法从未违反保守约束,而标准 UCRL2 在初始阶段有 53% 的回合违反该约束。
  • 在网格世界环境中,UCB-VI 在前 300 回合中有 83% 违反保守条件,而 CUCB-VI 全程保持满足。
  • CUCRL2 的遗憾与 UCRL2 呈相似增长趋势,表明保守探索未带来显著的遗憾代价。
  • 在基于成本的维护问题中,CUCRL2 保持了安全性(无系统故障),同时实现了具有竞争力的遗憾,而 UCRL2 多次发生故障。
  • 理论分析确认,保守算法的遗憾增长速率与标准 UCRL2 相同,证明保守性不会阻碍学习效率。
  • 使用简化的 Bernstein 置信区间可在保持理论保证的同时实现高效计算。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。