Skip to main content
QUICK REVIEW

[论文解读] Delegative Reinforcement Learning: learning to avoid traps with a little help

Vanessa Kosoy|arXiv (Cornell University)|Jul 19, 2019
Advanced Bandit Algorithms Research参考文献 8被引用 6
一句话总结

本文提出了委托强化学习(Delegative Reinforcement Learning, DRL),一种框架,使智能体能够在强化学习中通过偶尔将行动委托给人类顾问来避免灾难性‘陷阱’。通过将后验抽样与委托子程序相结合,该算法在存在陷阱的情况下,仍能在无限时域、非周期性的马尔可夫决策过程(MDP)中实现次线性遗憾,即使在有限假设下也适用——为自动驾驶系统或外科手术等高风险应用提供了实用的解决方案。

ABSTRACT

Most known regret bounds for reinforcement learning are either episodic or assume an environment without traps. We derive a regret bound without making either assumption, by allowing the algorithm to occasionally delegate an action to an external advisor. We thus arrive at a setting of active one-shot model-based reinforcement learning that we call DRL (delegative reinforcement learning.) The algorithm we construct in order to demonstrate the regret bound is a variant of Posterior Sampling Reinforcement Learning supplemented by a subroutine that decides which actions should be delegated. The algorithm is not anytime, since the parameters must be adjusted according to the target time discount. Currently, our analysis is limited to Markov decision processes with finite numbers of hypotheses, states and actions.

研究动机与目标

  • 解决强化学习中的根本性局限:陷阱(不可逆状态)会导致线性遗憾,使非周期性设置下的学习变得不可能。
  • 开发一种学习框架,避免陷阱而不假设陷阱不存在或允许重复致命错误,这对现实世界中安全关键的应用至关重要。
  • 形式化并分析一种智能体可将行动委托给外部顾问的设置,从而在具有有限状态、动作和假设的马尔可夫决策过程中实现安全探索。
  • 推导出在连续、无限时域强化学习设置中,使用几何时间折扣的非即时算法的遗憾边界,将委托作为安全机制。

提出的方法

  • 该算法是后验抽样强化学习(Posterior Sampling Reinforcement Learning, PSRL)的一种变体,智能体从其对可能MDP的后验信念中抽样一个假设。
  • 委托子程序用于确定何时调用顾问:当智能体的后验信念对当前假设下所有动作的期望效用为零时,或当不确定性较高时。
  • 时间轴被划分为长度为 $ O((1- u)^{-1/4}) $ 的区间,其中 $ \nu = \gamma $ 为时间折扣因子,从而实现周期性的信念更新与委托决策。
  • 智能体使用贝叶斯更新机制维护有限MDP假设集合上的信念分布,并仅在当前信念下所有动作的期望效用被认为过于不确定或危险时才进行委托。
  • 利用信息论工具(特别是智能体动作与真实假设之间的互信息)来控制探索与委托频率,从而对遗憾进行边界控制。
  • 分析利用了集中不等式与熵差,将期望遗憾以信念更新速率和假设数量的形式进行有界。

实验结果

研究问题

  • RQ1在存在陷阱的非周期性、无限时域MDP设置中,强化学习智能体能否实现次线性遗憾?
  • RQ2如何将人类顾问的委托正式整合进强化学习框架中,以防止不可逆错误?
  • RQ3当智能体使用后验抽样策略并结合委托机制时,在有限假设空间下可实现的理论遗憾边界是什么?
  • RQ4即使智能体由于不确定性无法避免所有陷阱,遗憾是否仍可实现次线性增长?
  • RQ5委托机制如何影响学习过程中的收敛速度与信息获取?

主要发现

  • 所提出的DRL算法实现了如下遗憾边界:$ O\left(\bar{\mathfrak{t}} \cdot \frac{1-\gamma}{1-\gamma^T} + \sqrt{\frac{(1-\gamma^T)\ln N}{\eta}} + \frac{(1-\gamma^T)\ln N}{\eta^2 \epsilon} \right) $,其中 $ \eta $ 控制探索程度,$ \bar{\mathfrak{t}} $ 为解决不确定性所需的期望时间。
  • 即使存在陷阱,遗憾仍随智能体数量 $ N $ 呈次线性增长,前提是智能体可委托给可靠的顾问。
  • 该算法并非即时算法,因其需要根据目标时间折扣 $ \gamma $ 调整参数(如区间长度 $ T $),但此限制在实际部署中可接受。
  • 分析表明,当智能体的信念分布高度不确定时,委托最为有效,且动作与假设之间的互信息控制了信念更新与遗憾的速率。
  • 关键洞见在于:通过仅在必要时进行委托,智能体避免了陷阱,同时仍能高效学习,遗憾由顾问提供的信息增益速率所界定。
  • 该框架在具有有限假设、状态与动作的MDP中得到形式化验证,为现实世界应用中的安全强化学习提供了理论基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。