Skip to main content
QUICK REVIEW

[论文解读] Discovering Options for Exploration by Minimizing Cover Time

Yuu Jinnai, Jee Won Park|arXiv (Cornell University)|Mar 2, 2019
Reinforcement Learning in Robotics参考文献 32被引用 11
一句话总结

本文提出了一种名为Covering Options的方法,用于在强化学习中发现选项,其目标是最小化预期覆盖时间——即一个随机游走访问MDP中所有状态所需的步数。通过将早期探索建模为在MDP状态转移图上的均匀随机游走,并利用谱图理论通过代数连通性最小化覆盖时间的上界,该方法生成的选项可加速稀疏奖励环境中的探索,在基准领域的实证评估中优于先前的最先进方法。

ABSTRACT

One of the main challenges in reinforcement learning is solving tasks with sparse reward. We show that the difficulty of discovering a distant rewarding state in an MDP is bounded by the expected cover time of a random walk over the graph induced by the MDP's transition dynamics. We therefore propose to accelerate exploration by constructing options that minimize cover time. The proposed algorithm finds an option which provably diminishes the expected number of steps to visit every state in the state space by a uniform random walk. We show empirically that the proposed algorithm improves the learning time in several domains with sparse rewards.

研究动机与目标

  • 解决在稀疏奖励强化学习中高效探索的挑战。
  • 减少到达遥远且未知的奖励状态所需步骤的期望数量。
  • 开发一种不依赖探索期间奖励信号的选项发现方法。
  • 对MDP状态转移图上随机游走的预期覆盖时间进行形式化上界估计。
  • 通过实证验证,最小化覆盖时间可提升稀疏奖励领域中的学习速度。

提出的方法

  • 将早期探索建模为在MDP状态转移图上的均匀随机游走。
  • 使用图拉普拉斯矩阵的代数连通性作为预期覆盖时间上界的代理指标。
  • 应用Ghosh与Boyd(2006)提出的启发式方法,以最小化预期覆盖时间的上界。
  • 构建点选项(在单个状态处启动和终止),以减少覆盖时间上界。
  • 在先验知识有限时,利用状态转移图的关联矩阵指导选项生成。
  • 将选项集成到Q-learning中并使用内在奖励,以实现实时选项发现与策略学习。

实验结果

研究问题

  • RQ1最小化预期覆盖时间是否能加快在MDP中发现遥远稀疏奖励的速度?
  • RQ2如何在探索过程中不依赖奖励信号的情况下发现选项?
  • RQ3通过代数连通性减少覆盖时间上界,是否能提升稀疏奖励任务中的学习效率?
  • RQ4与现有的选项发现基线方法(如eigenoptions和betweenness options)相比,该方法表现如何?
  • RQ5基于覆盖时间最小化的在线选项发现是否能加速实时设置中的策略学习?

主要发现

  • 在Parr的迷宫(一种稀疏奖励环境)中,Covering Options在学习速度上显著优于eigenoptions和betweenness options。
  • 在汉诺塔和Taxi领域中,使用Covering Options的智能体比仅使用原始动作的智能体收敛更快。
  • 该方法通过利用谱图特性(尤其是代数连通性)减少了预期覆盖时间。
  • 使用Covering Options的在线选项发现机制使智能体能够在Parr的迷宫中可靠地找到目标,而使用原始动作的智能体则失败。
  • 该方法在所有测试的稀疏奖励基准任务中均达到最先进性能,展现出鲁棒性与可扩展性。
  • 该算法成功在无先验奖励信息的情况下生成选项,完全依赖MDP的转移结构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。