Skip to main content
QUICK REVIEW

[论文解读] Active Reinforcement Learning with Monte-Carlo Tree Search

Sebastian Schulze, Owain Evans|arXiv (Cornell University)|Mar 13, 2018
Advanced Bandit Algorithms Research参考文献 26被引用 6
一句话总结

该论文提出 BAMCP++,一种基于蒙特卡洛树搜索(MCTS)的主动强化学习(ARL)算法,可在表格型马尔可夫决策过程(MDP)中平衡查询成本与奖励获取。通过在MCTS的模拟过程中引入无模型学习器,BAMCP++ 实现了渐近贝叶斯最优性,并在更大的MDP上优于采用ARL专用启发式方法的无模型基线方法,展现出在小规模问题上的近似最优性能以及更优的可扩展性。

ABSTRACT

Active Reinforcement Learning (ARL) is a twist on RL where the agent observes reward information only if it pays a cost. This subtle change makes exploration substantially more challenging. Powerful principles in RL like optimism, Thompson sampling, and random exploration do not help with ARL. We relate ARL in tabular environments to Bayes-Adaptive MDPs. We provide an ARL algorithm using Monte-Carlo Tree Search that is asymptotically Bayes optimal. Experimentally, this algorithm is near-optimal on small Bandit problems and MDPs. On larger MDPs it outperforms a Q-learner augmented with specialised heuristics for ARL. By analysing exploration behaviour in detail, we uncover obstacles to scaling up simulation-based algorithms for ARL.

研究动机与目标

  • 为解决主动强化学习(ARL)中的探索挑战,其中奖励观测会产生成本,使得标准RL方法次优。
  • 将表格型MDP中的ARL形式化为贝叶斯自适应MDP问题,实现在不确定性下的合理规划。
  • 开发一种基于仿真的算法,实现ARL的渐近贝叶斯最优性,克服标准MCTS和启发式方法的局限性。
  • 通过引入更智能的无模型探索策略改进MCTS模拟,提升在更大MDP上的实际性能。

提出的方法

  • 该论文将表格型MDP中的ARL问题简化为贝叶斯自适应MDP的规划问题,其中智能体维护对未知奖励的后验分布,并规划以最大化期望回报减去查询成本。
  • 通过在回报计算中引入查询成本,并使用贝叶斯更新来精炼奖励信念,将BAMCP算法(一种用于贝叶斯自适应MDP的模型化MCTS)扩展至ARL场景。
  • BAMCP++ 引入了一种无模型的模拟策略,利用基于Q-learning的估计器引导模拟路径,提升利用效率并减少对随机模拟的依赖。
  • 该算法使用置信上界(UCB)进行树选择,并使用共轭先验维护对奖励的后验分布,从而实现高效的贝叶斯更新。
  • BAMCP++ 中的模拟过程由学习到的Q值估计引导,使模拟能够更好地预测长期回报,减少无谓的查询。
  • 超参数根据MDP类别进行调优以保证公平比较,性能在具有不同时域和状态-动作空间的多个MDP上进行评估。

实验结果

研究问题

  • RQ1能否将表格型MDP中的ARL正式简化为贝叶斯自适应MDP的规划问题,以在查询成本下实现最优探索?
  • RQ2基于贝叶斯更新的MCTS规划能否产生ARL的渐近贝叶斯最优策略?
  • RQ3MCTS中模拟策略的选择如何影响ARL性能,特别是在更大的MDP中?
  • RQ4在ARL模拟中,无模型的模拟策略能否优于随机或启发式模拟策略?
  • RQ5BAMCP++ 与采用专用探索启发式方法的无模型ARL算法相比,在总回报和查询效率方面表现如何?

主要发现

  • 在小型MDP如Early Fork和Late Fork上,BAMCP++ 实现了近似最优性能,其在Late4-30上的平均回报为28.2,在Early4-30上为25.9,优于MCCH和First-N。
  • 在25个随机MDP上,BAMCP++ 的平均回报为60.2(标准差8.8),显著优于MCCH(48.5)和First-N(55.7),在Rand-25基准测试中表现突出。
  • 在具有15个动作和100个时间步长的更大MDP中,BAMCP++ 超过采用ARL专用启发式方法的无模型基线,尤其在高时域设置如Early5-50中表现更优(BAMCP++为32.9,MCCH为39.3,First-N为42.9)。
  • 该算法对超参数设置具有鲁棒性,First-N和BAMCP++ 在不同查询预算下均表现稳定,而MCCH在未调优时表现较差。
  • BAMCP++ 采用无模型模拟策略显著提升了模拟质量,使长期回报估计更准确,并实现了更高效的查询选择。
  • BAMCP++ 在更长时域(如Late5-50)上相对性能的下降归因于每步模拟次数有限,凸显了基于模拟的ARL算法在扩展性方面的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。