Skip to main content
QUICK REVIEW

[论文解读] Interpretable Reinforcement Learning with Ensemble Methods

Alexander Brown, Marek Petrik|arXiv (Cornell University)|Sep 19, 2018
Reinforcement Learning in Robotics参考文献 13被引用 3
一句话总结

本文提出使用梯度提升回归树来为强化学习创建可解释的策略,通过在神经网络或SARSA智能体生成的策略数据上训练集成模型。该方法在Cart-Pole和Mountain Car等简单环境中实现了与原始智能体相当或更优的性能,表明可解释模型可以匹配高性能强化学习系统,同时保持人类可读性。

ABSTRACT

We propose to use boosted regression trees as a way to compute human-interpretable solutions to reinforcement learning problems. Boosting combines several regression trees to improve their accuracy without significantly reducing their inherent interpretability. Prior work has focused independently on reinforcement learning and on interpretable machine learning, but there has been little progress in interpretable reinforcement learning. Our experimental results show that boosted regression trees compute solutions that are both interpretable and match the quality of leading reinforcement learning methods.

研究动机与目标

  • 为解决强化学习中可解释解决方案的缺乏,特别是在医疗保健和金融等高风险领域中的问题。
  • 探索集成方法,特别是梯度提升决策树,是否能够生成既准确又可解释的策略。
  • 评估两种方法:(1) 在预训练智能体生成的策略数据上进行监督学习;(2) 从零开始通过决策树进行策略梯度提升。
  • 研究树集成是否能抵抗过拟合并比原始强化学习智能体具有更好的泛化能力。
  • 评估空间高效树重用的可行性,以在限制模型大小的同时维持性能。

提出的方法

  • 训练一个小型回归树的梯度提升集成模型,以模仿强化学习环境中预训练深度神经网络策略的行为。
  • 利用从训练好的强化学习智能体(如神经网络或SARSA)收集的状态-动作对数据,通过梯度提升进行监督学习训练集成模型。
  • 通过将每棵树视为策略参数,并在期望回报上执行梯度上升,直接对决策树应用策略梯度下降。
  • 通过在计划移除的树的残差和预测结果上训练新树,实现树的重用。
  • 使用值函数近似来减少策略梯度更新中的方差,类似于演员-评论家方法。
  • 通过限制树的深度和集成规模来保持可解释性,可解释性通过节点数量或树深度进行衡量。

实验结果

研究问题

  • RQ1梯度提升的决策树集成能否在标准强化学习基准测试中匹配深度神经网络策略的性能?
  • RQ2与原始神经网络策略相比,该集成方法是否能提升泛化能力并更好地抵抗过拟合?
  • RQ3通过决策树进行的策略梯度提升是否能从零开始在简单MDP中逐步学习到有效的策略?
  • RQ4集成中树的重用是否能在不显著降低性能的前提下减小模型大小?
  • RQ5人类在多大程度上可以理解所得到的策略?可解释性与性能之间存在怎样的权衡?

主要发现

  • 在Cart-Pole环境中,基于神经网络策略数据训练的集成模型实现了完美性能(每集200个时间步),优于原始神经网络,后者表现出过拟合迹象。
  • 在Mountain Car环境中,集成模型与SARSA智能体性能相当,达到了相同的每集回报,但未超过它。
  • 通过策略梯度提升的决策树成功地随时间逐步提高累积奖励,在Cart-Pole中接近每集200的最大值,但速度远慢于神经网络。
  • 通过策略梯度提升的学习过程需要8,000至10,000个回合才能接近最优性能,而神经网络仅需约400个回合。
  • 树重用显著降低了性能;在第4,000回合开始重用后,性能下降且未能恢复,表明该策略无法有效维持高奖励。
  • 通过使用小型树,集成方法保持了可解释性,最终模型具有人类可读性,决策规则可通过树结构清晰追踪。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。