Skip to main content
QUICK REVIEW

[论文解读] Fitted Q-Learning for Relational Domains

Srijita Das, Sriraam Natarajan|arXiv (Cornell University)|Jun 10, 2020
Reinforcement Learning in Robotics参考文献 34被引用 6
一句话总结

本文提出了首个关系型拟合Q-learning算法GBQL与RBFQ,利用关系型回归树(RRTs)与梯度提升来近似关系型马尔可夫决策过程中的Q值与贝尔曼残差。该方法在较少轨迹数据下实现强大泛化能力,且无需领域模型,性能在多数任务中优于RRTs,同时保持较低的贝尔曼误差。

ABSTRACT

We consider the problem of Approximate Dynamic Programming in relational domains. Inspired by the success of fitted Q-learning methods in propositional settings, we develop the first relational fitted Q-learning algorithms by representing the value function and Bellman residuals. When we fit the Q-functions, we show how the two steps of Bellman operator; application and projection steps can be performed using a gradient-boosting technique. Our proposed framework performs reasonably well on standard domains without using domain models and using fewer training trajectories.

研究动机与目标

  • 解决由于对象数量可变与关系复杂,命题方法失效的关系型领域中值函数近似的挑战。
  • 为关系型马尔可夫决策过程(RMDPs)开发一种无需模型、可扩展的近似动态规划方法。
  • 在不依赖领域模型或大量特征工程的前提下,实现在关系型任务中的有效泛化。
  • 将经典值函数近似技术(如瓦片编码、聚合方法)统一于关系型梯度提升框架中。
  • 证明关系型梯度提升能够有效学习因子化、关系型状态空间中的Q函数与贝尔曼残差。

提出的方法

  • 使用关系型回归树(RRTs)表示Q值与贝尔曼残差,实现在符号化、结构可变的状态-动作空间上的函数近似。
  • 通过梯度提升迭代学习RRTs,以最小化贝尔曼误差,每棵新树均用于修正前序集成的残差误差。
  • 通过树的评估执行贝尔曼算子的应用步骤,通过梯度提升回归执行投影步骤。
  • 采用非参数化、顺序学习方法,每棵新RRT均基于当前Q近似所产生的残差误差进行训练。
  • 利用RRT中从根到叶的路径作为关系特征,实现在不进行实例化的情况下对关系结构的泛化。
  • 通过将命题拟合Q-learning提升至一阶逻辑表示,实现向关系型领域的函数近似机制迁移。

实验结果

研究问题

  • RQ1梯度提升的关系型回归树是否能有效近似具有可变对象数量与关系的关系型领域中的Q值?
  • RQ2在训练数据有限的关系型强化学习任务中,所提方法是否比标准RRTs具有更好的泛化能力?
  • RQ3在不同关系型领域中,GBQL与RBFQ在贝尔曼误差与目标达成成功率方面相较于RRTs的表现如何?
  • RQ4该方法是否能在不使用领域模型或专家轨迹的情况下实现有竞争力的性能?
  • RQ5直接近似贝尔曼残差(RBFQ)是否比近似Q函数(GBQL)带来更好的收敛性或稳定性?

主要发现

  • 在4项任务中的3项,GBQL与RBFQ的测试集性能优于RRTs,证明其具备更优的泛化能力。
  • 在Unstack任务中,RBFQ在未见轨迹上的累积奖励方差更低,表明在复杂奖励设计下具有更高的稳定性。
  • RBFQ在关键状态中保持了更低的贝尔曼误差,但整体误差更高,表明局部与全局近似精度之间存在权衡。
  • 当有专家轨迹引导时,GBQL在早期迭代中表现出贝尔曼误差更快的下降速度,表明对人机协同反馈具有良好的响应能力。
  • 在某些情况下(如Logistics领域),RBFQ的贝尔曼误差上升,表明由于基函数的累积组合,投影步骤存在不稳定性。
  • 在分层ON任务中,RRT的表现优于GBQL与RBFQ,尽管差异无统计显著性,表明该方法在层次结构学习方面存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。