Skip to main content
QUICK REVIEW

[论文解读] Policy Iteration for Relational MDPs

Chenggang Wang, Roni Khardon|arXiv (Cornell University)|Jun 20, 2012
Reinforcement Learning in Robotics参考文献 11被引用 13
一句话总结

本文提出了一种用于关系马尔可夫决策过程(RMDPs)的新颖策略迭代算法,解决了传统策略迭代无法正确评估或改进策略的表示异常问题。通过将策略改进整合到评估阶段,所提出的算法即使在传统关系表示存在缺陷的情况下,也能确保收敛至最优策略。

ABSTRACT

Relational Markov Decision Processes are a useful abstraction for complex reinforcement learning problems and stochastic planning problems. Recent work developed representation schemes and algorithms for planning in such problems using the value iteration algorithm. However, exact versions of more complex algorithms, including policy iteration, have not been developed or analyzed. The paper investigates this potential and makes several contributions. First we observe two anomalies for relational representations showing that the value of some policies is not well defined or cannot be calculated for restricted representation schemes used in the literature. On the other hand, we develop a variant of policy iteration that can get around these anomalies. The algorithm includes an aspect of policy improvement in the process of policy evaluation and thus differs from the original algorithm. We show that despite this difference the algorithm converges to the optimal policy.

研究动机与目标

  • 解决尽管已有值迭代方法,但关系MDP缺乏精确策略迭代算法的问题。
  • 识别并解决在标准方案下策略值未定义或不可计算的关系MDP中的表示异常问题。
  • 设计一种保持收敛性的策略迭代变体,同时处理关系结构与符号表示。
  • 确保在关系规划框架中策略评估与改进的正确性与完备性。

提出的方法

  • 提出一种修改后的策略迭代框架,将策略改进与策略评估过程交错进行,区别于经典的两阶段迭代。
  • 采用支持符号状态与动作描述的关系表示,实现对状态实例的泛化。
  • 使用基于关系模板而非基状态的提升贝尔曼更新,计算过程中保持结构完整性。
  • 在关系策略表示上应用不动点迭代机制,以确保收敛至最优策略。
  • 通过确保即使在标准方案失效时策略值计算仍保持良好定义,来处理异常问题。
  • 采用符号动态规划方法,在整个迭代过程中保持策略与值函数的关系形式。

实验结果

研究问题

  • RQ1尽管存在表示限制,策略迭代能否有意义地扩展至关系MDP?
  • RQ2在关系策略评估中出现哪些异常,导致标准策略迭代无法正确运行?
  • RQ3如何将策略改进整合到评估阶段,以保持正确性与收敛性?
  • RQ4是否可能设计一种完全在关系符号空间中运行、无需实例化的策略迭代算法?
  • RQ5在定义的关系表示下,所提出的算法是否收敛至最优策略?

主要发现

  • 本文识别出关系策略表示中的两个根本异常:策略值未定义,以及在受限方案下值函数不可计算。
  • 所提出的算法通过将策略改进嵌入评估步骤,成功规避了这些异常,确保了值计算的良好定义性。
  • 尽管偏离了经典策略迭代,该算法被证明可在有限时间内收敛至最优策略。
  • 该方法在整个过程中保持符号化的关系表示,避免了对基状态枚举的需求。
  • 该算法在关系策略学习中表现出正确性与完备性,实现了在结构化随机环境中的精确规划。
  • 该方法为复杂关系领域中的精确规划提供了基础,这些领域此前仅限于近似值迭代。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。