Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning in Partially Observable Markov Decision Processes using Hybrid Probabilistic Logic Programs

Emad Saad|arXiv (Cornell University)|Nov 27, 2010
Logic, Reasoning, and Knowledge参考文献 31被引用 5
一句话总结

该论文提出了一种混合概率逻辑编程框架,通过使用具有概率答案集语义的普通混合概率逻辑程序,将强化学习整合到部分可观察马尔可夫决策过程(POMDPs)中。该框架支持领域特定知识的表示,证明了策略查找问题为NP完全问题,并展示了将POMDPs编码为逻辑程序和SAT问题的方法,引入了一种新的动作描述语言,支持因子化POMDP表示,并区分知识生成型动作与环境改变型动作。

ABSTRACT

We present a probabilistic logic programming framework to reinforcement learning, by integrating reinforce-ment learning, in POMDP environments, with normal hybrid probabilistic logic programs with probabilistic answer set seman-tics, that is capable of representing domain-specific knowledge. We formally prove the correctness of our approach. We show that the complexity of finding a policy for a reinforcement learning problem in our approach is NP-complete. In addition, we show that any reinforcement learning problem can be encoded as a classical logic program with answer set semantics. We also show that a reinforcement learning problem can be encoded as a SAT problem. We present a new high level action description language that allows the factored representation of POMDP. Moreover, we modify the original model of POMDP so that it be able to distinguish between knowledge producing actions and actions that change the environment.

研究动机与目标

  • 开发一个统一框架,将POMDP中的强化学习与概率逻辑编程相结合。
  • 通过混合概率逻辑程序,在POMDP中表示领域特定知识。
  • 在POMDP背景下,正式证明所提出方法的正确性。
  • 证明在所提框架中查找策略的问题为NP完全问题。
  • 引入一种高层动作描述语言,用于因子化POMDP表示,并区分知识生成型与环境改变型动作。

提出的方法

  • 该框架使用概率答案集语义,将强化学习与普通混合概率逻辑程序相结合。
  • 它扩展了标准POMDP模型,以区分产生知识的动作与改变环境的动作。
  • 该方法允许将任何强化学习问题编码为具有答案集语义的经典逻辑程序。
  • 它证明了强化学习问题可约简为SAT问题,从而可使用SAT求解器。
  • 引入了一种新的高层动作描述语言,以支持POMDP的因子化表示。
  • 该方法使用概率答案集编程来表示和推理部分可观察环境中不确定性。

实验结果

研究问题

  • RQ1能否使用具有概率答案集语义的混合概率逻辑编程,有效形式化POMDP中的强化学习?
  • RQ2如何通过逻辑编程将领域特定知识整合到基于POMDP的强化学习中?
  • RQ3在所提框架中,查找策略的计算复杂度是多少?
  • RQ4POMDP能否被编码为具有答案集语义的逻辑程序以及SAT问题?
  • RQ5在POMDP模型中,如何在语义上区分知识生成型动作与环境改变型动作?

主要发现

  • 所提框架中的策略查找问题被证明为NP完全问题。
  • 任何强化学习问题均可编码为具有答案集语义的经典逻辑程序。
  • 该框架通过一种新的高层动作描述语言,支持POMDP的因子化表示。
  • 强化学习问题可编码为SAT问题,从而可使用SAT求解器进行策略搜索。
  • 扩展后的POMDP模型成功区分了知识生成型动作与环境改变型动作。
  • 所提方法通过概率逻辑编程,正式将领域特定知识集成到POMDP中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。