Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning in Partially Observable Markov Decision Processes using Hybrid Probabilistic Logic Programs

Emad Saad|arXiv (Cornell University)|Nov 27, 2010
Logic, Reasoning, and Knowledge参考文献 31被引用数 5
ひとこと要約

この論文は、確率的答え集合意味論を用いた通常のハイブリッド確率的論理プログラミングを用いて、部分的に観測可能なマルコフ決定過程(POMDP)における強化学習を統合するハイブリッド確率的論理プログラミングフレームワークを導入する。ドメイン固有の知識の表現を可能にし、方策探索問題がNP完全であることを証明し、POMDPを論理プログラムおよびSAT問題にエンコードすることを示し、要因分解されたPOMDP表現を可能にする新規なアクション記述言語を導入し、知識を生成する行動と環境を変化させる行動の区別を可能にする。

ABSTRACT

We present a probabilistic logic programming framework to reinforcement learning, by integrating reinforce-ment learning, in POMDP environments, with normal hybrid probabilistic logic programs with probabilistic answer set seman-tics, that is capable of representing domain-specific knowledge. We formally prove the correctness of our approach. We show that the complexity of finding a policy for a reinforcement learning problem in our approach is NP-complete. In addition, we show that any reinforcement learning problem can be encoded as a classical logic program with answer set semantics. We also show that a reinforcement learning problem can be encoded as a SAT problem. We present a new high level action description language that allows the factored representation of POMDP. Moreover, we modify the original model of POMDP so that it be able to distinguish between knowledge producing actions and actions that change the environment.

研究の動機と目的

  • POMDPにおける強化学習と確率的論理プログラミングを統合する包括的なフレームワークの開発。
  • ハイブリッド確率的論理プログラミングを用いて、POMDP内でのドメイン固有の知識の表現を可能にする。
  • POMDPの文脈において、提案手法の正しさを形式的に証明する。
  • 提案フレームワークにおける方策探索がNP完全であることを示す。
  • 要因分解されたPOMDP表現を可能にする高水準のアクション記述言語を導入し、知識を生成する行動と環境を変化させる行動の区別を行う。

提案手法

  • フレームワークは、確率的答え集合意味論を用いた通常のハイブリッド確率的論理プログラミングと強化学習を統合する。
  • 標準的なPOMDPモデルを拡張し、知識を生成する行動と環境を変化させる行動の区別を可能にする。
  • あらゆる強化学習問題を答え集合意味論を備えた古典的論理プログラムにエンコードすることが可能である。
  • 強化学習問題がSAT問題に還元可能であることを示し、方策探索にSATソルバを利用可能にする。
  • 要因分解されたPOMDP表現を支援する新規な高水準アクション記述言語を導入する。
  • 確率的答え集合プログラミングを用いて、部分的に観測可能な環境における不確実性の表現と推論を行う。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッド確率的論理プログラミングと確率的答え集合意味論を用いたPOMDPにおける強化学習は、効果的に形式化可能か?
  • RQ2論理プログラミングを用いて、ドメイン固有の知識をPOMDPベースの強化学習に統合する方法は何か?
  • RQ3提案フレームワークにおける方策探索の計算複雑性は何か?
  • RQ4POMDPは答え集合意味論を備えた論理プログラムおよびSAT問題にエンコード可能か?
  • RQ5POMDPモデルにおいて、アクションを知識生成行動と環境変化行動として意味論的に区別する方法は何か?

主な発見

  • 提案フレームワークにおける方策探索問題は、NP完全であることが証明された。
  • あらゆる強化学習問題を答え集合意味論を備えた古典的論理プログラムにエンコード可能である。
  • フレームワークは、新規な高水準アクション記述言語を用いてPOMDPの要因分解表現を可能にする。
  • 強化学習問題はSAT問題にエンコード可能であり、方策探索にSATソルバを利用可能にする。
  • 拡張されたPOMDPモデルは、知識を生成する行動と環境を変化させる行動の区別を効果的に実現した。
  • 提案手法は、確率的論理プログラミングを用いてドメイン固有の知識をPOMDPに形式的に統合した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。