[논문 리뷰] Reinforcement Learning in Partially Observable Markov Decision Processes using Hybrid Probabilistic Logic Programs
이 논문은 정규 하이브리드 확률적 논리 프로그래밍을 사용하여 부분적으로 관찰 가능한 마르코프 결정 과정(POMDP)에서 강화 학습을 통합하는 하이브리드 확률적 논리 프로그래밍 프레임워크를 소개한다. 확률적 답변 집합 의미론을 활용하며, 도메인 특화 지식의 표현이 가능하고, 정책 탐색 문제의 NP-완전성을 증명하며, POMDP를 논리 프로그램과 SAT 문제로 인코딩하는 방법을 제시한다. 또한, 인자화된 POMDP 표현을 지원하고 지식 생성 행동과 환경 변경 행동을 구분하는 새로운 행동 기술 언어를 도입한다.
We present a probabilistic logic programming framework to reinforcement learning, by integrating reinforce-ment learning, in POMDP environments, with normal hybrid probabilistic logic programs with probabilistic answer set seman-tics, that is capable of representing domain-specific knowledge. We formally prove the correctness of our approach. We show that the complexity of finding a policy for a reinforcement learning problem in our approach is NP-complete. In addition, we show that any reinforcement learning problem can be encoded as a classical logic program with answer set semantics. We also show that a reinforcement learning problem can be encoded as a SAT problem. We present a new high level action description language that allows the factored representation of POMDP. Moreover, we modify the original model of POMDP so that it be able to distinguish between knowledge producing actions and actions that change the environment.
연구 동기 및 목표
- POMDP에서의 강화 학습과 확률적 논리 프로그래밍을 통합하는 통합 프레임워크를 개발하는 것.
- 하이브리드 확률적 논리 프로그래밍을 사용하여 POMDP 내에서 도메인 특화 지식을 표현할 수 있도록 하는 것.
- POMDP 맥락에서 제안된 접근법의 정당성을 공식적으로 증명하는 것.
- 제안된 프레임워크에서 정책 탐색 문제의 NP-완전성 증명하는 것.
- 인자화된 POMDP 표현을 지원하고 지식 생성 행동과 환경 변경 행동을 구분하는 고수준 행동 기술 언어를 도입하는 것.
제안 방법
- 확률적 답변 집합 의미론을 사용하여 강화 학습과 정규 하이브리드 확률적 논리 프로그래밍을 통합하는 프레임워크를 구축한다.
- 기존 POMDP 모델을 확장하여 지식을 생성하는 행동과 환경을 변화시키는 행동을 구분한다.
- 모든 강화 학습 문제를 답변 집합 의미론을 갖는 고전적 논리 프로그램으로 인코딩할 수 있도록 한다.
- 강화 학습 문제를 SAT 문제로 감소시켜 SAT 솔버를 사용한 정책 탐색이 가능하도록 한다.
- POMDP의 인자화된 표현을 지원하기 위해 새로운 고수준 행동 기술 언어를 도입한다.
- 확률적 답변 집합 프로그래밍을 사용하여 부분 관찰 가능한 환경에서의 불확실성 표현 및 추론을 수행한다.
실험 결과
연구 질문
- RQ1하이브리드 확률적 논리 프로그래밍과 확률적 답변 집합 의미론을 사용하여 POMDP에서의 강화 학습을 효과적으로 형식화할 수 있는가?
- RQ2논리 프로그래밍을 활용하여 도메인 특화 지식을 POMDP 기반 강화 학습에 통합할 수 있는가?
- RQ3제안된 프레임워크에서 정책 탐색의 계산 복잡도는 무엇인가?
- RQ4POMDP를 답변 집합 의미론을 갖는 논리 프로그램과 SAT 문제로 인코딩할 수 있는가?
- RQ5POMDP 모델에서 행동을 지식 생성 행동과 환경 변경 행동으로 의미론적으로 구분할 수 있는가?
주요 결과
- 제안된 프레임워크에서 정책 탐색 문제의 NP-완전성은 증명되었다.
- 모든 강화 학습 문제는 답변 집합 의미론을 갖는 고전적 논리 프로그램으로 인코딩될 수 있다.
- 새로운 고수준 행동 기술 언어를 통해 POMDP의 인자화된 표현이 가능해졌다.
- 강화 학습 문제는 SAT 문제로 인코딩될 수 있으며, 이는 정책 탐색에 SAT 솔버를 활용할 수 있음을 의미한다.
- 확장된 POMDP 모델은 지식 생성 행동과 환경 변경 행동을 성공적으로 구분한다.
- 제안된 접근법은 확률적 논리 프로그래밍을 사용하여 도메인 특화 지식을 POMDP에 공식적으로 통합한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.