Skip to main content
QUICK REVIEW

[논문 리뷰] Policy Iteration for Relational MDPs

Chenggang Wang, Roni Khardon|arXiv (Cornell University)|2012. 06. 20.
Reinforcement Learning in Robotics참고 문헌 11인용 수 13
한 줄 요약

이 논문은 표준 정책 반복 기법이 정책을 올바르게 평가하거나 개선할 수 없게 만드는 표현적 이상 현상들을 다루기 위해 관계형 마르코프 결정 과정(Relational MDPs, RMDPs)을 위한 새로운 정책 반복 알고리즘을 제안한다. 제안된 알고리즘은 정책 개선을 평가 단계에 통합함으로써, 기존의 관계형 표현 방식에서 발생하는 문제들에도 불구하고 최적의 정책으로 수렴함을 보장한다.

ABSTRACT

Relational Markov Decision Processes are a useful abstraction for complex reinforcement learning problems and stochastic planning problems. Recent work developed representation schemes and algorithms for planning in such problems using the value iteration algorithm. However, exact versions of more complex algorithms, including policy iteration, have not been developed or analyzed. The paper investigates this potential and makes several contributions. First we observe two anomalies for relational representations showing that the value of some policies is not well defined or cannot be calculated for restricted representation schemes used in the literature. On the other hand, we develop a variant of policy iteration that can get around these anomalies. The algorithm includes an aspect of policy improvement in the process of policy evaluation and thus differs from the original algorithm. We show that despite this difference the algorithm converges to the optimal policy.

연구 동기 및 목표

  • 기존의 가치 반복 접근법은 존재하지만 관계형 MDPs를 위한 정확한 정책 반복 알고리즘이 부족한 문제를 해결하기 위해.
  • 기존의 표준 기법에서 정책 값이 잘 정의되지 않거나 계산이 불가능한 관계형 표현에서 발생하는 표현적 이상 현상을 식별하고 해결하기 위해.
  • 관계형 구조와 기호적 표현을 유지하면서도 수렴성을 유지하는 정책 반복 변형을 설계하기 위해.
  • 관계형 계획 프레임워크 내에서 정책 평가 및 개선의 정확성과 완전성을 확보하기 위해.

제안 방법

  • 전통적인 이중 단계 반복과 다름없이 정책 평가 과정 내에 정책 개선을 통합한 수정된 정책 반복 프레임워크를 도입한다.
  • 기본 상태 및 동작 기술을 지원하는 기호적 표현을 활용하여 상태 인스턴스 간의 일반화를 가능하게 한다.
  • 지상 상태가 아닌 관계형 템플릿을 대상으로 작동하는 업그레이드된 벨먼 업데이트를 사용하여 계산 과정에서 구조를 유지한다.
  • 최적의 정책으로 수렴하기 위해 관계형 정책 표현에 대한 고정점 반복 메커니즘을 적용한다.
  • 표준 기법이 실패할 경우에도 정책 값 계산이 잘 정의되도록 이상 현상에 대응한다.
  • 반복 과정 전반에 걸쳐 정책 및 가치 함수를 관계형 형태로 유지하는 기호적 동적 프rogram밍 접근법을 활용한다.

실험 결과

연구 질문

  • RQ1표현적 제약이 존재하는 관계형 MDPs로의 정책 반복의 의미 있는 연장이 가능한가?
  • RQ2표준 정책 반복 기법이 제대로 작동하지 못하게 만드는 관계형 정책 평가에서 발생하는 이상 현상은 무엇인가?
  • RQ3정책 평가 단계에 정책 개선을 통합함으로써 정확성과 수렴성을 유지할 수 있는가?
  • RQ4지상화 없이 완전히 관계형 기호 공간에서 작동하는 정책 반복 알고리즘을 설계할 수 있는가?
  • RQ5정의된 관계형 표현 방식 하에서 제안된 알고리즘이 최적의 정책으로 수렴하는가?

주요 결과

  • 논문은 관계형 정책 표현에서 발생하는 두 가지 근본적인 이상 현상을 규명한다: 잘 정의되지 않은 정책 값과 제한된 기법에서 계산이 불가능한 값 함수.
  • 제안된 알고리즘은 정책 개선을 평가 단계에 통합함으로써 이러한 이상 현상을 효과적으로 회피하며, 잘 정의된 값 계산을 보장한다.
  • 전통적인 정책 반복과는 다름에도 불구하고, 알고리즘은 유한 시간 내에 최적의 정책으로 수렴함을 증명하였다.
  • 지상 상태의 나열이 필요 없이 기호적이고 관계형 표현 방식을 전반적으로 유지한다.
  • 관계형 정책 학습에서 정확성과 완전성을 확보하여, 구조화된 스토케스틱 환경에서 정확한 계획 수립을 가능하게 한다.
  • 이전에는 근사적 가치 반복에 국한되었던 복잡한 관계형 도메인에 대해 정확한 계획 수립의 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.