Skip to main content
QUICK REVIEW

[논문 리뷰] Does the Markov Decision Process Fit the Data: Testing for the Markov Property in Sequential Decision Making

Chengchun Shi, Runzhe Wan|arXiv (Cornell University)|2020. 02. 05.
Reinforcement Learning in Robotics참고 문헌 37인용 수 9
한 줄 요약

이 논문은 순차적 의사결정에서 마르코프 성질을 검증하기 위한 새로운 전진-후진 학습 절차를 제안한다. 이는 고차수 마르코프 결정 과정(HMDP)과 부분적으로 관찰 가능한 MDP(POMDP)를 파arametric 형태를 가정하지 않고 탐지할 수 있도록 한다. 검정은 이중 강건한 추정 방정식과 기계학습을 활용하여 고차원 설정에서 유효한 추론을 보장하며, 궁극적으로 표본 수 $n$ 또는 시간 수평 $T$ 가 무한히 커질 때 점점 더 정확해진다.

ABSTRACT

The Markov assumption (MA) is fundamental to the empirical validity of reinforcement learning. In this paper, we propose a novel Forward-Backward Learning procedure to test MA in sequential decision making. The proposed test does not assume any parametric form on the joint distribution of the observed data and plays an important role for identifying the optimal policy in high-order Markov decision processes and partially observable MDPs. We apply our test to both synthetic datasets and a real data example from mobile health studies to illustrate its usefulness.

연구 동기 및 목표

  • 강화학습(RL) 알고리즘의 기초가 되는 순차적 의사결정에서 마르코프 가정(MA)에 대한 유효한 통계적 검정을 개발하는 것.
  • 짧은 기억을 가진 상태에서 마르코프 성질이 성립하지 않는 고차수 MDP(HMDP)에서 적절한 봉우리 기간 $\kappa_0$ 를 선택하는 문제를 해결하는 것.
  • 여러 시간 포인트를 연결해도 마르코프 성질이 성립하지 않을 경우, 부분적으로 관찰 가능한 MDP(POMDP)임을 탐지하여 POMDP 전용 RL 방법을 적용할 수 있도록 하는 것.
  • 기존의 파arametric 모델링을 피하고 현대 기계학습과 이중 강건성의 조합을 통해 고차원 상태 공간에서도 검정의 유효성을 확보하는 것.
  • 실제 데이터 세트인 모바일 헬스 및 프램싱햄 심장 연구에 적용 가능한, 확장 가능하고 점점 더 유효해지는 검정을 제공하는 것. 이는 표본 수 $n$ 또는 시간 수평 $T$ 가 발산할 때도 성립한다.

제안 방법

  • 전진 및 후진 예측 오차를 모두 활용하여 검정 통계량을 구성하는 전진-후진 학습 절차를 제안한다.
  • 기계학습 모델의 오차를 줄이고 모델 잘못 설정 하에서도 일관된 추정을 보장하기 위해 이중 강건한 추정 방정식을 사용한다.
  • 과거 상태의 조건부 독립성을 현재 상태에 조건화한 조건부 독립성 기반으로 검정 통계량을 정의하기 위해 스펙트럼 분해와 경험적 특성 함수를 활용한다.
  • 순차적 검정 절차를 적용: $k=1$ 로 시작하여 $k$ 개의 시간 포인트에 걸친 연결된 상태에서 마르코프 성질을 검정하고, 마르코프 성질이 기각되지 않을 때까지 $k$ 를 증가시킨다.
  • 고차원 중심극한정리와 블록 대각 행렬 공분산 구조를 활용하여 귀무가설 하에서 검정 통계량의 점근적 분포를 유도한다.
  • 공분산 행렬 추정의 추정 오차를 $O((nT)^{-c^{**}})$ 속도로 유한하게 제한하여 고차원 설정에서의 유효성을 확보한다.

실험 결과

연구 질문

  • RQ1관측된 데이터의 공동분포에 대해 파arametric 형태를 가정하지 않고도 순차적 의사결정에서 마르코프 성질을 검정할 수 있는가?
  • RQ2마르코프 성질이 작은 $\kappa_0$ 에서 성립하지 않을 경우, 고차수 MDP(HMDP)에서 최적의 봉우리 기간 $\kappa_0$ 는 어떻게 결정할 수 있는가?
  • RQ3우리의 검정은 시스템이 표준 MDP가 아니라 부분적으로 관찰 가능한 MDP(POMDP)로 더 잘 모델링될 수 있을 때 이를 탐지할 수 있는가?
  • RQ4기존의 국소 다항 회귀 방법이 차원의 극복 문제로 곤란을 겪는 고차원 설정에서도, 제안된 검정이 정확한 크기와 검정력을 유지하는가?
  • RQ5표본 수 $n$ 또는 시간 수평 $T$ 가 발산할 때, 검정이 점점 더 유효해지는가?

주요 결과

  • 제안된 검정은 시뮬레이션 데이터에서 최적의 상태 표현을 정확히 식별하며, RL 알고리즘과 함께 적용했을 때 거의 모든 경우에서 최고의 성능을 기록한다.
  • 순차적 전진 검정 절차는 마르코프 성질이 성립하는 최소 $k$ 를 성공적으로 식별하여, 고정되거나 잘못 설정된 봉우리 기간을 사용한 경우보다 더 나은 정책 추정을 이끈다.
  • 실제 모바일 헬스 데이터에서는 여러 시간 포인트를 연결한 후에도 마르코프 성질 위반이 탐지되었으며, 이는 POMDP 모델링의 필요성을 시사한다.
  • 검정은 고차원 설정에서도 정확한 크기와 검정력을 유지하며, 차원의 극복 문제로 어려움을 겪는 기존 방법(Chen & Hong, 2012)을 능가한다.
  • 검정 통계량의 점근적 분포는 약간의 규칙성 조건 하에서도 간단한 공분산 구조를 가진 정규분포에 수렴하므로, 유효한 추론이 가능하다.
  • 실증 결과는 제안된 검정을 통해 선택된 상태를 기반으로 학습된 정책이 표준 MDP 가정에 기반한 정책보다 일관되게 뛰어난 성능을 보이며, 비마르코프 환경에서 특히 두드러진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.