Skip to main content
QUICK REVIEW

[논문 리뷰] Batch Policy Learning in Average Reward Markov Decision Processes

Peng Liao, Zhengling Qi|arXiv (Cornell University)|2020. 07. 23.
Advanced Bandit Algorithms Research참고 문헌 27인용 수 15
한 줄 요약

이 논문은 무한할인 마르코프 결정 과정에서 배치 정책 학습을 위한 평균 보상에 대한 이중 강건 추정기(doubly robust estimator)를 제안하며, 반모수 효율성(semiparametric efficiency)을 달성하고 파arameterized 정책 클래스 내에서 최적의 정책 탐색을 가능하게 한다. 이 방법은 유한 표본에서의 위험 보장(regret guarantees)을 보장하며, 시뮬레이션과 실세계 mHealth 응용 분야에서 기존의 오프라인 강화 학습 기준선보다 뛰어난 성능을 보인다.

ABSTRACT

We consider the batch (off-line) policy learning problem in the infinite horizon Markov Decision Process. Motivated by mobile health applications, we focus on learning a policy that maximizes the long-term average reward. We propose a doubly robust estimator for the average reward and show that it achieves semiparametric efficiency. Further we develop an optimization algorithm to compute the optimal policy in a parameterized stochastic policy class. The performance of the estimated policy is measured by the difference between the optimal average reward in the policy class and the average reward of the estimated policy and we establish a finite-sample regret guarantee. The performance of the method is illustrated by simulation studies and an analysis of a mobile health study promoting physical activity.

연구 동기 및 목표

  • 장기적인 결과가 중요한 모바일 헬스(mHealth) 맥락에서, 특히 장기적인 행동 유지에 중점을 두고 무한할인 마르코프 결정 과정에서 배치(off-line) 데이터를 이용한 최적의 정책 학습 문제에 도전한다.
  • 할인 요인 값이 1에 가까워질수록 불안정하고 취약한 할인 보상 설정의 한계를 극복하기 위해, 장기적 행동 유지에 더 자연스럽고 타당한 성능 지표로 평균 보상을 사용한다.
  • 사전에 정의된 파라미터화된 정책 클래스 내에서 신뢰할 수 있는 최적화를 가능하게 하는 데이터 효율적이고 균일하게 잘 작동하는 평균 보상 추정기 개발.
  • 추정된 정책에 대한 유한 표본 위험 경계를 수립하여, 정책 클래스 내 최적의 정책과의 성능 비교에 이론적 보장을 제공한다.
  • 장기적인 결과가 우선시되는 모바일 헬스 응용 분야에서의 실용적 유용성을 시뮬레이션과 실제 mHealth 연구를 통해 입증한다.

제안 방법

  • 무한할인 MDP에서 정책의 평균 보상에 대한 새로운 이중 강건 추정기를 제안하며, 결과 회귀와 성향 점수 추정을 조합하여 미약한 규칙성 조건 하에서 반모수 효율성을 달성한다.
  • 정책 파라미터에 대한 추정된 평균 보상의 닫힌 형태의 기울기(gradient)를 유도하여, 표준 기울기 기반 최적화 방법을 효율적으로 적용할 수 있도록 한다.
  • 정적 분포의 정규화 조건을 다루기 위해 라그랑주 보완을 사용하여 추정된 평균 보상의 최대화를 제약 조건이 있는 최적화 문제로 재구성한다.
  • 이중 강건 추정기를 파라미터화된 정책 클래스 내에서 최적의 정책을 계산하는 정책 탐색 알고리즘에 통합하여 통계적 효율성과 계산의 실현 가능성을 동시에 확보한다.
  • 이중 강건 추정기의 두 단계 추정 절차를 적용: 먼저 낙관적 함수(조건부 평균 보상 및 전이 확률)를 추정하고, 그 다음 이를 이중 강건 추정기의 입력으로 사용한다.
  • 유한 표본 위험 분석을 적용하여 정책 클래스 내 최적의 평균 보상과 추정된 정책의 보상 간 차이를 경계함으로써 이론적 성능 보장을 제공한다.

실험 결과

연구 질문

  • RQ1무한할인 MDP에서 평균 보상에 대한 이중 강건 추정기는 낙관적 함수 추정 오차의 규칙성 조건 하에서 반모수 효율성을 달성하고 정책 학습에서 낮은 위험을 보장할 수 있는가?
  • RQ2제한된 배치 데이터 하에서, 기존의 오프라인 강화 학습 알고리즘(BEAR, BCQ, FQI 등)과 비교해 볼 때, 제안된 방법은 위험과 평균 보상 추정에서 어떤 성능을 보이는가?
  • RQ3장기적인 결과가 할인 보상보다 우선시되는 모바일 헬스 응용 분야에서, 이 방법은 정책 성능을 얼마나 향상시키는가?
  • RQ4경로 길이와 경로 수가 추정된 정책의 유한 표본 성능에 어떤 영향을 미치는가?
  • RQ5파라미터화된 정책 클래스에 제한을 두어 낮은 분산과 높은 해석 가능성(interpretability)을 유지하면서도 강력한 성능을 달성할 수 있는가?

주요 결과

  • 제안된 평균 보상에 대한 이중 강건 추정기는 낙관적 함수 추정 오차에 대한 미약한 규칙성 조건 하에서 반모수 효율성을 달성한다.
  • 시뮬레이션 연구에서, 50개의 경로(길이 48)를 사용할 경우 위험는 0.009 (±0.003)로 나타났으며, BEAR(0.843 ± 0.060), BCQ(0.652 ± 0.025), FQI(0.054 ± 0.027)보다 유의미하게 낮았다.
  • 최적 설정(n=50, T=48) 하에서 추정된 정책의 평균 보상은 0.914 (±0.003)였으며, BEAR(0.121 ± 0.046), BCQ(0.276 ± 0.001), FQI(0.853 ± 0.023)를 모두 초월했다.
  • 이 방법은 다양한 데이터 환경에서 일관된 성능을 보였으며, 경로 길이와 경로 수가 증가할수록 위험이 감소하는 경향을 보였다.
  • HeartSteps mHealth 연구에서, 이 방법은 장기적인 신체 활동을 극대화하는 정책을 성공적으로 식별하여 실세계 모바일 헬스 응용 분야에서의 실용성을 입증했다.
  • 유한 표본 위험 경계는 제한된 데이터 조건 하에서도 추정된 정책의 성능이 정책 클래스 내 최적 정책과 유사할 것임을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.