Skip to main content
QUICK REVIEW

[논문 리뷰] Statistical Inference of the Value Function for Reinforcement Learning in Infinite Horizon Settings

Chengchun Shi, Shengxing Zhang|arXiv (Cornell University)|2020. 01. 13.
Reinforcement Learning in Robotics참고 문헌 52인용 수 18
한 줄 요약

이 논문은 무한할행 강화학습 환경에서 정책의 가치 함수에 대한 타당한 신뢰구간(CI)을 구축하기 위해 새로운 방법인 순차적 가치 평가(Sequential Value Evaluation, SAVE)를 제안한다. 행동가치 함수(Q-함수)를 증가하는 기저 함수를 갖는 급수/체계 방법으로 모델링함으로써, 정책이 데이터에 의존하는 경우에도 이중점근(trajectories 또는 결정점 수 증가) 조건 하에서 渐近적으로 타당한 CI를 달성하며, 최적 정책이 유일하지 않은 경우에도 명목상의 커버리지 유지 가능하다.

ABSTRACT

Reinforcement learning is a general technique that allows an agent to learn an optimal policy and interact with an environment in sequential decision making problems. The goodness of a policy is measured by its value function starting from some initial state. The focus of this paper is to construct confidence intervals (CIs) for a policy's value in infinite horizon settings where the number of decision points diverges to infinity. We propose to model the action-value state function (Q-function) associated with a policy based on series/sieve method to derive its confidence interval. When the target policy depends on the observed data as well, we propose a SequentiAl Value Evaluation (SAVE) method to recursively update the estimated policy and its value estimator. As long as either the number of trajectories or the number of decision points diverges to infinity, we show that the proposed CI achieves nominal coverage even in cases where the optimal policy is not unique. Simulation studies are conducted to back up our theoretical findings. We apply the proposed method to a dataset from mobile health studies and find that reinforcement learning algorithms could help improve patient's health status. A Python implementation of the proposed procedure is available at https://github.com/shengzhang37/SAVE.

연구 동기 및 목표

  • 무한할행 강화학습 환경에서 정책 가치 함수에 대한 통계적 추론 방법의 부족을 해결하기 위해.
  • 정책이 데이터로부터 추정될 때도 명목상 커버리지 확보를 위한 정책의 가치에 대한 신뢰구간(CI)을 구축하기 위해.
  • 실제 응용에서 흔한 문제이지만 최적 정책이 유일하지 않은 경우에도 타당한 추론을 보장하기 위해.
  • 제한된 트레이젝터리에 비해 증가하는 결정점 수를 고려한 방법을 개발하기 위해, 이는 모바일 헬스 및 종단적 연구에서 일반적인 특성이다.
  • 실제 적용이 가능한 이론적 기반의 프레임워크를 제공하여, 실제 도입 이전에 학습된 정책의 영향을 평가하기 위해.

제안 방법

  • 관측 수의 증가에 따라 증가하는 $L$개의 기저 함수를 갖는 급수/체계 방법을 사용하여 행동가치 함수(Q-함수)를 모델링하며, $L$은 관측 수에 따라 증가한다.
  • SAVE 방법에서 순차적 추정 전략을 적용하여 새로운 데이터가 도착함에 따라 정책과 그 가치 추정기를 순차적으로 갱신한다.
  • 비모수적 Q-함수 추정을 위해 체계 방법을 사용하여 복잡한 가치 함수의 탄력적 근사가 가능하다.
  • 약한 정규성 조건 하에서 추정된 Q-함수의 점근적 분포를 역행함으로써 정책 가치에 대한 신뢰구간을 유도한다.
  • 결정점 수 또는 트레이젝터리 수가 무한으로 발산하는 이중점근 조건 하에서 가치 추정기의 점근 정규성을 확립한다.
  • 적절한 정규성 조건 하에서 정책 및 가치 함수의 추정 오차가 제어됨을 보장함으로써 데이터에 의존하는 정책을 다룬다.

실험 결과

연구 질문

  • RQ1정책이 데이터로부터 추정될 때 무한할행 강화학습 환경에서 정책의 가치 함수에 대해 타당한 신뢰구간을 구성할 수 있는가?
  • RQ2최적 정책이 유일하지 않은 경우에도 제안된 방법이 명목상 커버리지 확률을 유지하는가?
  • RQ3모바일 헬스 응용에서 흔한 제한된 트레이젝터리와 많은 수의 결정점이 있는 설정에서 이 방법은 어떻게 성능을 보이는가?
  • RQ4약한 정규성 조건 하에서 증가하는 기저 차원을 가진 체계 기반 Q-함수 추정이 타당한 추론을 제공하는가?
  • RQ5가치 추정기의 수렴 속도는 트레이젝터리 수와 결정점 수에 어떻게 의존하는가?

주요 결과

  • 제안된 신뢰구간은 최적 정책이 유일하지 않은 경우에도 이중점근 조건 하에서 명목상 커버리지 확보를 달성한다.
  • 트레이젝터리 수 또는 결정점 수가 무한으로 발산하는 경우에도 타당한 추론이 유지된다.
  • 가치 함수의 추정 오차는 $O_p(|\mathcal{I}|^{-2b_*/(2+\alpha)})$ 의 속도로 수렴하며, 여기서 $\mathcal{I}$는 데이터를 인덱싱하고 $b_*$, $\alpha$는 부드러움 파라미터이다.
  • 체계 기반 Q-함수 추정은 기저 함수 수가 표본 크기와 함께 증가함에 따라 진정한 Q-함수의 일致한 근사가 가능하다.
  • 이론적 결과는 제안된 조건 하에서 정책 추정의 편향이 사라짐을 보여주며, 이는 타당한 추론을 가능하게 한다.
  • 시뮬레이션 연구는 이론적 결과를 확인하며, 다양한 데이터 생성 메커니즘 하에서 정확한 커버리지와 강건성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.