Skip to main content
QUICK REVIEW

[논문 리뷰] Importance Sampling Policy Evaluation with an Estimated Behavior Policy

Josiah P. Hanna, Scott Niekum|arXiv (Cornell University)|2018. 06. 04.
Advanced Causal Inference Techniques참고 문헌 28인용 수 8
한 줄 요약

이 논문은 중요도 샘플링의 평균 제곱 오차(MSE)를 줄이기 위해, 동일한 데이터셋에서 행동 정책을 추정하는 회귀 중요도 샘플링(RIS)을 제안한다. 샘플링 오차를 보정함으로써 RIS는 진정한 행동 정책이 마르코프일지라도, 일반 중요도 샘플링보다 더 낮은 MSE를 달성한다. 특히 대규모 표본과 비마르코프 행동 정책 추정에서 뚜렷한 성능 향상을 보인다.

ABSTRACT

We consider the problem of off-policy evaluation in Markov decision processes. Off-policy evaluation is the task of evaluating the expected return of one policy with data generated by a different, behavior policy. Importance sampling is a technique for off-policy evaluation that re-weights off-policy returns to account for differences in the likelihood of the returns between the two policies. In this paper, we study importance sampling with an estimated behavior policy where the behavior policy estimate comes from the same set of data used to compute the importance sampling estimate. We find that this estimator often lowers the mean squared error of off-policy evaluation compared to importance sampling with the true behavior policy or using a behavior policy that is estimated from a separate data set. Intuitively, estimating the behavior policy in this way corrects for error due to sampling in the action-space. Our empirical results also extend to other popular variants of importance sampling and show that estimating a non-Markovian behavior policy can further lower large-sample mean squared error even when the true behavior policy is Markovian.

연구 동기 및 목표

  • 오프-폴리시 평가에서 중요도 샘플링을 사용할 때 발생하는 높은 분산과 샘플링 오차를 해결하기 위해.
  • 동일한 데이터셋에서 행동 정책를 추정함으로써 추정 정확도가 향상되는지 조사하기 위해.
  • 진정한 정책이 마르코프일지라도, 비마르코프 행동 정책 추정이 점차적 분산(MSE)을 줄일 수 있는지 평가하기 위해.
  • 일반 중요도 샘플링에 비해 RIS가 일致성과 더 낮은 점근적 분산을 가지는지 보여주기 위해.
  • 기존 분산 감소 기법과 RIS를 조합했을 때의 실용적 이점 탐색하기 위해.

제안 방법

  • RIS는 데이터셋 $\mathcal{D}$ 에서 각 상태에서의 경험적 행동 빈도를 사용하여 행동 정책 $\pi_{\mathcal{D}}$ 를 추정하며, 중요도 샘플링에서 진짜 $\pi_b$ 를 대체한다.
  • 중요도 가중치는 $\frac{\pi_e(a|s)}{\pi_{\mathcal{D}}(a|s)}$ 로 계산되며, 여기서 $\pi_{\mathcal{D}}$ 는 데이터셋 $\mathcal{D}$ 에서 관측된 상태-행동 빈도로부터 추정된다.
  • RIS는 동일한 데이터셋 $\mathcal{D}$ 를 사용하여 $\pi_{\mathcal{D}}$ 를 추정하고 중요도 샘플링 추정치를 계산함으로써, 샘플링에 기인한 편향을 보정한다.
  • 현재 상태가 아닌 궤적 세그먼트를 조건으로 하여 비마르코프 행동 정책로 확장한다.
  • 더 나은 성능을 위해 RIS는 제어 변수, 정규화된 가중치, 클리핑과 같은 기존의 분산 감소 기법과 조합된다.
  • 이론적 분석을 통해 정책 클래스에 진짜 행동 정책가 포함되어 있을 경우, RIS는 일致성 있고 일반 중요도 샘플링보다 점근적으로 더 낮은 분산을 가진다.

실험 결과

연구 질문

  • RQ1중요도 샘플링 추정치와 동일한 데이터셋에서 행동 정책를 추정함으로써 오프-폴리시 평가에서 평균 제곱 오차(MSE)가 감소하는가?
  • RQ2진정한 행동 정책가 마르코프일지라도, 비마르코프 행동 정책 추정이 대규모 표본에서의 MSE를 추가로 줄일 수 있는가?
  • RQ3이산 및 연속 행동 공간에서 일반 중요도 샘플링에 비해 RIS는 편향, 분산, MSE 측면에서 어떻게 비교되는가?
  • RQ4기존의 분산 감소 기법과 RIS를 조합했을 때의 영향은 무엇인가?
  • RQ5RIS가 진짜 행동 정책를 사용할 때보다 더 낮은 점근적 분산을 달성하는 조건는 무엇인가?

주요 결과

  • RIS는 진짜 행동 정책가 마르코프일지라도 일반 중요도 샘플링(OIS)에 비해 일관되게 평균 제곱 오차(MSE)를 줄인다.
  • 동일한 데이터셋에서 행동 정책를 추정함으로써 행동 공간의 가능성도에서 발생하는 샘플링 오차를 보정하여 더 낮은 MSE를 달성한다.
  • 비마르코프 행동 정책 추정을 통한 RIS는 진짜 정책이 마르코프일지라도 대규모 표본에서의 MSE를 추가로 줄인다.
  • 추정된 정책 클래스에 진짜 행동 정책가 포함되어 있을 경우, RIS는 일치성 있고 일반 중요도 샘플링보다 점근적으로 더 낮은 분산을 가진다.
  • 이 방법은 이산 및 연속 행동 공간 환경 전반에서 경험적으로 효과적이다.
  • RIS는 기존의 분산 감소 기법과 상호 보완적이며, 이를 조합하면 추가적인 MSE 감소 효과를 얻을 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.