Skip to main content
QUICK REVIEW

[논문 리뷰] More Robust Doubly Robust Off-policy Evaluation

Mehrdad Farajtabar, Yinlam Chow|arXiv (Cornell University)|2018. 02. 10.
Reinforcement Learning in Robotics인용 수 10
한 줄 요약

이 논문은 이중으로 강건한(드러브) 추정기의 분산을 최소화함으로써 분산을 줄이고, 더 높은 정확도와 강건성을 확보하는 더 강건한 이중으로 강건한(MRDR) 오프-폴리시 평가 추정기를 제안한다. 이 방법은 강력한 일致성과 점근적 최적성을 확보하며, 표준 DR, IS, DM보다 더 낮은 평균 제곱 오차를 기록하여 문맥적 밴딧과 강화학습 벤치마크에서 뛰어난 성능을 보인다.

ABSTRACT

We study the problem of off-policy evaluation (OPE) in reinforcement learning (RL), where the goal is to estimate the performance of a policy from the data generated by another policy(ies). In particular, we focus on the doubly robust (DR) estimators that consist of an importance sampling (IS) component and a performance model, and utilize the low (or zero) bias of IS and low variance of the model at the same time. Although the accuracy of the model has a huge impact on the overall performance of DR, most of the work on using the DR estimators in OPE has been focused on improving the IS part, and not much on how to learn the model. In this paper, we propose alternative DR estimators, called more robust doubly robust (MRDR), that learn the model parameter by minimizing the variance of the DR estimator. We first present a formulation for learning the DR model in RL. We then derive formulas for the variance of the DR estimator in both contextual bandits and RL, such that their gradients w.r.t.~the model parameters can be estimated from the samples, and propose methods to efficiently minimize the variance. We prove that the MRDR estimators are strongly consistent and asymptotically optimal. Finally, we evaluate MRDR in bandits and RL benchmark problems, and compare its performance with the existing methods.

연구 동기 및 목표

  • 강화학습과 문맥적 밴딧에서 오프-폴리시 평가(OPE) 추정기의 높은 분산 문제를 해결하기 위해.
  • 더 나은 모델 학습을 통해 분산을 줄임으로써 이중으로 강건한(DR) 추정기의 강건성을 향상시키기 위해.
  • 직접 방법(DM) 모델 파라미터를 표준 손실 함수에 의존하는 대신, DR 추정기의 분산을 최소화하는 방식으로 학습하는 방법을 개발하기 위해.
  • 제안된 MRDR 추정기의 이론적 일致성과 점근적 최적성을 증명하기 위해.
  • 벤치마크 강화학습과 밴딧 환경에서 MRDR가 DM, IS, DR, DR0보다 뛰어난 성능을 보임을 경험적으로 검증하기 위해.

제안 방법

  • 강화학습에서 DR 추정기의 직접 방법(DM) 구성요소에 대한 새로운 공식을 제안한다.
  • 문맥적 밴딧과 강화학습 모두에서 DR 추정기의 분산에 대한 닫힌 형태의 표현식을 유도하여 기울기 기반 최적화를 가능하게 한다.
  • 표본 기반 분산 기울기 추정을 사용하여, 확률적 최적화를 통해 DM 모델 파라미터를 학습시킨다.
  • DM 모델을 학습하기 위한 목적 함수로 DR 추정기의 분산 최소화를 사용하여 강건성을 향상시킨다.
  • 두 가지 변형을 도입한다: 전체 분산 최소화를 수행하는 MRDR와 비교를 위한 기준선인 MRDR0.
  • MRDR가 미약한 정규성 조건 하에서 강력히 일치하고 점근적으로 최적임을 증명한다.

실험 결과

연구 질문

  • RQ1이중으로 강건한 추정기의 분산을 최소화하는 것이 강화학습과 문맥적 밴딧에서 오프-폴리시 평가 정확도를 향상시킬 수 있는가?
  • RQ2모델 잘못 설정에 강건하고 전체 추정기 분산을 줄일 수 있도록 직접 방법 모델을 어떻게 학습시킬 수 있는가?
  • RQ3DM 모델에 대한 분산 기반 최적화가 기존의 표준 손실 함수보다 더 나은 성능을 내는가?
  • RQ4MRDR 추정기의 편향, 분산, 평균 제곱 오차 측면에서 IS, DM, 표준 DR과 비교해 볼 때 어떤가?
  • RQ5표준 MDP 가정 하에서 MRDR 추정기는 점근적으로 최적이고 강력히 일치하는가?

주요 결과

  • 모든 벤치마크 환경에서 표준 DR, IS, DM과 비교해 MRDR는 평균 제곱 오차(MSE)를 크게 감소시켰다. 이는 4×4 미로, 마운틴 카, 카트폴 환경을 포함한다.
  • 4×4 미로 도메인에서, 2048개의 샘플에서 MRDR는 DR0 대비 약 75%의 MSE 감소를 기록했고, DR 대비 약 60%의 감소를 기록했다.
  • 마운틴 카 도메인에서, 2048개의 샘플에서 MRDR는 DR0 대비 80% 이상, DR 대비 70% 이상의 MSE 감소를 기록했다.
  • 카트폴 도메인에서, 512개의 샘플에서 MRDR는 DR 대비 약 75%의 MSE 감소를 기록했으며, MSE는 DR의 0.08455에서 MRDR의 0.079로 감소했다.
  • 기준선인 MRDR0는 MRDR보다 성능이 열 劣했으며, 이는 분산 최소화가 성능 향상의 핵심임을 확인시켰다.
  • 이론적 분석을 통해 MRDR가 강력히 일치하고 점근적으로 최적임을 확인하였으며, 이는 경험적 우월성의 이론적 근거를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.