Skip to main content
QUICK REVIEW

[논문 리뷰] Black-box Off-policy Estimation for Infinite-Horizon Reinforcement Learning

Ali Mousavi, Lihong Li|arXiv (Cornell University)|2020. 03. 24.
Advanced Bandit Algorithms Research참고 문헌 30인용 수 12
한 줄 요약

이 논문은 유한한 수명의 강화학습에 대해 알려진 행동 정책이나 정적 외부 데이터가 필요 없이, 뒤로 흐르는 흐름 연산자의 고정점 방정식을 푸는 방식으로 문제를 공식화함으로써 무한 수명 강화학습을 위한 블랙박스 외부 정책 추정 방법을 제안한다. 재생 핵 힐버트 공간(RKHS)을 사용하여 데이터로부터 직접 정적 분포 중요도 비율을 비모수적으로 추정함으로써 점점 더 일관되고 유한 샘플 일반화 성능을 달성하며, 실험 결과는 비정적 데이터 조건에서도 이전 방법들보다 뛰어난 성능을 보여준다.

ABSTRACT

Off-policy estimation for long-horizon problems is important in many real-life applications such as healthcare and robotics, where high-fidelity simulators may not be available and on-policy evaluation is expensive or impossible. Recently, \cite{liu18breaking} proposed an approach that avoids the \emph{curse of horizon} suffered by typical importance-sampling-based methods. While showing promising results, this approach is limited in practice as it requires data be drawn from the \emph{stationary distribution} of a \emph{known} behavior policy. In this work, we propose a novel approach that eliminates such limitations. In particular, we formulate the problem as solving for the fixed point of a certain operator. Using tools from Reproducing Kernel Hilbert Spaces (RKHSs), we develop a new estimator that computes importance ratios of stationary distributions, without knowledge of how the off-policy data are collected. We analyze its asymptotic consistency and finite-sample generalization. Experiments on benchmarks verify the effectiveness of our approach.

연구 동기 및 목표

  • 장수명 강화학습에서 알려진 행동 정책나 정적 데이터 분포를 요구하는 기존 외부 정책 추정 방법의 한계를 해결하기 위해.
  • 행동 정책가 알려져 있지 않고 데이터가 장기간 비정적 기간 동안 수집되는 실제 환경에서 정확한 외부 정책 평가를 가능하게 하는 방법을 개발하기 위해.
  • 외부 정책 추정을 뒤로 흐르는 흐름 연산자를 포함하는 고정점 문제로 공식화하여, 명시적 수명 의존성 없이 견고한 추정을 가능하게 하기 위해.
  • 제안된 추정기의 점점 일관성과 유한 샘플 일반화에 대한 이론적 보장을 제공하기 위해.
  • 비정적 및 식별 불가 행동 정책 조건 하에서 고전적 제어 벤치마크에서 방법의 효과성을 실증적으로 검증하기 위해.

제안 방법

  • 이 방법은 표준 전방 벨먼 연산자와 다름없이 뒤로 흐르는 흐름 연산자의 고정점을 구하는 방식으로 외부 정책 추정을 공식화한다.
  • 재생 핵 힐버트 공간(RKHS)을 활용하여 행동 정책에 대한 지식이 없이도 정적 분포의 중요도 비율을 비모수적으로 추정한다.
  • 이 추정기는 외부 정책 데이터 기반으로 상태의 중요도 가중치를 계산하며, 이는 알려지지 않은 또는 다수의 행동 정책에서 수집된 데이터일지라도 가능하다.
  • 기존 중요도 샘플링의 지수적 분산 증가 문제를 피하기 위해 궤도 수준의 가중치가 아닌 정적 분포 비율에 기반하여 작동한다.
  • 고정점 함수를 표현하기 위해 파라미터 모델(피드포워드 신경망)을 사용하며, 샘플 크기 변화에 대비해 하이퍼파rameter를 데이터의 일부에서 튜닝하여 다양한 샘플 크기에서의 견고성을 확보한다.
  • 이론적 분석을 통해 미약한 정규성 조건 하에서 점점 일관성과 유한 샘플 일반화 경계를 확립한다.

실험 결과

연구 질문

  • RQ1알려진 행동 정책가 없이도 무한 수명 강화학습에서 정확한 외부 정책 추정이 가능할 수 있는가?
  • RQ2외부 정책 데이터가 정적 분포에 도달하지 못한 상태에서도 방법이 효과를 유지할 수 있는가?
  • RQ3RKHS 기반의 고정점 공식화는 기존 방법들과 비교해 편향, 분산, 데이터 분포 이동에 대한 강건성 측면에서 어떻게 다른가?
  • RQ4실제 비정적 데이터 수집 조건 하에서 추정기의 유한 샘플 일반화 성능은 어떠한가?
  • RQ5장수명 역학과 알려지지 않은 행동 정책이 존재하는 벤치마크에서 기존 방법들을 능가하는가?

주요 결과

  • 비정적 데이터 조건에서도 세 가지 제어 벤치마크(Pendulum, Mountain Car, CartPole)에서 RMSE 측면에서 기준선 방법(일반 평균 및 IPS)보다 제안된 방법이 뛰어난 성능을 보였다.
  • Acrobot에서는 IPS와 유사한 성능을 보이며 다양한 환경에서의 강건성을 입증했다.
  • 다양한 트래잭션 수에 걸쳐 일관된 성능을 유지하며, 하이퍼파rameter 재조정 없이도 샘플 크기 변화에 강건함을 보였다.
  • 중위수 및 사분위 범위 결과(그림 3)는 성능 추세가 안정적이며, 경쟁 방법들보다 이상치에 덜 민감함을 확인했다.
  • 알려진 행동 정책나 정적 데이터가 필요로 하는 이전 연구들보다 낮은 RMSE를 달성함으로써, 블랙박스 성격과 실용적 적용 가능성을 입증했다.
  • 실험 결과는 행동 정책가 알려져 있지 않고 여러 관찰되지 않은 절차에서 데이터가 수집되는 현실 세계 관측 데이터 상황에서도 방법이 효과적으로 유지됨을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.