Skip to main content
QUICK REVIEW

[논문 리뷰] Finite Sample Analysis of Minimax Offline Reinforcement Learning: Completeness, Fast Rates and First-Order Efficiency

Masatoshi Uehara, Masaaki Imaizumi|arXiv (Cornell University)|2021. 02. 05.
Reinforcement Learning in Robotics참고 문헌 51인용 수 14
한 줄 요약

이 논문은 오프-폴리시 평가(OPE)를 위한 최소최대 오프라인 강화학습의 유한 표본 분석을 제공하며, 실현 가능성과 완전성 가정 하에서 $q$-함수와 마진 중요도 가중치의 빠른 수렴 속도를 확립한다. 비표본 설정에서 최초로 1차 효율적인 OPE를 가능하게 하는 새로운 완전성 조건을 도입하여, 점근적 분산의 주요 항에서 최소 분산 계수를 달성한다.

ABSTRACT

We offer a theoretical characterization of off-policy evaluation (OPE) in reinforcement learning using function approximation for marginal importance weights and $q$-functions when these are estimated using recent minimax methods. Under various combinations of realizability and completeness assumptions, we show that the minimax approach enables us to achieve a fast rate of convergence for weights and quality functions, characterized by the critical inequality \citep{bartlett2005}. Based on this result, we analyze convergence rates for OPE. In particular, we introduce novel alternative completeness conditions under which OPE is feasible and we present the first finite-sample result with first-order efficiency in non-tabular environments, i.e., having the minimal coefficient in the leading term.

연구 동기 및 목표

  • 오프라인 강화학습에서 오프-폴리시 평가(OPE)를 위한 최소최대 추정기의 유한 표본 이론적 분석을 제공하는 것.
  • 실현 가능성과 완전성 가정 하에서 최소최대 추정 $q$-함수와 마진 중요도 가중치의 빠른 수렴 속도를 확립하는 것.
  • 비표본 설정에서 OPE의 가능성을 보장하는 새로운 완전성 조건을 도입하는 것.
  • 이 조건 하에서 OPE의 1차 효율성을 달성하는 것—점근적 분산의 주요 항에서 계수를 최소화하는 것.
  • $q$-함수와 $w$-함수 추정의 분석을 안정화 항을 가진 최소최대 프레임워크를 통해 통합하는 것.

제안 방법

  • 평가 정책 $\pi^e$, 행동 정책 $\pi^b$, 할인 수익 $J$를 가진 마르코프 결정 과정(MDP)에서 OPE를 수식화하는 것.
  • 함수 클래스와 비평가 사이의 0-합 게임을 통해 최소최대 추정을 이용해 $q$-함수와 $w$-함수(중요도 가중치)를 학습하는 것.
  • 일반화 및 안정성 향상을 위해 최소최대 목표 함수에 안정화 항을 도입하는 것.
  • $w$와 $q$ 함수의 곱으로 이루어진 함수 클래스 $\mathcal{G}$의 커버링 수를 분석하여 공동 함수 공간의 복잡도를 근사하는 것.
  • 신경망 커버링 수 근사치(ReLU, ReLU 유사 활성화)와 라데마처 복잡도를 통한 일반화 오차 근사치를 적용하는 것.
  • 비판적 부등식 프레임워크(Bartlett 등, 2005)를 사용하여 유한 표본 수렴 속도를 유도하며, 추정 오차를 커버링 수와 표본 크기와 연결하는 것.

실험 결과

연구 질문

  • RQ1오프라인 RL에서 $q$-함수와 $w$-함수의 최소최대 추정기가 실현 가능성과 완전성 조건 하에서 어떤 조건에서 빠른 유한 표본 수렴 속도를 달성할 수 있는가?
  • RQ2비표본, 함수 근사 설정에서 실행 가능하고 효율적인 OPE를 가능하게 하는 새로운 완전성 조건은 무엇인가?
  • RQ3함수 근사 하에서 OPE에서 1차 효율성을 달성할 수 있는가—즉, 점근적 분산의 주요 항에서 계수를 최소화할 수 있는가?
  • RQ4최소최대 목표 함수에 안정화 항을 포함시키는 것이 $q$-함수와 $w$-함수 추정기의 일반화 및 수렴 성질에 어떤 영향을 미치는가?
  • RQ5함수 클래스 복잡도(커버링 수를 통해 측정)는 OPE의 유한 표본 오차 한계를 결정하는 데 어떤 역할을 하는가?

주요 결과

  • 논문은 실현 가능성과 완전성 조건 하에서 최소최대 추정 $q$-함수와 $w$-함수의 빠른 수렴 속도를 확립하였으며, 이는 비판적 부등식(Bartlett 등, 2005)으로 특징지어진다.
  • 비표본 환경에서 OPE의 실행 가능성을 보장하는 새로운 완전성 조건을 도입하여, 이전 결과를 함수 근사 설정으로 확장한다.
  • 비표본 오프라인 강화학습에서 최초로 1차 효율성을 확보한 유한 표본 결과를 도출하였으며, 이는 점근적 분산의 주요 항에서 분산 계수를 최소화하는 것을 의미한다.
  • $w$와 $q$ 함수로 이루어진 공동 함수 클래스 $\mathcal{G}$의 커버링 수는 $N_W N_Q$-커버링 집합을 사용하여 근사되며, 오차는 $\varepsilon_1$ 및 $\varepsilon_2$-넷으로 제어된다.
  • ReLU 활성화를 가진 신경망의 경우, $\log \mathcal{N}(\tau, \mathcal{F}_{NN}, \|\cdot\|_\infty) \leq \Omega \log(\text{poly}(B, L, \Omega)/\tau)$ 방식으로 커버링 수가 근사되며, 이는 유한 표본 분석을 가능하게 한다.
  • 라데마처 복잡도 근사치를 사용하여 일반화 오차를 도출하였으며, 제안된 가정 하에서 최소최대 추정기가 최적의 수렴 속도를 달성함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.