Skip to main content
QUICK REVIEW

[논문 리뷰] Near-Optimal Offline Reinforcement Learning via Double Variance Reduction

Minghao Yin, Yu Bai|arXiv (Cornell University)|2021. 02. 02.
Reinforcement Learning in Robotics참고 문헌 60인용 수 18
한 줄 요약

이 논문은 이중 분산 감소를 사용하는 새로운 오프라인 강화학습 알고리즘인 OPDVR을 제안한다. 이 알고리즘은 유한한 수명 주기의 정적 MDP에서 near-optimal 샘플 복잡도를 달성한다. OPDVR은 유한한 수명 주기의 정적 MDP에서 $\epsilon$-최적 정책을 $\widetilde{O}(H^{2}/d_{m}\epsilon^{2})$개의 오프라인 에피소드 내에 찾을 수 있음을 증명하며, 이는 이전의 작업보다 $H$ 요소만큼 향상되었고, 로그 인자 수준에서 새로운 정보 이론적 하한선과 일치한다.

ABSTRACT

We consider the problem of offline reinforcement learning (RL) -- a well-motivated setting of RL that aims at policy optimization using only historical data. Despite its wide applicability, theoretical understandings of offline RL, such as its optimal sample complexity, remain largely open even in basic settings such as \emph{tabular} Markov Decision Processes (MDPs). In this paper, we propose Off-Policy Double Variance Reduction (OPDVR), a new variance reduction based algorithm for offline RL. Our main result shows that OPDVR provably identifies an $ε$-optimal policy with $\widetilde{O}(H^2/d_mε^2)$ episodes of offline data in the finite-horizon stationary transition setting, where $H$ is the horizon length and $d_m$ is the minimal marginal state-action distribution induced by the behavior policy. This improves over the best known upper bound by a factor of $H$. Moreover, we establish an information-theoretic lower bound of $Ω(H^2/d_mε^2)$ which certifies that OPDVR is optimal up to logarithmic factors. Lastly, we show that OPDVR also achieves rate-optimal sample complexity under alternative settings such as the finite-horizon MDPs with non-stationary transitions and the infinite horizon MDPs with discounted rewards.

연구 동기 및 목표

  • 표본 MDP에서 오프라인 강화학습 샘플 복잡도에 대한 이론적 이해의 격차를 메우기 위해.
  • 유한한 수명 주기의 정적 MDP에서 오프라인 정책 최적화에 대해 최적의 샘플 복잡도를 달성하는 알고리즘을 개발하기 위해.
  • 제안된 알고리즘의 최적성을 확인하기 위해 날카러운 정보 이론적 하한선을 수립하기 위해.
  • 알고리즘의 최적성을 비정적 및 무한한 수명 주기의 할인 MDP로 확장하기 위해.
  • 이전의 분산 감소 방법에서 발생하는 초기화 의존성 문제를 해결하기 위해.

제안 방법

  • OPDVR는 이중 분산 감소를 사용하는 확률적 값 반복 프레임워크를 활용하여 오프라인 데이터로부터의 학습을 안정화시킨다.
  • 기본적인 분산 감소 알고리즘에서 발생하는 초기화에 의존하는 성능 문제를 해결하기 위해 이중화 기법을 적용한다.
  • 역사적 트레이젝터리에서 추출한 미니배치를 사용하여 값 함수에 대한 확률적 갱신을 수행함으로써 추정 분산을 감소시킨다.
  • Sidford 등 (2018a)이 제안한 방식을 변형하여 오프-정책 데이터와 정적 전이에 적합하게 조정한 분산 감소 기법을 활용한다.
  • 임의의 초기화에서도 농도 경계를 유지함으로써 최소 최대 최적성을 보장한다.
  • 에러 전파를 MDP 내 시간 단계 간에 분석하기 위해 조건부 분산 분해를 통합한다.

실험 결과

연구 질문

  • RQ1유한한 수명 주기의 정적 MDP에서 오프라인 강화학습의 최적 샘플 복잡도는 무엇인가?
  • RQ2분산 감소 기반 알고리즘이 오프라인 설정에서 이 최적 복잡도를 달성할 수 있는가?
  • RQ3정적 전이 모델과 비정적 전이 모델 간에 오프라인 강화학습의 샘플 복잡도는 어떻게 다를까?
  • RQ4제안된 알고리즘이 무한한 수명 주기의 할인 MDP에서도 최적성을 유지할 수 있는가?
  • RQ5이전의 분산 감소 방법은 오프라인 강화학습에서 어떤 이론적 한계를 가지며, 이를 어떻게 극복할 수 있는가?

주요 결과

  • OPDVR는 유한한 수명 주기의 정적 MDP에서 $\epsilon$-최적 정책을 찾는 데 $\widetilde{O}(H^{2}/d_{m}\epsilon^{2})$의 샘플 복잡도를 달성하며, 이는 이전의 최선의 경계보다 $H$ 요소만큼 향상되었다.
  • 논문은 $\Omega(H^{2}/d_{m}\epsilon^{2})$의 일치하는 정보 이론적 하한선을 수립하여, OPDVR가 로그 인자 수준에서 최적이며, 이는 증명되었다.
  • 유한한 수명 주기의 비정적 설정에서는 OPDVR가 $\widetilde{O}(H^{3}/d_{m}\epsilon^{2})$의 샘플 복잡도를 달성하며, 이는 로그 인자 수준에서 최적이며 최적이다.
  • 무한한 수명 주기의 할인 MDP에서는 OPDVR가 단계 수 기준으로 $\widetilde{O}((1-\gamma)^{-3}/d_{m}\epsilon^{2})$의 샘플 복잡도를 달성하며, 이는 로그 인자 수준에서 최적이며 최적이다.
  • 이중화 절차를 사용함으로써 이전의 분산 감소 방법의 심각한 결함을 해결하였으며, 초기화에 대한 의존성을 제거하였다.
  • 분석을 통해 OPDVR는 정적 설정에서 $O(H^2)$ 수명 주기 의존성을 달성하는 최초의 오프라인 알고리즘임을 확인하였으며, 이는 비정적 설정과의 엄밀한 분리를 공식화하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.