Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Instance-Optimal Offline Reinforcement Learning with Pessimism

Minghao Yin, Yu-Xiang Wang|arXiv (Cornell University)|2021. 10. 17.
Reinforcement Learning in Robotics참고 문헌 50인용 수 4
한 줄 요약

이 논문은 편향성 원리(pessimism)를 사용한 인스턴스 최적의 오프라인 강화학습 프레임워크를 소개하며, 개별 MDP 인스턴스에 적응하는 날카운 suboptimality 경계를 유도한다. 제안된 적응형 편향성가치반복(Adaptive Pessimistic Value Iteration, APVI) 알고리즘은 $ O\left(\sum_{h=1}^{H}\sum_{s_h,a_h} d^{\pi^\star}_h(s_h,a_h) \sqrt{\frac{\mathrm{Var}_{P_{s_h,a_h}}(V^{\star}_{h+1}+r_h)}{d^{\mu}_h(s_h,a_h)}} \sqrt{\frac{1}{n}} \right) $에 가까운 경계를 달성하며, 다양한 가정 하에서 기존의 최소최대(minimax) 및 문제에 의존하는 결과를 복원하고, 개별 인스턴스에 대한 정보이론적 하한을 설정한다.

ABSTRACT

We study the offline reinforcement learning (offline RL) problem, where the goal is to learn a reward-maximizing policy in an unknown Markov Decision Process (MDP) using the data coming from a policy $μ$. In particular, we consider the sample complexity problems of offline RL for finite-horizon MDPs. Prior works study this problem based on different data-coverage assumptions, and their learning guarantees are expressed by the covering coefficients which lack the explicit characterization of system quantities. In this work, we analyze the Adaptive Pessimistic Value Iteration (APVI) algorithm and derive the suboptimality upper bound that nearly matches \[ O\left(\sum_{h=1}^H\sum_{s_h,a_h}d^{π^\star}_h(s_h,a_h)\sqrt{\frac{\mathrm{Var}_{P_{s_h,a_h}}{(V^\star_{h+1}+r_h)}}{d^μ_h(s_h,a_h)}}\sqrt{\frac{1}{n}} ight). \] In complementary, we also prove a per-instance information-theoretical lower bound under the weak assumption that $d^μ_h(s_h,a_h)>0$ if $d^{π^\star}_h(s_h,a_h)>0$. Different from the previous minimax lower bounds, the per-instance lower bound (via local minimaxity) is a much stronger criterion as it applies to individual instances separately. Here $π^\star$ is a optimal policy, $μ$ is the behavior policy and $d_h^μ$ is the marginal state-action probability. We call the above equation the intrinsic offline reinforcement learning bound since it directly implies all the existing optimal results: minimax rate under uniform data-coverage assumption, horizon-free setting, single policy concentrability, and the tight problem-dependent results. Later, we extend the result to the assumption-free regime (where we make no assumption on $ μ$) and obtain the assumption-free intrinsic bound. Due to its generic form, we believe the intrinsic bound could help illuminate what makes a specific problem hard and reveal the fundamental challenges in offline RL.

연구 동기 및 목표

  • 최악의 경우 가정에 의존하지 않고 개별 문제 인스턴스에 적응하는 증명 가능하게 효율적인 오프라인 RL 방법을 개발하는 것.
  • 행동 정책의 커버리지와 가치 분산에 기반해 각 MDP 인스턴스의 본질적 난이도를 반영하는 suboptimality 경계를 도출하는 것.
  • 국소 최소최대성(local minimaxity)을 통해 개별 인스턴스에 대한 정보이론적 하한을 수립하는 것. 이는 전통적인 최소최대 경계보다 더 강력하다.
  • 데이터 커버리지 가정이 없는 가정 자유 영역(assumption-free regime)으로 분석을 확장하는 것.
  • 단일 내재 경계 내에서 기존 결과—최소최대, 수명주기 자유, 단일 정책 집중성, 문제에 의존하는 경계—를 통합하고 복원하는 것.

제안 방법

  • 오프라인 데이터의 분포 이탈을 다루기 위해 가치반복에 편향성 원리를 통합한 적응형 편향성가치반복(APVI) 알고리즘을 제안한다.
  • 최적 정책의 상태-행동 방문도 $ d^{\pi^\star}_h $, 행동 정책 커버리지 $ d^{\mu}_h $, 다음 가치함수의 분산 $ \mathrm{Var}_{P_{s_h,a_h}}(V^{\star}_{h+1}+r_h) $ 에 의존하는 suboptimality 상한을 도출한다.
  • 두점 최적가치 추정으로의 새로운 감소 기법을 사용해 개별 인스턴스에 대한 하한을 증명하고 국소 최소최대 최적성을 확립한다.
  • 가정 자유 영역을 분석하기 위해 편향성 확장 MDP를 도입하여, 어떤 데이터 커버리지 가정도 없이 경계를 도출할 수 있도록 한다.
  • 헬링거 거리와 두 번째 차수 테일러 전개를 활용해 분포 이탈을 제어하고 추정된 전이 모델의 통계적 일관성을 보장한다.
  • 국소 인스턴스 의존 분석을 적용해, 최악의 경우 평균이 아닌 각 개별 MDP 인스턴스에 대해 유효한 하한을 도출한다.

실험 결과

연구 질문

  • RQ1최악의 경우 가정에 의존하지 않고 개별 MDP 인스턴스의 본질적 난이도에 적응하는 오프라인 RL의 suboptimality 경계를 도출할 수 있는가?
  • RQ2제안된 경계는 최소최대율, 수명주기 자유 경계, 단일 정책 집중성 등 기존 결과들과 어떻게 관련되어 있으며 이를 복원하는가?
  • RQ3주어진 인스턴스에 대해 오프라인 RL의 기본 통계적 한계는 무엇이며, 이를 개별 인스턴스 하한으로 특성화할 수 있는가?
  • RQ4행동 정책에 대한 데이터 커버리지 가정이 없는 가정 자유 영역에서 증명 가능하게 효율적인 알고리즘을 수립할 수 있는가?
  • RQ5유도된 경계는 가치 분산과 커버리지의 역할을 포함해 오프라인 RL의 진정한 시스템 수준 복잡성을 반영하는가?

주요 결과

  • APVI 알고리즘은 $ O\left(\sum_{h=1}^{H}\sum_{s_h,a_h} d^{\pi^\star}_h(s_h,a_h) \sqrt{\frac{\mathrm{Var}_{P_{s_h,a_h}}(V^{\star}_{h+1}+r_h)}{d^{\mu}_h(s_h,a_h)}} \sqrt{\frac{1}{n}} \right) $ 에 가까운 suboptimality 상한을 달성하며, 이는 인스턴스 최적임이 입증된다.
  • 논문은 $ d^\mu_h(s_h,a_h) > 0 $ 이면 $ d^{\pi^\star}_h(s_h,a_h) > 0 $ 이라는 약한 가정 하에서 개별 인스턴스에 대한 정보이론적 하한을 증명하며, 이는 전통적인 최소최대 경계보다 더 강력하다.
  • 내재된 경계는 기존 결과를 복원한다: 균일한 커버리지 하에서 최소최대율, 수명주기 자유 경계, 단일 정책 집중성, 문제에 의존하는 경계.
  • 가정 자유 영역에서, 데이터 커버리지 가정 없이도 유효한 경계를 도출하였으며, 행동 정책의 지지 집합과 MDP의 구조에만 의존한다.
  • 분석은 오프라인 RL의 근본적 과제가 최적 정책의 방문도, 행동 정책의 커버리지, 가치함수의 분산 간 상호작용에 있음을 보여주며, 이는 내재된 경계가 정확히 이를 반영한다.
  • 다양한 영역에서 경계가 날카로움을 입증하여, 제안된 방법이 인스턴스 최적의 표본 복잡도를 달성함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.