Skip to main content
QUICK REVIEW

[논문 리뷰] Nearly Minimax Optimal Reward-free Reinforcement Learning

Zihan Zhang, Simon S. Du|arXiv (Cornell University)|2020. 10. 12.
Reinforcement Learning in Robotics참고 문헌 30인용 수 10
한 줄 요약

이 논문은 계획 수평 H에 대해 로그 스케일링으로 최소 최대 최적의 샘플 복잡도를 달성하는 보상 자유 강화 학습 알고리즘인 SSTP를 제안한다. 이는 기본 하한선에 로그 인자만을 고려해 일치하며, 보상 함수에 대해 최소한의 데이터로 효율적으로 탐색하고 계획을 수립한다. 이는 오랫동안 존재해온 보상 자유 RL에서의 상한선과 하한선 사이의 격차를 해결한다.

ABSTRACT

We study the reward-free reinforcement learning framework, which is particularly suitable for batch reinforcement learning and scenarios where one needs policies for multiple reward functions. This framework has two phases. In the exploration phase, the agent collects trajectories by interacting with the environment without using any reward signal. In the planning phase, the agent needs to return a near-optimal policy for arbitrary reward functions. We give a new efficient algorithm, extbf{S}taged extbf{S}ampling + extbf{T}runcated extbf{P}lanning (\algoname), which interacts with the environment at most $O\left( \frac{S^2A}{ε^2} ext{poly}\log\left(\frac{SAH}ε ight) ight)$ episodes in the exploration phase, and guarantees to output a near-optimal policy for arbitrary reward functions in the planning phase. Here, $S$ is the size of state space, $A$ is the size of action space, $H$ is the planning horizon, and $ε$ is the target accuracy relative to the total reward. Notably, our sample complexity scales only \emph{logarithmically} with $H$, in contrast to all existing results which scale \emph{polynomially} with $H$. Furthermore, this bound matches the minimax lower bound $Ω\left(\frac{S^2A}{ε^2} ight)$ up to logarithmic factors. Our results rely on three new techniques : 1) A new sufficient condition for the dataset to plan for an $ε$-suboptimal policy; 2) A new way to plan efficiently under the proposed condition using soft-truncated planning; 3) Constructing extended MDP to maximize the truncated accumulative rewards efficiently.

연구 동기 및 목표

  • 보상 자유 강화 학습에서 기존 상한선과 최소 최대 하한선 사이의 근본적 격차를 해결하며, 특히 계획 수평 H에 대한 다항적 의존성에 초점을 맞춘다.
  • 이론적 최소값에 가까운 샘플 복잡도를 달성하는 알고리즘을 개발하며, Ω(S²A/ε²) 하한선에 로그 인자만을 고려해 일치시킨다.
  • 장수평 환경에서의 확장성에 장애가 되던 샘플 복잡도의 다항적 H-의존성을 제거한다.
  • 균일하게 유계인 보상의 가정을 총 유계성으로 완화하여 실세계 적용 가능성을 넓힌다.
  • 절단된 가치 함수를 사용한 데이터 집합의 충분성과 불확실성 하에서의 효율적 계획을 위한 새로운 이론적 프레임워크를 제공한다.

제안 방법

  • ε-하위최적 정책의 계획을 지원하기 위한 새로운 충분 조건을 도입하며, 이는 상태-행동 방문 카운트와 신뢰 구간에 기반한다.
  • 높은 방문 빈도 상태-행동 쌍을 우선시하면서도, 절단된 보상으로 과대추정을 억제하는 소프트-절단 계획 기법을 설계한다.
  • 절단된 누적 보상을 최대화하기 위해 확장된 MDP를 구성함으로써, 불확실성 하에서의 효율적 탐색과 계획을 가능하게 한다.
  • 적응형 에피소드 스케줄링을 포함한 단계적 샘플링을 구현하며, 각 단계에서 상태-행동 쌍의 최소 방문 기준을 증가시킨다.
  • Hoeffding 유형 부등식으로 유도된 신뢰 구간 기반 탐색 전략을 사용하여, 방문 카버리지와 추정 정확성의 균형을 확보한다.
  • 값 함수 차이의 재귀적 분해를 활용해, 방문 빈도 가중치를 적용한 신뢰 구간으로 하위최적성 갭을 한계화한다.

실험 결과

연구 질문

  • RQ1보상 자유 강화 학습의 샘플 복잡도를 로그 스케일링을 초월해 계획 수평 H에 독립적으로 만들 수 있는가?
  • RQ2보상 함수의 가정을 완화하면서도 보상 자유 강화 학습에서 샘플 복잡도의 최소 최대 최적성을 달성할 수 있는가?
  • RQ3어떤 데이터 집합 조건이 임의의 보상 함수에 대해 ε-최적 정책의 계획을 보장하는가?
  • RQ4보상 신호 없이 데이터를 수집한 후, 불확실성 하에서 계획을 어떻게 효율적이고 견고하게 수행할 수 있는가?
  • RQ5단일 데이터 집합이 최소한의 샘플 오버헤드로 여러 임의의 보상 함수에 대해 거의 최적의 정책을 지원할 수 있는가?

주요 결과

  • 제안된 SSTP 알고리즘은 고확률로 O((SA/ε²)(S + log(1/δ)) · polylog(SAH/ε))의 샘플 복잡도를 달성하며, Ω(S²A/ε²) 최소 최대 하한선에 로그 인자만을 고려해 일치한다.
  • 샘플 복잡도는 계획 수평 H에 대해 로그 스케일링으로 증가하지만, 이전 연구들이 다항적 스케일링(예: H³ 또는 H⁵)을 보였던 것과 대비해 기하급수적 향상이다.
  • 알고리즘은 데이터 수집 시 보상 피드백이 없더라도, 탐색 후 모든 비음수이고 총 유계인 1 이하의 보상 함수에 대해 ε-최적 정책을 보장한다.
  • 이전 결과에 비해 균일하게 유계인 보상의 가정을 제거하고, 총 유계성 조건으로 완화함으로써 실용성 있는 적용 범위를 넓혔다.
  • 이론적 분석을 통해 알고리즘의 하위최적성 갭이 O(K²ε)로 한계화되며, 이는 제안된 신뢰 구간 프레임워크 하에서 타당한 경계임을 확인하였다.
  • 소프트-절단 계획 기법은 가치 함수 추정에서의 과대추정에 대한 견고성을 확보하여, 단일 데이터 집합으로부터 안정적이고 효율적인 정책 유도를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.