Skip to main content
QUICK REVIEW

[논문 리뷰] Reward-Free RL is No Harder Than Reward-Aware RL in Linear Markov Decision Processes

Andrew Wagenmaker, Yifang Chen|arXiv (Cornell University)|2022. 01. 26.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 선형 마르코프 결정 과정(MDP)에서 보상 자유 강화 학습(RL)이 표본의 경우와는 달리 보상 인식 RL보다 본질적으로 더 어렵지 않음을 입증한다. 저자들은 샘플 복잡도 $\widetilde{\mathcal{O}}(d^2H^5/\epsilon^2)$를 달성하는 계산적으로 효율적인 알고리즘을 제안하며, 이는 보상 인식 RL에 대한 하한 $\Omega(d^2H^2/\epsilon^2)$와 일치하여 기능 근사 하에서 복잡도 격차가 없음을 증명한다.

ABSTRACT

Reward-free reinforcement learning (RL) considers the setting where the agent does not have access to a reward function during exploration, but must propose a near-optimal policy for an arbitrary reward function revealed only after exploring. In the the tabular setting, it is well known that this is a more difficult problem than reward-aware (PAC) RL -- where the agent has access to the reward function during exploration -- with optimal sample complexities in the two settings differing by a factor of $|\mathcal{S}|$, the size of the state space. We show that this separation does not exist in the setting of linear MDPs. We first develop a computationally efficient algorithm for reward-free RL in a $d$-dimensional linear MDP with sample complexity scaling as $\widetilde{\mathcal{O}}(d^2 H^5/ε^2)$. We then show a lower bound with matching dimension-dependence of $Ω(d^2 H^2/ε^2)$, which holds for the reward-aware RL setting. To our knowledge, our approach is the first computationally efficient algorithm to achieve optimal $d$ dependence in linear MDPs, even in the single-reward PAC setting. Our algorithm relies on a novel procedure which efficiently traverses a linear MDP, collecting samples in any given ``feature direction'', and enjoys a sample complexity scaling optimally in the (linear MDP equivalent of the) maximal state visitation probability. We show that this exploration procedure can also be applied to solve the problem of obtaining ``well-conditioned'' covariates in linear MDPs.

연구 동기 및 목표

  • 표본의 설정에서 그러한 격차가 존재하는 선형 MDP에서 보상 자유와 보상 인식 RL 간의 격차를 좁히기.
  • 선형 MDP에서 보상 자유 RL에 대해 최적의 특성 차원 $d$에 대한 의존성을 가진 계산적으로 효율적인 알고리즘 개발.
  • 선형 MDP에서 보상 자유 RL의 샘플 복잡도가 $H$ 요소를 제외하고 보상 인식 RL과 일치함을 보여주기.
  • 주어진 정확도 이내에서 모든 특성 방향에 걸쳐 데이터를 효율적으로 수집하는 새로운 탐색 절차 설계.
  • 동일한 탐색 전략이 최소 고유값이 제로에서 멀리 떨어진 양호하게 조건화된 공분산 행렬을 구성하는 데에 가능하게 함을 보여주기.

제안 방법

  • 주어진 정확도 이내에서 모든 특성 방향에 샘플을 수집하기 위해 '커버링 트랙토리'를 생성하는 새로운 탐색 전략 제안.
  • 이 탐색 절차를 사용하여 선형 MDP에서 근사 최적 정책을 학습할 수 있는 계산적으로 효율적인 알고리즘 설계.
  • 알고리즘의 샘플 복잡도는 선형 MDP 설정에서 최대 상태 방문 확률의 역수에 대해 최적 스케일링을 보인다.
  • 특성 공간을 $\mathcal{X}_i$ 집합으로 계층적으로 분해하여 커버링 오차를 제어하고 전체 특성 공간 커버리지 보장.
  • 각 커버링 집합 내 특성 벡터의 최대 노름을 기반으로 한 새로운 고유값 하한 증명을 통해 양호하게 조건화된 공분산 행렬 확보.
  • 탐색 절차를 활용하여 최소 고유값이 하한이 존재하는 설계 행렬을 구성함으로써 후속 정책 학습에 필수적인 조건을 확보.

실험 결과

연구 질문

  • RQ1표본의 설정과 달리 선형 MDP에서 보상 자유 RL은 보상 인식 RL만큼 본질적으로 어렵지 않은가?
  • RQ2계산적으로 효율적인 알고리즘이 선형 MDP에서 보상 자유 RL의 샘플 복잡도에 대해 최적의 $d$-의존성을 달성할 수 있는가?
  • RQ3보상 자유 RL의 탐색 절차가 최대 상태 방문 확률의 역수에 대해 최적 스케일링을 보이는가?
  • RQ4동일한 탐색 메커니즘이 선형 MDP에서 양호하게 조건화된 공분산 행렬을 구성하는 데에 사용될 수 있는가?
  • RQ5선형 MDP에서 보상 인식 RL의 최적 샘플 복잡도는 무엇이며, 이는 보상 자유 RL과 일치하는가?

주요 결과

  • 제안된 보상 자유 RL 알고리즘의 샘플 복잡도는 $\widetilde{\mathcal{O}}(d^2H^5/\epsilon^2)$로 스케일링되며, 특성 차원 $d$에 대해 최적의 의존성을 달성한다.
  • 보상 인식 RL에 대해 $\Omega(d^2H^2/\epsilon^2)$의 하한이 확립되어 보상 자유 설정에서 $d$-의존성에 추가 비용이 발생하지 않음을 보여준다.
  • 알고리즘의 탐색 절차는 최대 상태 방문 확률의 역수에 대해 최적 스케일링을 보이며, 그 제곱의 역수보다 더 좋다.
  • 동일한 탐색 메커니즘을 통해 최소 고유값이 0에서 멀리 떨어진 양호하게 조건화된 공분산 행렬을 구성할 수 있다.
  • 이 작업은 선형 MDP에서 계산적으로 효율적인 알고리즘의 최적 $d$-의존성을 처음으로 보상 자유, 보상 인식, 그리고 손실 최소화 설정 전반에 걸쳐 정립한다.
  • 결과적으로 선형 MDP에서는 보상 함수를 활용한 탐색 전략이 샘플 복잡도에 있어 점근적 이점이 없다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.