Skip to main content
QUICK REVIEW

[논문 리뷰] Tight Regret Bounds for Model-Based Reinforcement Learning with Greedy Policies

Yonathan Efroni, Nadav Merlis|arXiv (Cornell University)|2019. 05. 27.
Reinforcement Learning in Robotics참고 문헌 37인용 수 12
한 줄 요약

이 논문은 유한한 시간 범위, 할인 없음 MDP에서 1단계 계획(전체 계획이 아닌)을 사용하는 탐색 정책을 갖는 모델 기반 강화 학습이 전체 계획 알고리즘과 동일한 날카운 감소 경계를 달성함을 보여준다. 핵심 기여는 실시간 동적 프로그래밍(RTDP)에 대한 새로운 분석으로, 이는 UCRL2-GP와 EULER-GP의 설계를 가능하게 하였으며, 계산 복잡도를 $S$ 배 감소시키면서도 $\tilde{O}(\sqrt{HSAT})$의 감소 경계를 유지한다.

ABSTRACT

State-of-the-art efficient model-based Reinforcement Learning (RL) algorithms typically act by iteratively solving empirical models, i.e., by performing \emph{full-planning} on Markov Decision Processes (MDPs) built by the gathered experience. In this paper, we focus on model-based RL in the finite-state finite-horizon MDP setting and establish that exploring with \emph{greedy policies} -- act by \emph{1-step planning} -- can achieve tight minimax performance in terms of regret, $ ilde{\mathcal{O}}(\sqrt{HSAT})$. Thus, full-planning in model-based RL can be avoided altogether without any performance degradation, and, by doing so, the computational complexity decreases by a factor of $S$. The results are based on a novel analysis of real-time dynamic programming, then extended to model-based RL. Specifically, we generalize existing algorithms that perform full-planning to such that act by 1-step planning. For these generalizations, we prove regret bounds with the same rate as their full-planning counterparts.

연구 동기 및 목표

  • 모델 기반 RL 알고리즘에서 전체 계획의 높은 계산 비용을 해결하기 위해.
  • 전체 계획 대신 1단계 계획(탐색 정책)을 사용하는 모델 기반 RL에 대한 감소 보장을 수립하기 위해.
  • 탐색 정책이 표본 유한 시간 범위 MDP에서 전체 계획 알고리즘과 동일한 최소 최대 감소를 달성할 수 있음을 보여주기 위해.
  • 기존의 전체 계획 알고리즘(UCRL2, EULER)을 1단계 계획으로 일반화하면서도 감소 경계를 유지하기 위해.
  • 성능 보장을 훼손하지 않고 계산 복잡도를 $S$ 배 감소시키기 위해.

제안 방법

  • 알려진 모델 하에서 감소한 유계 과정에 초점을 맞춘 실시간 동적 프로그래밍(RTDP)의 새로운 유한 샘플 분석을 개발하기 위해.
  • 감소한 유계 과정에 대한 농도 경계를 도입하였으며, 이는 별도의 관심을 가진 결과이자 RTDP 분석을 지원한다.
  • UCRL2와 EULER 알고리즘을 전체 계획 대신 탐색 정책(1단계 계획)을 사용하도록 수정하여 UCRL2-GP와 EULER-GP를 도출하기 위해.
  • 예측된 방문 빈도 기반으로 상태-행동 쌍을 분할하기 위해 새로운 상태-행동 방문 임계값 $L_k$를 도입하기 위해.
  • 감소 경계 분석에서 기대 역방문 빈도를 제어하기 위해 코시-슈바르츠 부등식과 합계 경계를 적용하기 위해.
  • 탐색 변형의 감소 경계가 전체 계획 대응체와 동일한, 로그 인자 수준 이내의 감소 경계를 가짐을 증명하기 위해.

실험 결과

연구 질문

  • RQ11단계 계획(탐색 정책)을 사용하는 모델 기반 RL이 유한 시간 범위 MDP에서 전체 계획 알고리즘과 동일한 감소 경계를 달성할 수 있는가?
  • RQ2모델 기반 RL에서 전체 계획을 1단계 계획으로 대체할 경우, 여전히 날카운 감소 보장($\tilde{\mathcal{O}}(\sqrt{HSAT})$)을 유지할 수 있는가?
  • RQ3모델 기반 RL 알고리즘에서 전체 계획을 1단계 계획으로 대체할 경우 계산 복잡도는 얼마나 감소하는가?
  • RQ4알려진 모델 하에서 실시간 동적 프로그래밍(RTDP)을 유한 샘플 보장 하에 분석할 수 있는가? 이는 학습 설정에서의 사용을 가능하게 한다.
  • RQ5UCRL2와 EULER의 계획 단계를 1단계 탐색 계획으로 대체할 경우, 감소 경계를 유지할 수 있는가?

주요 결과

  • 전체 계획 대신 1단계 탐색 계획을 사용하는 UCRL2-GP와 EULER-GP는 전체 계획 대응체와 동일한 감소 경계 $\tilde{\mathcal{O}}(\sqrt{HSAT})$를 달성한다.
  • 모델 기반 RL의 계산 복잡도는 시간 및 공간 복잡도 모두에서 전체 계획을 1단계 계획으로 대체함으로써 $S$ 배 감소한다.
  • 모델 기반 RL에서 날카운 감소 경계를 달성하기 위해 전체 계획이 반드시 필요한 것은 아니며, 탐색 정책과 1단계 계획만으로도 충분하다.
  • 알려진 모델 하에서 RTDP의 분석은 학습 설정에서 감소 경계를 유도하는 기초를 제공하며, 감소한 유계 과정에 대한 새로운 농도 결과를 포함한다.
  • UCRL2-GP와 EULER-GP는 UCRL2와 EULER와 동일한 감소 속도를 유지하면서도 계산 오버헤드를 크게 감소시킨다.
  • $\tilde{\mathcal{O}}(\sqrt{HSAT})$의 감소 경계는 날카롭게, 표본 유한 시간 범위 MDP에 대한 알려진 최소 최대 하한과 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.