Skip to main content
QUICK REVIEW

[논문 리뷰] Nearly Minimax Optimal Reinforcement Learning for Discounted MDPs

Jiafan He, Dongruo Zhou|arXiv (Cornell University)|2020. 10. 01.
Advanced Bandit Algorithms Research참고 문헌 32인용 수 9
한 줄 요약

이 논문은 할인 마르코프 결정 과정(MDPs)을 위한 모델 기반 강화학습 알고리즘인 UCBVI-γ를 제안한다. 이 알고리즘은 개선된 버진스 타입 보너스와 전반적 분산의 법칙을 활용하여 거의 최소 최대 최적의 적자(Regret)를 달성한다. 상한선은 $\widetilde{O}(\sqrt{SAT}/(1-\gamma)^{1.5})$이며, 하한선은 $\widetilde{\Omega}(\sqrt{SAT}/(1-\gamma)^{1.5})$로, 로그 인자 외에는 거의 최적임을 입증한다.

ABSTRACT

We study the reinforcement learning problem for discounted Markov Decision Processes (MDPs) under the tabular setting. We propose a model-based algorithm named UCBVI-$γ$, which is based on the \emph{optimism in the face of uncertainty principle} and the Bernstein-type bonus. We show that UCBVI-$γ$ achieves an $ ilde{O}\big({\sqrt{SAT}}/{(1-γ)^{1.5}}\big)$ regret, where $S$ is the number of states, $A$ is the number of actions, $γ$ is the discount factor and $T$ is the number of steps. In addition, we construct a class of hard MDPs and show that for any algorithm, the expected regret is at least $ ildeΩ\big({\sqrt{SAT}}/{(1-γ)^{1.5}}\big)$. Our upper bound matches the minimax lower bound up to logarithmic factors, which suggests that UCBVI-$γ$ is nearly minimax optimal for discounted MDPs.

연구 동기 및 목표

  • 기존의 온라인 강화학습 알고리즘과 할인 MDPs에 대한 이론적 최소 최대 하한선 사이의 격차를 메우기 위해.
  • 생성 모델이 필요 없이 거의 최적의 적자를 달성하는 실용적인 모델 기반 알고리즘을 설계하기 위해.
  • 할인 MDPs에서 적자에 대한 거의 매칭되는 상한선과 하한선을 확립하여, 로그 인자 외에는 최소 최대 최적임을 확인하기 위해.
  • 이전의 $\widetilde{O}(\sqrt{SAT}/(1-\gamma)^{2.5})$로 스케일링된 적자 상한선을 $(1-\gamma)^{-1}$의 요소로 향상시키기 위해.

제안 방법

  • 알고리즘 UCBVI-γ는 불확실성에 대한 낙관주의 원칙(OFU)에 기반하며, 상한선을 강화하기 위해 개선된 버진스 타입 보너스를 통합한다.
  • 값 함수 갱신에서 추정 오차를 더 잘 제어하기 위해 전반적 분산의 법칙을 사용한다.
  • empirical 카운트와 분산 추정치에서 유도된 신뢰 간격을 사용하여 값 반복을 수행한다.
  • 시간 단계에 걸쳐 재귀적 적자 분해와 농도 불등식을 조합한 새로운 분석 기법을 사용한다.
  • 방문 빈도와 분산에 따라 달라지는 보너스 항과 함께 경험 보상의 조합을 사용하여 값 함수에 대한 상한 신뢰 구간을 유지한다.
  • 적자 분석은 시간 영역에 걸친 재귀적 적자 분해를 활용하고, 코시-슈바르츠 및 기타 불등식을 적용하여 누적된 최적성 부족을 제한한다.

실험 결과

연구 질문

  • RQ1모델 기반 온라인 RL 알고리즘이 할인 MDPs에 대해 최소 최대 하한선에 로그 인자 외에는 매칭되는 적자를 달성할 수 있는가?
  • RQ2표준 UCB나 Q-러닝 접근 방식에 비해 개선된 버진스 타입 보너스를 사용할 경우 적자 상한선이 향상되는가?
  • RQ3할인 MDPs에서 온라인 학습에 대해 가능한 가장 날카로운 적자 하한선은 무엇인가?
  • RQ4할인 요소 $\gamma$에 대한 적자 의존성은 $O((1-\gamma)^{-2.5})$에서 $O((1-\gamma)^{-1.5})$로 향상시킬 수 있는가?

주요 결과

  • 제안된 UCBVI-γ 알고리즘은 할인 MDPs에 대해 $\widetilde{O}(\sqrt{SAT}/(1-\gamma)^{1.5})$의 상한 적자 상한선을 달성한다.
  • 논문은 $\widetilde{\Omega}(\sqrt{SAT}/(1-\gamma)^{1.5})$의 기대 적자에 대해 하한선을 도출하는 어려운 MDP 클래스를 구성한다.
  • 상한선과 하한선이 로그 인자 외에는 매칭되며, 이는 UCBVI-γ가 거의 최소 최대 최적임을 확인한다.
  • 이전의 Double Q-러닝 [15]와 같은 연구에 비해 개선된 $\widetilde{O}(\sqrt{SAT}/(1-\gamma)^{2.5})$의 적자 상한선을 달성한다.
  • 일반적인 특징 매핑으로 인해 발생하는 $S^2A$ 의존성으로 인해 발생하는 선형 혼합 MDP 기반 방법보다 표본 설정에서 더 우수한 성능을 보인다.
  • 분석을 통해 개선된 버진스 보너스와 분산 인식 신뢰 구간이 향상된 적자 스케일링을 달성하는 데 핵심적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.