Skip to main content
QUICK REVIEW

[논문 리뷰] $Q$-learning with Logarithmic Regret

Kunhe Yang, Lin F. Yang|arXiv (Cornell University)|2020. 06. 16.
Advanced Bandit Algorithms Research참고 문헌 42인용 수 16
한 줄 요약

이 논문은 엄격히 양의 부분최적성 갭 조건 하에서, 모델에 의존하지 않는 Q-학습 알고리즘에 대해 에피소딕 표본형 강화학습에서 최초로 비점점적 로그적 등급 경계를 확립한다. 이는 온실적 Q-학습이 $\mathcal{O}\left(\frac{SAH^{6}}{\Delta_{\min}}\log(SAT)\right)$의 누적 등급을 달성함을 증명하며, $\log(SA)$ 인자 외에는 인스턴스에 의존하는 하한 경계와 일치한다. 이는 $\Delta_{\min}$의 지식이 필요하지 않다.

ABSTRACT

This paper presents the first non-asymptotic result showing that a model-free algorithm can achieve a logarithmic cumulative regret for episodic tabular reinforcement learning if there exists a strictly positive sub-optimality gap in the optimal $Q$-function. We prove that the optimistic $Q$-learning studied in [Jin et al. 2018] enjoys a ${\mathcal{O}}\left(\frac{SA\cdot \mathrm{poly}\left(H ight)}{Δ_{\min}}\log\left(SAT ight) ight)$ cumulative regret bound, where $S$ is the number of states, $A$ is the number of actions, $H$ is the planning horizon, $T$ is the total number of steps, and $Δ_{\min}$ is the minimum sub-optimality gap. This bound matches the information theoretical lower bound in terms of $S,A,T$ up to a $\log\left(SA ight)$ factor. We further extend our analysis to the discounted setting and obtain a similar logarithmic cumulative regret bound.

연구 동기 및 목표

  • 모델에 의존하지 않는 Q-학습이 에피소딕 표본형 MDP에서 로그적 등급을 달성할 수 있는지 여부에 대한 열린 문제를 해결하기 위해.
  • 실제 환경에서 흔히 존재하는 부분최적성 갭 조건 하에서 온실적 Q-학습을 분석하기 위해.
  • 인스턴스에 의존하는 하한 경계와 로그 인자 외에는 일치하는 비점점적 등급 경계를 유도하기 위해.
  • 유사한 등급 경계를 갖는 무한 수평 할인 설정으로 분석을 확장하기 위해.

제안 방법

  • 각 상태-행동 수준에서의 추정 오차의 가중합을 통해 등급을 제한하는 온실적 Q-학습에 대한 새로운 분석 프레임워크를 제안한다.
  • 계획 수평 내에서 시간 단계 간 오차 전파를 체계적으로 제어하기 위해 $(C, (1+1/H)w)$-시퀀스를 도입한다.
  • 모델 기반 분석에서 유래한 온실적 초과 개념에 클리핑 기법을 적용하여 로그적 등급을 도출한다.
  • 하위최적 행동의 수를 제한하기 위해 Q-값 오차를 구간 $[2^{n-1}\Delta_{\min}, 2^n\Delta_{\min})$로 이중 분할한다.
  • 집중 불등식과 재귀적 경계 설정을 활용하여 모든 단계와 수준에서 누적 오차를 제어한다.
  • 할인 인자 $\gamma$를 사용해 항을 조정함으로써 할인 설정으로의 분석 확장을 수행한다.

실험 결과

연구 질문

  • RQ1엄격히 양의 부분최적성 갭 조건 하에서 모델에 의존하지 않는 Q-학습이 에피소딕 표본형 MDP에서 로그적 등급을 달성할 수 있는가?
  • RQ2Jin 등(2018)의 온실적 Q-학습 알고리즘이 인스턴스에 의존하는 하한 경계와 일치하는 등급 경계를 달성할 수 있는가?
  • RQ3모델에 의존하지 않는 설정에서 계획 수평 $H$와 최소 부분최적성 갭 $\Delta_{\min}$에 따라 등급은 어떻게 스케일링되는가?
  • RQ4유사한 로그적 등급 보장을 갖는 무한 수평 할인 MDP 설정으로 분석을 확장할 수 있는가?
  • RQ5등급은 $H$와 $\Delta_{\min}$에 대해 어떻게 의존하는가? 그리고 $H^6$ 요소는 향상시킬 수 있는가?

주요 결과

  • 온실적 Q-학습 알고리즘이 에피소딕 표본형 MDP에서 $\mathcal{O}\left(\frac{SAH^{6}}{\Delta_{\min}}\log(SAT)\right)$의 누적 등급을 달성한다.
  • 이 등급 경계는 Simchowitz와 Jamieson(2019)의 인스턴스에 의존하는 하한 경계와 $S$, $A$, $T$의 $\log(SA)$ 인자 외에는 일치한다.
  • 알고리즘은 최소 부분최적성 갭 $\Delta_{\min}$의 사전 지식이 필요하지 않다.
  • 할인 설정에서는 등급이 $\mathcal{O}\left(\frac{SA}{\Delta_{\min}(1-\gamma)^6}\log\left(\frac{SAT}{\Delta_{\min}(1-\gamma)}\right)\right)$로 경계된다.
  • 분석 결과 $H^6$의 의존성은 최적화 가능성이 없음을 시사하며, 향상 여지가 있음을 보여준다.
  • 이 방법은 모델 기반 분석에서 유래한 온실적 초과 기법을 새로운 재귀적 오차 경계 프레임워크를 통해 모델에 의존하지 않는 Q-학습에 성공적으로 적용한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.