Skip to main content
QUICK REVIEW

[논문 리뷰] Regret Bounds for Discounted MDPs

Shuang Liu, Hao Su|arXiv (Cornell University)|2020. 02. 12.
Advanced Bandit Algorithms Research참고 문헌 16인용 수 7
한 줄 요약

이 논문은 비에피소딕 강화학습에 대한 새로운 성능 측정 기준인 $\gamma$-regret을 도입하며, 유한한 시간 간격 설정에서 평균 보상 재해의 한계를 해결한다. 이는 이론적 경계를 통해 $\gamma$-regret이 $\left(\frac{\sqrt{SAT}}{(1-\gamma)^{1/2}}\right)$ 비례하여 증가함을 보이며, 이는 이전 방법보다 더 날카롭고 실용적인 유한시간 최적성 기준을 제공한다.

ABSTRACT

Reinforcement learning (RL) has traditionally been understood from an episodic perspective; the concept of non-episodic RL, where there is no restart and therefore no reliable recovery, remains elusive. A fundamental question in non-episodic RL is how to measure the performance of a learner and derive algorithms to maximize such performance. Conventional wisdom is to maximize the difference between the average reward received by the learner and the maximal long-term average reward. In this paper, we argue that if the total time budget is relatively limited compared to the complexity of the environment, such comparison may fail to reflect the finite-time optimality of the learner. We propose a family of measures, called $γ$-regret, which we believe to better capture the finite-time optimality. We give motivations and derive lower and upper bounds for such measures. Note: A follow-up work (arXiv:2010.00587) has improved both our lower and upper bound, the gap is now closed at $ ildeΘ\left(\frac{\sqrt{SAT}}{(1 - γ)^{\frac{1}{2}}} ight)$.

연구 동기 및 목표

  • 시간 예산 $T$가 환경의 복잡성에 비해 작을 때, 평균 보상 재해가 유한시간 성능을 잘 반영하지 못하는 데서 비롯되는 부족함을 해결한다.
  • 비에피소딕 MDP에서 유한시간 최적성의 특성을 더 잘 반영할 수 있도록 $\gamma$-regret을 새로운 성능 측정 기준으로 제안한다.
  • $\gamma$-regret의 이론적 하한 및 상한을 유도하여 성능 측정 기준으로서의 적합성을 검증한다.
  • 제한된 시간 예산 하에서 단기 성능을 우선시하는 RL 알고리즘의 평가 및 설계를 위한 프레임워크를 제공한다.

제안 방법

  • 최적의 $\gamma$-할인 가치와 $T$ 단계 동안 실제로 확보한 보상 간의 누적 차이로 $\gamma$-regret을 정의한다: $\textnormal{Regret}_{\gamma}(T) = \sum_{h=0}^{T-1}(1-\gamma)V^{*,\gamma}_{s_h} - \sum_{h=0}^{T-1}r_h$.
  • 비에피소딕 가치 함수 학습에서의 과대평가 편향과 자기 의존성 문제를 완화하기 위해 더블 Q-학습을 활용한다.
  • 리셋이 발생하지 않는 비에피소딕 설정에서 재해가 급격히 증가하는 것을 방지하기 위해, 에피소딕 RL(예: Jin 등, 2018)의 증명 기법을 변형 적용한다.
  • 농도 불확실성 부등식과 비최적 단계 수의 경계를 사용하여 기대 재해를 분석함으로써 상한을 확립한다.
  • Jaksch 등(2010)의 이중 상태 MDP 구성 방식을 할인 설정에 적응시켜 하한을 도출한다.
  • 성능 비교의 기준으로서 $\gamma$-할인 가치 함수 $V^{*,\gamma}_s = \sup_\pi \mathbb{E}_\pi[\sum_{h=0}^\infty \gamma^h r_h \mid s_0 = s]$ 를 사용한다.

실험 결과

연구 질문

  • RQ1시간 예산 $T$가 작을 때, $T$가 환경의 복잡성에 비해 작을 경우 유한시간 최적성을 잘 반영할 수 있는 비에피소딕 RL을 위한 성능 측정 기준은 어떻게 정의할 수 있는가?
  • RQ2시간 예산이 제한된 복잡한 환경에서 평균 보상 재해가 유한시간 성능을 충분히 반영하지 못하는 이유는 무엇인가?
  • RQ3제안된 $\gamma$-regret 측정 기준에 대한 이론적 하한 및 상한은 무엇인가?
  • RQ4$\gamma$-regret 프레임워크는 기존의 평균 보상 재해 기반 수식보다 더 나은 알고리즘 설계를 가능하게 하는가?
  • RQ5할인 요소 $\gamma$ 가 비에피소딕 설정에서 재해 경계에 미치는 영향은 어떠한가?

주요 결과

  • 논문은 기대 $\gamma$-regret에 대해 이론적 상한을 $\tilde{O}\left(\frac{\sqrt{SAT}}{(1-\gamma)^{1/2}}\right)$ 로 확립하며, 이는 이전의 평균 보상 재해 경계보다 더 날카롭다.
  • 상한은 비최적 단계 수의 분석과 더불어 더블 Q-학습 및 적응형 학습률을 활용한 재해 급증 제어 기법을 통해 도출된다.
  • 이중 상태 MDP 구성 방식을 활용한 하한이 증명되며, 표준 가정 하에서 $\gamma$-regret는 $\Omega\left(\frac{\sqrt{SAT}}{(1-\gamma)^{1/2}}\right)$ 보다 향상될 수 없음을 보여준다.
  • 후속 연구(He 등, 2020)에서 상한과 하한 간의 격차가 해소되어, $\tilde{\Theta}\left(\frac{\sqrt{SAT}}{(1-\gamma)^{1/2}}\right)$ 수준에서 경계의 날카로움이 확인된다.
  • 기존의 비최적 단계 수에 대한 경계($N_{\gamma}(\epsilon,\delta)$)는 균일성 가정이 추가로 이루어지지 않는 한 더 날카운 재해 경계를 도출하지 못한다.
  • 제안된 $\gamma$-regret 측정 기준은 $T \ll \text{mixing time}$ 일 때 무한시간 최적 정책과의 비교에서 발생하는 오류를 피할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.