Skip to main content
QUICK REVIEW

[논문 리뷰] Exploration Bonus for Regret Minimization in Undiscounted Discrete and Continuous Markov Decision Processes

Jian Qian, Ronan Fruit|arXiv (Cornell University)|2018. 12. 11.
Advanced Bandit Algorithms Research참고 문헌 13인용 수 4
한 줄 요약

이 논문은 할인되지 않은 마르코프 결정 과정(MDPs)을 위한 효율적인 탐색 알고리즘인 SCAL+와 C-SCAL+를 소개한다. 이 알고리즘들은 탐색 보너스를 사용하여 비선형적 인과를 달성한다. 직접적으로 경험적으로 추정된 MDP에 보너스 항을 추가함으로써, 이전의 낙관적 알고리즘들(예: SCAL, UCCRL)의 인과 경계를 유지하면서도 계산 복잡도를 크게 감소시켜, 연속 상태의 할인되지 않은 MDP에서 인과 보장을 갖는 최초의 실행 가능한 알고리즘을 만든다.

ABSTRACT

We introduce and analyse two algorithms for exploration-exploitation in discrete and continuous Markov Decision Processes (MDPs) based on exploration bonuses. SCAL$^+$ is a variant of SCAL (Fruit et al., 2018) that performs efficient exploration-exploitation in any unknown weakly-communicating MDP for which an upper bound C on the span of the optimal bias function is known. For an MDP with $S$ states, $A$ actions and $Γ\leq S$ possible next states, we prove that SCAL$^+$ achieves the same theoretical guarantees as SCAL (i.e., a high probability regret bound of $\widetilde{O}(C\sqrt{ΓSAT})$), with a much smaller computational complexity. Similarly, C-SCAL$^+$ exploits an exploration bonus to achieve sublinear regret in any undiscounted MDP with continuous state space. We show that C-SCAL$^+$ achieves the same regret bound as UCCRL (Ortner and Ryabko, 2012) while being the first implementable algorithm with regret guarantees in this setting. While optimistic algorithms such as UCRL, SCAL or UCCRL maintain a high-confidence set of plausible MDPs around the true unknown MDP, SCAL$^+$ and C-SCAL$^+$ leverage on an exploration bonus to directly plan on the empirically estimated MDP, thus being more computationally efficient.

연구 동기 및 목표

  • 할인되지 않은 MDP에 대해 증명 가능한 인과 보장을 갖는 효율적인 탐색-이용 알고리즘을 개발하기 위해.
  • 기존의 낙관적 알고리즘들이 높은 신뢰도 집합을 유지함으로써 발생하는 계산 비효율성을 해결하기 위해.
  • 밴드잇과 할인된 MDP에서 흔히 사용되는 탐색 보너스를 할인되지 않은 일반적인 무한수렴 MDP로 확장하기 위해.
  • 연속 상태의 할인되지 않은 MDP에서 인과 보장을 갖는 최초의 실행 가능한 알고리즘을 제공하기 위해.
  • SCAL과 UCCRL의 이론적 인과 경계를 유지하면서도 계산 복잡도를 크게 감소시키기 위해.

제안 방법

  • SCAL+는 이산 MDP의 경험적 보상에 탐색 보너스를 추가하여, 유사한 MDP의 높은 신뢰도 집합을 유지하지 않고도 추정된 MDP에 직접 계획을 수립할 수 있도록 한다.
  • SCAL+의 탐색 보너스는 최적의 비용 함수의 범위에서 유도되며, $\widetilde{O}(c / \sqrt{N(s,a)})$의 비율로 척도가 조정되며, 여기서 $c$는 비용 함수의 범위에 대한 상한이다.
  • C-SCAL+는 연속 상태의 MDP로 탐색 보너스 접근법을 확장하여, 함수 근사와 보너스 항을 사용하여 비선형적 인과를 보장한다.
  • 두 알고리즘 모두 유 incertitude에 대한 낙관주의(OFU) 원칙에 기반하지만, 유사한 MDP의 집합을 유지하는 데 발생하는 계산 오버헤드를 피한다.
  • 에피소드 기반 학습과 정지 시간을 사용하여 충분한 탐색을 보장하고 추정된 MDP에 대한 고확률 신뢰도를 유지한다.
  • 이론적 분석을 통해 SCAL+는 SCAL보다 훨씬 낮은 계산 비용으로 $\widetilde{O}(c\sqrt{\Gamma SAT})$의 인과를 달성하며, C-SCAL+는 연속 MDP에서 UCCRL의 인과 경계를 동일하게 유지한다.

실험 결과

연구 질문

  • RQ1높은 신뢰도 집합을 유지하지 않으면서도, 할인되지 않은 MDP에서 탐색 보너스를 효과적으로 사용하여 비선형적 인과를 달성할 수 있는가?
  • RQ2SCAL과 UCCRL과 같은 낙관적 알고리즘의 계산 복잡도를 인과 보장을 유지하면서 줄일 수 있는가?
  • RQ3탐색 보너스를 사용하여 연속 상태의 할인되지 않은 MDP에서 인과 보장을 갖는 실행 가능한 알고리즘을 설계할 수 있는가?
  • RQ4비용 함수의 범위 기반 보너스와 신뢰도 집합 기반 방법 간의 인과성과 효율성 측면에서의 비교는 어떠한가?
  • RQ5추정된 MDP에 보너스 항을 추가한 직접 계획 수립을 통해, 할인되지 않은 MDP에서 OFU 원칙을 효율적으로 적용할 수 있는가?

주요 결과

  • SCAL+는 SCAL와 동일한 인과 경계—$\widetilde{O}(c\sqrt{\Gamma SAT})$—를 달성하지만, 높은 신뢰도 집합 유지 없이 계산 복잡도를 크게 감소시켰다.
  • C-SCAL+는 연속 상태의 할인되지 않은 MDP에서 UCCRL의 인과 경계를 동일하게 달성하여, 그러한 보장을 갖는 최초의 실행 가능한 알고리즘이다.
  • SCAL+의 탐색 보너스는 $\widetilde{O}(c / \sqrt{N(s,a)})$ 비율로 척도가 조정되며, 여기서 $c$는 최적의 비용 함수의 범위에 대한 상한이다.
  • 추정된 MDP에 보너스 항을 추가한 직접 계획 수립은 이론적 인과 보장을 유지하면서도 효율적인 계산을 가능하게 한다.
  • 이론적 분석을 통해 두 알고리즘이 에피소드 기반 학습과 정지 시간을 통해 추정된 MDP에 대한 고확률 신뢰도를 유지함을 확인하였다.
  • 결과는 탐색 보너스가 밴드잇 스타일 방법과 완전한 강화 학습 알고리즘 사이의 격차를 메우기 위해 할인되지 않은 MDP로 효과적으로 확장될 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.