Skip to main content
QUICK REVIEW

[논문 리뷰] No-Regret Exploration in Goal-Oriented Reinforcement Learning

Jean Tarbouriech, Evrard Garcelon|arXiv (Cornell University)|2019. 12. 07.
Advanced Bandit Algorithms Research참고 문헌 24인용 수 8
한 줄 요약

이 논문은 순환 구조가 없는 가정 없이 일반적인 스토케스틱 최단경로(SSP) 문제를 위한 최초의 no-regret 강화학습 알고리즘인 UC-SSP를 제안한다. 새로운 피벗-호리즌 기반 정지 규칙을 사용하여 느린 정책을 차단하고 더 빠른 대안으로 전환함으로써, 유계가 아닌 에피소드 길이를 가진 목표 지향 MDP에서 효율적인 탐색을 가능하게 하며, $\widetilde{\mathcal{O}}(DS\sqrt{ADK})$의 리그레트 한계를 달성한다.

ABSTRACT

Many popular reinforcement learning problems (e.g., navigation in a maze, some Atari games, mountain car) are instances of the episodic setting under its stochastic shortest path (SSP) formulation, where an agent has to achieve a goal state while minimizing the cumulative cost. Despite the popularity of this setting, the exploration-exploitation dilemma has been sparsely studied in general SSP problems, with most of the theoretical literature focusing on different problems (i.e., fixed-horizon and infinite-horizon) or making the restrictive loop-free SSP assumption (i.e., no state can be visited twice during an episode). In this paper, we study the general SSP problem with no assumption on its dynamics (some policies may actually never reach the goal). We introduce UC-SSP, the first no-regret algorithm in this setting, and prove a regret bound scaling as $\displaystyle \widetilde{\mathcal{O}}( D S \sqrt{ A D K})$ after $K$ episodes for any unknown SSP with $S$ states, $A$ actions, positive costs and SSP-diameter $D$, defined as the smallest expected hitting time from any starting state to the goal. We achieve this result by crafting a novel stopping rule, such that UC-SSP may interrupt the current policy if it is taking too long to achieve the goal and switch to alternative policies that are designed to rapidly terminate the episode.

연구 동기 및 목표

  • 순환 없음 가정이나 알려진 유한한 수명 주기를 갖지 않는 일반적인 스토케스틱 최단경로-SSP 문제에서 no-regret 탐색 알고리즘이 부족한 문제를 해결하기 위해.
  • 유한 수명 주기 및 무한 수명 주기 강화학습 설정이 목표 도달을 위한 기대 비용을 최소화하는 진정한 SSP 목표를 포괄하지 못하는 한계를 극복하기 위해.
  • 목표에 도달하는 데 너무 오래 걸리는 정책을 정지시켜 더 효율적인 대안으로 신속하게 전환할 수 있는 정지 규칙을 설계하기 위해.
  • 순환 금지나 알려진 수명 주기와 같은 제한적인 가정 없이 일반 SSP 설정에서 하위선형 리그레트 한계를 증명하기 위해.
  • 희망적 계획법과 흡수 시간의 단계형 분포 분석을 융합하여 SSP 탐색의 이론적 격차를 메우기 위해.

제안 방법

  • 전이 확률에 대한 베르누이 불등식을 기반으로 한 신뢰 구간을 활용한 희망적 가치 반복을 사용하는 UC-SSP 알고리즘을 제안한다.
  • 동적으로 조정되는 시간 임계값을 기반으로 한 새로운 피벗-호리즌 정지 규칙을 도입하여, 현재 정책이 지정된 시간 이내에 목표에 도달하지 못할 경우 에피소드 종료를 유도한다.
  • 이중 단계 전략을 활용한다: 단계 ①은 높은 불확실성과 함께 희망적 정책을 통해 탐색을 수행하고, 단계 ②는 추정된 흡수 시간이 낮은 정책을 사용해 에피소드를 신속히 종료한다.
  • 비정상 정책을 방지하고 기대 흡수 시간이 유한해지도록 하기 위해 비용을 페르튜브레이션(예: $c(s,a) = \max\{c(s,a), \epsilon\}$)하는 방법을 사용한다.
  • 희망적 정책의 흡수 시간 분포를 모델링하기 위해 이산 단계형 분포를 적용하여, 탐색과 적시 종료의 균형을 이루는 정지 기준을 설계한다.
  • 실제 전이 추정치에 대한 베르누이 유형의 경계를 사용해 정의된 신뢰 집합을 활용한 확장된 가치 반복을 통해 불확실성 하에서 계획을 수립한다.

실험 결과

연구 질문

  • RQ1순환 없는 동역학이나 알려진 유한한 수명 주기 가정 없이 일반 SSP 문제에 대해 no-regret 탐색 알고리즘을 설계할 수 있는가?
  • RQ2SSP 환경에서 비용 최소화와 목표 도달 시간 최소화라는 이중 목표를 어떻게 균형 있게 달성할 수 있는가?
  • RQ3유계가 아닌 에피소드 길이와 비정상 정책이 존재할 수 있는 SSP 환경에서 효율적인 탐색을 가능하게 하는 정지 기준은 무엇인가?
  • RQ4피벗-호리즌 기반의 에피소드 종료 규칙은 기존의 방문 횟수 기반 규칙보다 SSP 환경에서 더 나은 리그레트 한계를 달성할 수 있는가?
  • RQ5흡수 시간 추정과 함께 희망적 계획법을 사용할 경우 일반 SSP 환경에서 리그레트 성능이 어떻게 향상되는가?

주요 결과

  • 모든 알려지지 않은 SSP 문제에 대해 상태 수 $S$, 행동 수 $A$, SSP-지름 $D$, 양의 비용을 가진 $K$개의 에피소드 이후 UC-SSP는 $\widetilde{\mathcal{O}}(DS\sqrt{ADK})$의 리그레트 한계를 달성한다.
  • 특히 $c_{\min} = 0$일 경우 피벗-호리즌 정지 규칙 덕분에 UCRL-SSP보다 더 뛰어난 성능을 보이며, 이는 SSP의 구조에 더 잘 적응함을 시사한다.
  • UC-SSP의 단계 ②는 주로 초기 학습 단계에서 발생하며, 후속 단계에서는 리그레트에 거의 기여하지 않는다.
  • 신뢰 집합에 대해 베르누이 불등식을 사용함으로써 전이 확률 추정의 더 좁은 경계를 확보하여 희망적 계획의 정확도를 향상시킨다.
  • 초기 단계에서 학습을 안정화시키고 비정상 정책이 탐색을 지배하지 못하도록 하기 위해 $\epsilon = S^2A/K$로 비용을 페르튜브레이션한다.
  • 실험 결과, 불확실성과 페르튜브레이션이 감소함에 따라 UC-SSP의 추정 흡수 시간이 급격히 감소함을 확인하여 최적 정책으로의 효과적 수렴을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.