Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic Shortest Path: Minimax, Parameter-Free and Towards Horizon-Free Regret

Jean Tarbouriech, Runlong Zhou|arXiv (Cornell University)|2021. 04. 22.
Advanced Bandit Algorithms Research참고 문헌 44인용 수 5
한 줄 요약

이 논문은 $B_{\star}$ 또는 $T_{\star}$에 대한 사전 지식이 필요 없이 최대손실 최적의 성능 $×plantilde{O}(B_{\star}\sqrt{SAK})$ 를 달성하는 새로운 모델 기반 강화학습 알고리즘인 EB-SSP를 제안한다. 이는 이 설정에서 최초의 파rameter-free이자 거의 시간경계 없는 알고리즘이다. 이 방법은 편향 보정된 경험 전이와 탐색 보너스를 사용하는 낙관적 가치 반복을 통해 수렴성과 손실 한계를 보장한다.

ABSTRACT

We study the problem of learning in the stochastic shortest path (SSP) setting, where an agent seeks to minimize the expected cost accumulated before reaching a goal state. We design a novel model-based algorithm EB-SSP that carefully skews the empirical transitions and perturbs the empirical costs with an exploration bonus to induce an optimistic SSP problem whose associated value iteration scheme is guaranteed to converge. We prove that EB-SSP achieves the minimax regret rate $ ilde{O}(B_{\star} \sqrt{S A K})$, where $K$ is the number of episodes, $S$ is the number of states, $A$ is the number of actions, and $B_{\star}$ bounds the expected cumulative cost of the optimal policy from any state, thus closing the gap with the lower bound. Interestingly, EB-SSP obtains this result while being parameter-free, i.e., it does not require any prior knowledge of $B_{\star}$, nor of $T_{\star}$, which bounds the expected time-to-goal of the optimal policy from any state. Furthermore, we illustrate various cases (e.g., positive costs, or general costs when an order-accurate estimate of $T_{\star}$ is available) where the regret only contains a logarithmic dependence on $T_{\star}$, thus yielding the first (nearly) horizon-free regret bound beyond the finite-horizon MDP setting.

연구 동기 및 목표

  • 에피소드 길이가 유계가 아니며 에이전트의 행동에 따라 달라지는 확률적 최단경로(SSP) 설정에서의 학습 과제를 해결한다.
  • 문제의 핵심 파ram터인 $B_{\\text{가장 작은}}$ (최적 비용 상한) 또는 $T_{\\text{가장 작은}}$ (목표 도달 예상 시간)에 대한 사전 지식이 없이도 최대손실 최적의 손실을 달성하는 알고리즘을 설계한다.
  • $T_{\\text{가장 작은}}$ 에 대한 로그적 의존성만을 가지며, 유한 시간경계 MDP를 초월해 시간경계 없는 성능에 가까운 손실 한계를 달성한다.
  • $K, S, A, B_{\\text{가장 작은}}, T_{\\text{가장 작은}}$ 에 대해 다항 시간 복잡도를 가지며 이론적 보장을 유지하면서 계산 효율성을 확보한다.

제안 방법

  • 경험 전이를 왜곡하고 비용에 탐색 보너스를 추가하여 낙관적인 SSP 문제를 구성하는 모델 기반 알고리즘인 EB-SSP를 제안한다.
  • 낙관적 모델에 대해 가변 정밀도 $\epsilon_{\\text{VI}}$ 를 사용하는 가치 반복 기반 방법(VISGO)을 적용하며, 이는 에피소드가 진행됨에 따라 감소하여 수렴을 보장한다.
  • 이중 정지 조건을 도입: 누적 비용이 고확률 임계값을 초과하거나, 가치 함수 크기가 $\widetilde{B}$ 를 초과할 경우 정지한다.
  • 방문 횟수 $N(s,a)$ 와 $\theta(s,a)$ 를 사용해 경험적 추정치 $\widehat{P}, \widehat{c}$ 를 유지하며, 방문 횟수가 기하급수적 트리거 집합 $\mathcal{N} = \{2^{j-1}\}$ 에 도달할 경우 재최적화를 촉발한다.
  • 학습 안정성을 높이기 위해 목표 상태의 가짜 도착을 통합한 편향 보정 전이 모델 $\widetilde{P}_{s,a,s'}$ 를 적용한다.
  • 가장자리 기반 보너스 $b^{(i+1)}(s,a)$ 를 가치 반복에 적용하여 분산, 비용, 상태-행동 방문 빈도 요소를 통합해 탐색을 장려한다.

실험 결과

연구 질문

  • RQ1사전 지식 없이 $B_{\star}$ 또는 $T_{\star}$ 를 알지 못하는 상태에서 파rameter-free 알고리즘이 최대손실 최적의 손실을 달성할 수 있는가?
  • RQ2손실이 $T_{\star}$ 에 대해 로그적 의존성만 가지며, 시간경계 없는 성능에 가까운 알고리즘을 설계할 수 있는가?
  • RQ3낙관적 가치 반복을 사용하는 모델 기반 접근이 비유계 시간경계 SSP 설정에서 수렴성과 손실 보장을 보장할 수 있는가?
  • RQ4경험 전이 및 비용 추정에서 낙관성과 안정성을 균형 잡기 위해 탐색 보너스를 어떻게 설계할 수 있는가?
  • RQ5사전 파ram터 조정 없이 거의 최대손실 최적의 손실을 달성하기 위해 필요한 최소한의 가정은 무엇인가?

주요 결과

  • EB-SSP는 $\widetilde{O}(B_{\star}\sqrt{SAK})$ 의 최대손실 최적의 손실 한계를 달성하며, 정보 이론적 하한선에 로그 요소를 제외하고 정확히 일치한다.
  • 알고리즘이 파rameter-free이며 $B_{\star}$ 또는 $T_{\star}$ 에 대한 사전 지식이 필요 없어 기존 방법에 비해 중대한 개선을 이룬다.
  • 양의 비용이 존재하거나 $T_{\star}$ 가 정확하게 추정되는 경우, 손실은 $T_{\star}$ 에 대해 오직 로그적 의존성만 가지며, SSP에서 최초로 거의 시간경계 없는 손실 한계를 달성한다.
  • 제한된 가치 함수와 가변 정밀도를 통해 낙관적 가치 반복의 수렴성을 보장하며, 발산을 방지하기 위해 두 가지 정지 조건을 도입한다.
  • 목표 상태의 가짜 도착과 신뢰도 기반 보너스를 사용해 경험 전이 및 비용 모델을 보정함으로써 강건성과 낙관성을 확보한다.
  • 실행 시간 복잡도는 $K, S, A, B_{\star}, T_{\star}$ 에 대해 다항식이므로 알고리즘은 계산적으로 효율적이고 확장 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.