Skip to main content
QUICK REVIEW

[논문 리뷰] Minimax Regret for Stochastic Shortest Path

Alon Cohen, Yonathan Efroni|arXiv (Cornell University)|2021. 03. 24.
Advanced Bandit Algorithms Research참고 문헌 33인용 수 5
한 줄 요약

이 논문은 비알고리즘적 비용이 있는 강화학습에서 확률적 최단경로(SSP)의 최소최대 손실을 설정하며, 유한한 수명주기 MDPs로의 새로운 감소 방법을 제안한다. 이는 $\widetilde{O}(\sqrt{(B_{\star}^2 + B_{\star})|S||A|K})$의 손실 경계를 달성하여 기존의 하한선과 일치시키며, 이전 작업에서 제거된 $\sqrt{|S|}$ 격차를 개선한다. 새로운 알고리즘 ULCVI는 $B_{\star}$에 대한 다항적 의존성과 시간 길이에 대한 로그 의존성을 제공한다.

ABSTRACT

We study the Stochastic Shortest Path (SSP) problem in which an agent has to reach a goal state in minimum total expected cost. In the learning formulation of the problem, the agent has no prior knowledge about the costs and dynamics of the model. She repeatedly interacts with the model for $K$ episodes, and has to minimize her regret. In this work we show that the minimax regret for this setting is $\widetilde O(\sqrt{ (B_\star^2 + B_\star) |S| |A| K})$ where $B_\star$ is a bound on the expected cost of the optimal policy from any state, $S$ is the state space, and $A$ is the action space. This matches the $Ω(\sqrt{ B_\star^2 |S| |A| K})$ lower bound of Rosenberg et al. [2020] for $B_\star \ge 1$, and improves their regret bound by a factor of $\sqrt{|S|}$. For $B_\star < 1$ we prove a matching lower bound of $Ω(\sqrt{ B_\star |S| |A| K})$. Our algorithm is based on a novel reduction from SSP to finite-horizon MDPs. To that end, we provide an algorithm for the finite-horizon setting whose leading term in the regret depends polynomially on the expected cost of the optimal policy and only logarithmically on the horizon.

연구 동기 및 목표

  • 확률적 최단경로(SSP)에서 손실의 상한선과 하한선 사이의 격차를 좁히기 위한 목표: 비알고리즘적, 동일분포로 된 비용을 가진 경우.
  • 비용이 작거나 0일 경우 표준의 낙관 기반 방법이 실패하여 무한 루프에 빠지는 문제를 다루기 위한 목표.
  • 최적 정책의 기대 비용 $B_{\star}$, 상태 공간 $|S|$, 행동 공간 $|A|$, 에피소드 수 $K$에 대해 최적의 의존성을 가지는 손실 최소화 알고리즘 개발.
  • 최소최대 최적성의 손실 경계를 증명하기 위해 $B_{\star} \geq 1$ 및 $B_{\star} < 1$ 경우에 대해 일치하는 하한선을 수립하기 위한 목표.

제안 방법

  • 고정된 길이 $H$의 수명주기로 나누어진 각 에피소드를 갖는, SSP에서 유한 수명주기 MDPs로의 블랙박스 감소 방법 제안.
  • ULCVI라는 새로운 알고리즘을 도입하여, $B_{\star}$에 대해 다항적이고 $H$에 대해 로그 의존성이 있는 손실을 가지는, 유한 수명주기 MDPs에 적합한 알고리즘 개발. 이는 이전 방법보다 향상됨.
  • 최적 정책의 기대 목표 도달 시간에 대한 사전 지식 없이도 장기적인 순환을 방지하고 목표 도달 가능성을 보장하기 위해 매 $H$ 단계마다 재시작 메커니즘 도입.
  • 유한 수명주기 설정에서 손실를 제어하기 위해 프리드먼 부등식과 제닝스 부등식을 고확률 농도 경계에 적용.
  • i.i.d. 비용을 가진 어려운 MDP 인스턴스를 구성하여, $B_{\star} < 1$일 경우 $\Omega(\sqrt{B_{\star}|S||A|K})$의 하한선을 유도하고, $B_{\star} \geq 1$일 경우 $\Omega(\sqrt{B_{\star}^2|S||A|K})$의 하한선을 도출.
  • 유한 수명주기 알고리즘과 감소 방법을 조합하여 SSP에 대한 최소최대 최적 손실 경계를 달성.

실험 결과

연구 질문

  • RQ1비용이 i.i.d. 이며 초깃값이 알려지지 않은 경우, 확률적 최단경로에 대한 최소최대 손실은 무엇인가요?
  • RQ2이전 작업 대비 상태 공간 크기 $|S|$에 대한 의존도를 줄여 손실 경계를 개선할 수 있을까요?
  • RQ3모든 $B_{\star}$ 값에 대해 $\widetilde{O}(\sqrt{(B_{\star}^2 + B_{\star})|S||A|K})$의 손실 경계가 최소최대 최적일까요?
  • RQ4수명주기 $H$에 대해 로그 의존성과 $B_{\star}$에 대해 다항 의존성을 가지는 유한 수명주기 MDP 알고리즘을 설계할 수 있을까요?
  • RQ5제안된 유한 수명주기 MDP로의 감소 방법이 목표 도달 가능성을 유지하면서도 손실를 최소화할 수 있을까요?

주요 결과

  • 알 수 없는 i.i.d. 비용을 가진 SSP에 대한 최소최대 손실은 $\widetilde{\Theta}(\sqrt{(B_{\star}^2 + B_{\star})|S||A|K})$이며, 로그 요소를 제외한 기존 하한선과 일치한다.
  • $B_{\star} \geq 1$일 경우, 손실 경계 $\widetilde{O}(\sqrt{(B_{\star}^2 + B_{\star})|S||A|K})$는 로젠버그 등(2020)의 $\Omega(\sqrt{B_{\star}^2|S||A|K})$ 하한선과 일치하며, $\sqrt{|S|}$ 격차를 해소한다.
  • $B_{\star} < 1$일 경우, 더 강력한 하한선 $\Omega(\sqrt{B_{\star}|S||A|K})$를 증명하여, 이 영역에서도 상한선이 최소최대 최적임을 입증한다.
  • 제안된 ULCVI 알고리즘은 $B_{\star}$에 대해 다항적 의존성과 수명주기 $H$에 대해 로그 의존성을 가지며, 이전 방법의 $\sqrt{H}$ 의존성 대비 향상된 성능을 달성한다.
  • SSP에서 유한 수명주기 MDPs로의 감소 방법은 최적 정책의 기대 목표 도달 시간에 대한 사전 지식 없이도 매 에피소드에서 목표 도달 가능성을 보장한다.
  • 분석을 통해 손실의 적절한 척도로 최적 정책의 기대 비용 $B_{\star}$가 아닌 수명주기 길이 $H$가 되며, 이는 $B_{\star}$가 핵심 복잡도 매개변수임을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.