Skip to main content
QUICK REVIEW

[논문 리뷰] Finding the Stochastic Shortest Path with Low Regret: The Adversarial Cost and Unknown Transition Case

Liyu Chen, Haipeng Luo|arXiv (Cornell University)|2021. 02. 10.
Advanced Bandit Algorithms Research참고 문헌 19인용 수 5
한 줄 요약

이 논문은 공격적인 비용과 알려지지 않은 전이 동역학을 가진 스토하스틱 최단경로 문제를 위한 새로운 알고리즘을 제안하며, 전면 정보 설정에서는 $×{\tilde{\mathcal{O}}}(\sqrt{S^{2}ADT_{\star}K})$의 손실을, 밴딧 피드백 설정에서는 $\tilde{\mathcal{O}}(\sqrt{S^{3}A^{2}DT_{\star}K})$의 손실을 달성한다. 전이 추정 오차로 인한 편향을 제어하기 위해 비대칭 점유도 측정법과 낙관적인 비용 추정기를 도입하여 이전 연구에 비해 크게 향상되었으며, 밴딧 피드백, 공격적인 비용, 알려지지 않은 전이 동역학의 가장 도전적인 조합에 대해 첫 번째 해결책을 제공한다.

ABSTRACT

We make significant progress toward the stochastic shortest path problem with adversarial costs and unknown transition. Specifically, we develop algorithms that achieve $\widetilde{O}(\sqrt{S^2ADT_\star K})$ regret for the full-information setting and $\widetilde{O}(\sqrt{S^3A^2DT_\star K})$ regret for the bandit feedback setting, where $D$ is the diameter, $T_\star$ is the expected hitting time of the optimal policy, $S$ is the number of states, $A$ is the number of actions, and $K$ is the number of episodes. Our work strictly improves (Rosenberg and Mansour, 2020) in the full information setting, extends (Chen et al., 2020) from known transition to unknown transition, and is also the first to consider the most challenging combination: bandit feedback with adversarial costs and unknown transition. To remedy the gap between our upper bounds and the current best lower bounds constructed via a stochastically oblivious adversary, we also propose algorithms with near-optimal regret for this special case.

연구 동기 및 목표

  • 공격적인 비용과 알려지지 않은 전이 함수를 가진 스토하스틱 최단경로(SSF) 문제를 다루며, 이전 연구는 전이가 알려져 있거나 간단한 피드백 설정을 가정했다.
  • 공격적인 비용과 알려지지 않은 전이 동역학 하에서 SSP의 기존 상한과 하한 사이의 손실 갭을 좁히기.
  • 최적 정책의 도달 시간 $T_{\star}$에 대한 사전 지식 없이도 전면 정보 및 밴딧 피드백 설정 모두에서 비선형 손실을 달성하는 효율적인 알고리즘 개발.
  • 기존의 전이가 알려진 설정 연구를 더 현실적이고 도전적인 알려지지 않은 동역학의 경우, 특히 밴딧 피드백 환경으로 확장하기.

제안 방법

  • Chen 등(2020)의 루프 없는 감소 기법을 알려지지 않은 전이 설정에 적응시켜 불확실성 하에서 손실 분석이 가능하도록 한다.
  • 전면 정보 설정에서 전이 추정 오차로 인한 편향을 제어하기 위해 비대칭 점유도 측정법을 도입한다.
  • 비용 분산과 기대 도달 시간 $T_{\star}$ 사이의 관계를 설정하기 위해 벨만 유형의 전반적 분산 법칙을 활용하여 더 날카운 손실 상한을 가능하게 한다.
  • 밴딧 피드백을 처리하고 손실을 최소화하기 위해 상위 점유도 상한에서 영감을 얻은 두 가지 낙관적인 비용 추정기를 제안한다.
  • 루프 없는 감소 기법을 개선하여 빠른 정책으로의 동적 전환을 허용함으로써, 스토하스틱으로 무심한 적대자 하에서 근사 최적의 손실을 달성하는 데 필수적이다.
  • 마팅게일 차이를 제어하고 고확률 손실 보장을 보장하기 위해 농도 불등식(예: 프리드먼의 및 베르누이 타입)을 적용한다.

실험 결과

연구 질문

  • RQ1비용이 공격적이며 전이 함수가 알려지지 않은 상황에서 스토하스틱 최단경로 문제에서 낮은 손실을 달성할 수 있는가?
  • RQ2알려지지 않은 전이 하에서 상태 수 $S$, 행동 수 $A$, 직경 $D$, 기대 도달 시간 $T_{\star}$에 따라 손실은 어떻게 스케일링되는가?
  • RQ3공격적인 비용과 알려지지 않은 전이 동역학을 가진 밴딧 피드백 알고리즘을 설계하여 비선형 손실을 달성할 수 있는가?
  • RQ4밴딧 피드백, 공격적인 비용, 알려지지 않은 전이 동역학의 가장 어려운 설정에서 상한과 하한 사이의 손실 갭을 메울 수 있는가?
  • RQ5스토하스틱으로 무심한 적대자 하에서 근사 최적의 손실을 달성하기 위해 어떤 수정이 필요한가? 이 경우 하한은 날카로운 것으로 알려져 있다.

주요 결과

  • 제안된 알고리즘은 전면 정보 설정에서 $\tilde{\mathcal{O}}(\sqrt{S^{2}ADT_{\star}K})$의 손실을 달성하며, Rosenberg과 Mansour(2020)의 이전 상한 $\tilde{\mathcal{O}}(\frac{1}{c_{\min}}\sqrt{S^{2}AD^{2}K})$보다 향상되었다.
  • 밴딧 피드백 설정에서는 $\tilde{\mathcal{O}}(\sqrt{S^{3}A^{2}DT_{\star}K})$의 손실을 달성하는 첫 번째 알고리즘이 개발되어, 알려지지 않은 전이와 부분 피드백 하에서 공격적인 비용 문제를 해결하였다.
  • 비용 최소값 $c_{\min} = 0$일 경우 알고리즘은 $\tilde{\mathcal{O}}(K^{2/3})$의 손실을 달성하며, Rosenberg과 Mansour(2020)의 $\tilde{\mathcal{O}}(K^{3/4})$ 상한보다 향상되었다.
  • 스토하스틱으로 무심한 적대자 하에서는 알고리즘이 하한에 $\sqrt{S}$ 요인 내에서 근접한 손실을 달성하였으며, 이는 SSP에서 이 클래스의 적대자에 대해 알려진 바 가장 낮은 갭이다.
  • 알려지지 않은 $T_{\star}$ 및 $T_{\max}$에 대해 강건하며, 에피소드 수와 문제 파rameter에 따라 다양한 영역으로 자동 전환하는 손실 상한을 제공한다.
  • 고급 농도 불등식(프리드먼의 및 언제나 적용 가능한 베르누이 타입 불등식 포함)을 사용한 이론적 분석을 통해 고확률 손실 보장을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.