Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Stochastic Shortest Path.

Aviv Rosenberg, Yishay Mansour|arXiv (Cornell University)|2020. 06. 20.
Advanced Bandit Algorithms Research참고 문헌 5인용 수 9
한 줄 요약

이 논문은 비용이 에피소드 간에 임의로 변화하는 동안 동역학은 고정되어 있고 알려져 있지 않은 적대적 확률적 최단경로(Stochastic Shortest Path, SSP) 문제를 제안한다. 모든 비용이 엄격히 양수일 경우 $\tilde{O}(\pi K)$의 손실을 달성하는 알고리즘을 제안하며, 일반적인 경우는 $\tilde{O}(K^{3/4})$의 손실을 기록한다. 이는 전이 동역학을 알지 못하는 조건에서 적대적 SSP에 대해 처음으로 비선형 손실 경계를 확립한 것이다.

ABSTRACT

Stochastic shortest path (SSP) is a well-known problem in planning and control, in which an agent has to reach a goal state in minimum total expected cost. In this paper we consider adversarial SSPs that also account for adversarial changes in the costs over time, while the dynamics (i.e., transition function) remains unchanged. Formally, an agent interacts with an SSP environment for $K$ episodes, the cost function changes arbitrarily between episodes, and the fixed dynamics are unknown to the agent. We give high probability regret bounds of $\widetilde O (\sqrt{K})$ assuming all costs are strictly positive, and $\widetilde O (K^{3/4})$ for the general case. To the best of our knowledge, we are the first to consider this natural setting of adversarial SSP and obtain sub-linear regret for it.

연구 동기 및 목표

  • 비용이 에피소드 간에 임의로 변화하는 적대적 확률적 최단경로 문제를 체계화하고 연구하기 위해.
  • 적대적 비용 변화 하에서 전이 동역학을 알지 못하는 SSP 문제의 과제를 다루기 위해.
  • 이러한 적대적 SSP 환경에서 학습의 고확률 손실 경계를 유도하기 위해.
  • 전이 동역학의 사전 지식 없이도 비선형 손실 보장을 확립하기 위해.

제안 방법

  • 에이전트는 $K$개의 에피소드 동안 비용 함수가 에피소드 간에 임의로 변화하는 SSP 환경과 상호작용한다.
  • 모든 비용이 엄격히 양수라는 가정 하에 더 날카로운 손실 경계를 확보할 수 있다.
  • 적대적 비용 시퀀스에 적합한 변형된 값 반복(Value Iteration) 또는 동적 프로그래밍 기법을 활용한다.
  • 누적 손실을 최소화하면서도 알려지지 않은 동역학을 학습하기 위한 탐색 전략을 통합한다.
  • 집중 불등식과 추정 오차의 고확률 경계를 활용해 손실 분석을 수행한다.
  • 이론적 분석을 통해 엄격히 양수인 비용의 경우 $\tilde{O}(\pi K)$의 손실과 일반적인 경우 $\tilde{O}(K^{3/4})$의 손실을 도출한다.

실험 결과

연구 질문

  • RQ1적대적 비용 변화와 알려지지 않은 동역학 조건에서 비선형 손실을 달성할 수 있는가?
  • RQ2엄격히 양수인 비용 조건 하에서 적대적 SSP에서 최적의 손실 경계는 무엇인가?
  • RQ3비용이 양수로 제한되지 않을 경우 손실은 어떻게 스케일링되는가?
  • RQ4전이 동역학의 사전 지식 없이도 적대적 비용 변화에 대응하는 학습을 가능하게 하는 알고리즘 기법은 무엇인가?
  • RQ5모든 모델 정보가 부족한 조건에서 적대적 SSP에 대해 고확률 손실 경계를 확립할 수 있는가?

주요 결과

  • 모든 비용이 엄격히 양수일 경우 고확률 손실 경계로 $\widetilde{O}(\sqrt{K})$를 달성한다.
  • 양수 제약이 없는 일반적인 경우 손실 경계는 $\widetilde{O}(K^{3/4})$이다.
  • 이것은 적대적 확률적 최단경로 문제에 대해 처음으로 비선형 손실 경계를 제공한다.
  • 전이 동역학이 고정되어 있지만 에이전트가 이를 알지 못한다는 가정 하에 결과가 성립한다.
  • 환경과 학습 과정의 랜덤성에 대해 고확률로 성립하는 이론적 보장을 수립한다.
  • 적대적 비용 변화가 있는 SSP에서 온라인 학습을 위한 기초 프레임워크를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.