[논문 리뷰] Stochastic Shortest Path Games and Q-Learning
이 논문은 유한 상태와 컴act 제어를 갖는 두 명의 플레이어가 참가하는 제로섬 스토케스틱 최단경로(Stochastic Shortest Path, SSP) 게임에 대해 Q-러닝의 수렴성을 넓은 범위의 클래스에 대해 확립한다. 대칭적 모델 조건을 도입하여 벨만 방정식의 해의 유일성과 Q-러닝 반복의 유계성을 보장함으로써, 약한 검증 가능한 가정 하에 거의 확실한 수렴성을 증명하며, 할인되지 않은 총비용 스토케스틱 게임으로 모델리스 학습을 확장한다.
We consider a class of two-player zero-sum stochastic games with finite state and compact control spaces, which we call stochastic shortest path (SSP) games. They are undiscounted total cost stochastic dynamic games that have a cost-free termination state. Exploiting the close connection of these games to single-player SSP problems, we introduce novel model conditions under which we show that the SSP games have strong optimality properties, including the existence of a unique solution to the dynamic programming equation, the existence of optimal stationary policies, and the convergence of value and policy iteration. We then focus on finite state and control SSP games and the classical Q-learning algorithm for computing the value function. Q-learning is a model-free, asynchronous stochastic iterative algorithm. By the theory of stochastic approximation involving monotone nonexpansive mappings, it is known to converge when its associated dynamic programming equation has a unique solution and its iterates are bounded with probability one. For the SSP case, as the main result of this paper, we prove the boundedness of the Q-learning iterates under our proposed model conditions, thereby establishing completely the convergence of Q-learning for a broad class of total cost finite-space stochastic games.
연구 동기 및 목표
- 두 명의 플레이어가 참가하는 제로섬 SSP 게임에 대해 강한 최적성 성질—유일한 해 존재, 최적 정적 정책 존재, 값/정책 반복의 수렴성—을 확립하기.
- 모델리스 비동기 설정 하에서 유한 상태, 컴 pact 제어를 갖는 SSP 게임에서 Q-러닝의 수렴을 보장하는 모델 조건을 규명하기.
- 단일 에이전트 MDP를 넘어서 두 명의 플레이어가 참가하는 총비용 기준 스토케스틱 게임으로 Q-러닝의 이론적 기반을 확장하기.
- 할인되지 않은 스토케스틱 게임에서 수렴을 위해 필수적인, 거의 확실한 유계성인 Q-러닝 반복의 유계성을 증명하기.
- 기존 문헌에서의 비대칭 가정을 일반화하는 대칭적 형식의 모델 조건을 제공하기.
제안 방법
- SSP 게임에서 동적 프rogramming 방정식의 해의 유일성을 보장하는 새로운 대칭적 모델 조건(formulation)을 제안한다(가정 2.3).
- SSP 게임과 단일 에이전트 SSP 문제 간의 관계를 분석하여 MDP 이론에서 알려진 수렴 결과를 활용한다.
- 단조 비확장 사상(stochastic approximation theory)을 활용하여 Q-러닝 수렴을 분석한다.
- 특정 가중 함수 ξ를 사용한 가중 sup-노름을 정의하여 벨만 연산자 Fν̄의 수축 성질을 증명한다.
- 이웃하는 SSP 문제에서의 총비용 과정과 Q-러닝 반복을 연결하여 커플링 방법을 활용해 하한 및 상한 유계성을 증명함으로써 Q-러닝 반복의 유계성을 확립한다.
- Tsitsiklis(1994)의 비동기 스토케스틱 근사 이론에서 수축 사상에 대한 결과를 적용하여 거의 확실한 유계성과 수렴성을 도출한다.
실험 결과
연구 질문
- RQ1두 명의 플레이어가 참가하는 제로섬 SSP 게임의 벨만 방정식은 어떤 조건에서 유일한 해를 갖는가?
- RQ2모델리스 비동기 학습 하에서 유한 상태, 컴 pact 제어를 갖는 SSP 게임에서 Q-러닝은 수렴 가능한가?
- RQ3어떤 모델 조건이 이러한 게임에서 Q-러닝 반복이 거의 확실하게 유계로 유지되는지를 보장하는가?
- RQ4이전 결과가 제한적이었던 할인되지 않은 총비용 스토케스틱 게임에서 Q-러닝 수렴을 어떻게 확립할 수 있는가?
- RQ5대칭적 조건은 기존 문헌에서의 비대칭 가정을 어떻게 일반화하는가?
주요 결과
- 제안된 모델 조건(가정 2.3)은 SSP 게임의 동적 프로그래밍 방정식에 대해 해의 유일성을 보장한다.
- 이 조건 하에서 두 플레이어 모두 최적 정적 정책이 존재하며, 값 반복 및 정책 반복이 수렴한다.
- 제안된 조건 하에서 Q-러닝 반복은 거의 확실하게 유계이며, 이는 수렴을 위한 핵심 조건이다.
- 수렴은 가중 노름 하에서 벨만 연산자의 수축 성질에 기반한 스토케스틱 근사 이론을 통해 확립된다.
- 유계성 증명은 Q-러닝 반복을 이웃하는 SSP 문제의 총비용 과정과 연결하고, 새로운 가중 함수 ξ를 활용한 기법에 기반한다.
- 결과적으로, 약한 검증 가능한 가정 하에 Q-러닝 수렴은 총비용 기준의 넓은 범위의 두 명의 플레이어가 참가하는 제로섬 스토케스틱 게임으로 확장된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.