[논문 리뷰] On Online Learning in Kernelized Markov Decision Processes
이 논문은 연속 상태 및 연속 행동을 갖는 마르코프 결정 과정(MDP)에서 비모수적이고 매끄러운 전이 및 보상 함수를 모델링하기 위해 가우시안 프로세스 사전분포를 사용하는 온라인 강화 학습을 위한 GP-UCRL 및 사후 표본 추출 알고리즘을 제안한다. 새로운 커널에 의존하는 정보 수익 측도를 도입하여, 기존 커널 밴딧 결과를 MDP로 일반화하고, 비모수적 커널 기반 MDP에 대해 최초로 빈도주의적 등록 보장(등록 한계)을 제공한다.
We consider online learning for minimizing regret in unknown, episodic Markov decision processes (MDPs) with continuous states and actions. We develop variants of the UCRL and posterior sampling algorithms that employ nonparametric Gaussian process priors to generalize across the state and action spaces. When the transition and reward functions of the true MDP are members of the associated Reproducing Kernel Hilbert Spaces of functions induced by symmetric psd kernels (frequentist setting), we show that the algorithms enjoy sublinear regret bounds. The bounds are in terms of explicit structural parameters of the kernels, namely a novel generalization of the information gain metric from kernelized bandit, and highlight the influence of transition and reward function structure on the learning performance. Our results are applicable to multidimensional state and action spaces with composite kernel structures, and generalize results from the literature on kernelized bandits, and the adaptive control of parametric linear dynamical systems with quadratic costs.
연구 동기 및 목표
- 연속 상태와 행동을 갖는 에피소딕 MDP에서 전이 및 보상 함수가 매끄럽고 Reproducing Kernel Hilbert Space(RKHS)에 속할 때 온라인 학습 알고리즘을 개발하기 위해.
- 특히 정보 수익 측도를 포함한 커널 기반 밴딧 결과를 시간적이고 상태에 의존적인 MDP 설정으로 확장하기 위해.
- 빈도주의 설정 하에서 커널 기반 MDP에서 온라인 강화 학습에 대해 유한 시간, 고확률 등록 한계를 제공하기 위해.
- 기존의 파라미터적 LQR 및 UCRL/PSRL 결과를 비모수적, 무한차원, 커널 구조를 가진 MDP로 일반화하기 위해.
- RKHS 값의 마틴갈에 대한 농도 부등식을 활용하여 이론적 보장을 도출하기 위해.
제안 방법
- 연속 MDP에서 알려지지 않은 전이 및 보상 함수를 모델링하기 위해 가우시안 프로세스 사전분포를 사용하는 GP-UCRL 및 사후 표본 추출(PSRL) 변형을 제안한다.
- 진짜 전이 및 보상 함수를 대칭 정부분 정의 커널에 의해 유도되는 RKHS의 원소로 모델링하여 상태와 행동 간의 비모수적 일반화를 가능하게 한다.
- T번의 상호작용 후에 진짜 동역학과 보상에 대해 얻을 수 있는 최대 정보를 캡처하는 커널 기반 MDP에 대한 정보 수익의 새로운 일반화인 γT(R) 및 γmT(P)를 정의한다.
- 사후 분산과 커널 구조에 의존하는 후행 분산과 커널 구조를 활용하여 가치 함수와 정책 등록의 추정 오차를 제어하기 위해 RKHS 값의 마틴갈에 대한 농도 부등식을 사용한다.
- GP 사후 분산과 신뢰도 너비 파rameter βR,l 및 βP,l을 사용하여 진짜 보상 및 전이 함수에 대한 고확률 신뢰 집합을 구성한다.
- 최적 정책과 학습된 정책의 가치 차이를 보상 및 전이 함수의 추정 오차로 분해하고, 각 오차를 커널 특성에 따라 정의된 정보 수익 항으로 bound하여 등록 한계를 유도한다.
실험 결과
연구 질문
- RQ1진짜 전이 및 보상 함수가 매끄럽고 RKHS에 속할 때, 연속 상태 및 연속 행동 MDP에서 온라인 강화 학습이 하위선형 등록 성능를 달성할 수 있는가?
- RQ2커널의 선택이 커널 기반 MDP에서의 등록 성능에 미치는 영향은 무엇이며, 이를 일반화된 정보 수익 측도로 정량화할 수 있는가?
- RQ3커널 기반 밴딧의 이론적 프레임워크를 상태 변화와 유한 수평 계획이 있는 순차적 의사결정 설정인 MDP로 확장할 수 있는가?
- RQ4GP-UCRL 및 사후 표본 추출 알고리즘의 커널 기반 MDP에서의 등록 한계는 무엇이며, 이는 커널의 구조적 특성에 어떻게 의존하는가?
- RQ5RKHS 값의 과정에 대한 농도 부등식을 활용하여 비모수적 MDP에서 고확률 등록 한계를 도출할 수 있는가?
주요 결과
- GP-UCRL의 등록 한계는 고확률적으로 Õ(γT(R) + γmT(P))√T 이하로 유한하며, 여기서 γT(R) 및 γmT(P)는 보상 및 전이 함수에 대한 새로운 정보 수익 측도이다.
- 제곱 지수 커널의 경우 정보 수익 항 γT(R) 및 γmT(P)는 다항로그(T)의 비율로 증가하며, d차원 상태 및 행동 공간에서는 등록 한계가 Õ(√T log^d T)로 유한해진다.
- 사후 표본 추출 알고리즘(PSRL)은 고확률적으로 O(αR,τ exp(γH−1(kR,Z))√(γT(kR,Z)T)) + O(αP,τ exp(γmH−1(kP,Z̃))√(γmT(kP,Z̃)T))의 베이즈 등록 한계를 달성한다.
- 정보 수익을 통해 커널 구조가 명시적으로 등록 한계에 영향을 주며, 더 매끄러운 커널(예: 제곱 지수 커널)은 더 우수한 등록 성능를 보인다.
- 분석은 커널 밴딧 결과를 MDP로 일반화하고, 기존의 파라미터적 LQR 등록 한계를 비모수적, 커널 기반 MDP로 확장하며, 무한차원 함수 공간을 갖는다.
- 결과는 커널 기반 MDP에서 온라인 학습에 대해 최초의 빈도주의 등록 보장이며, 매끄러운 가정 하에 비모수적 강화 학습의 이론적 기초를 마련한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.