[논문 리뷰] Provably Efficient Reinforcement Learning for Discounted MDPs with Feature Mapping
논문은 할인된 MDP에서 선형 커널 전이의 Upper-Confidence Linear Kernel Reinforcement Learning (UCLK) 알고리즘을 도입하여 regret를 ern~$\tilde{O}(d\sqrt{T}/(1-\gamma)^2)$로 달성하고, 거의 최적성에 상응하는 매칭 하한을 보인다.
Modern tasks in reinforcement learning have large state and action spaces. To deal with them efficiently, one often uses predefined feature mapping to represent states and actions in a low-dimensional space. In this paper, we study reinforcement learning for discounted Markov Decision Processes (MDPs), where the transition kernel can be parameterized as a linear function of certain feature mapping. We propose a novel algorithm that makes use of the feature mapping and obtains a $ ilde O(d\sqrt{T}/(1-γ)^2)$ regret, where $d$ is the dimension of the feature space, $T$ is the time horizon and $γ$ is the discount factor of the MDP. To the best of our knowledge, this is the first polynomial regret bound without accessing the generative model or making strong assumptions such as ergodicity of the MDP. By constructing a special class of MDPs, we also show that for any algorithms, the regret is lower bounded by $Ω(d\sqrt{T}/(1-γ)^{1.5})$. Our upper and lower bound results together suggest that the proposed reinforcement learning algorithm is near-optimal up to a $(1-γ)^{-0.5}$ factor.
연구 동기 및 목표
- 할인된 MDP에서 피처 매핑을 통해 대규모 상태/행동 공간으로 확장 가능한 RL 알고리즘 설계 동기를 제시한다.
- Transition 확률이 알려진 피처 맵과 미지의 파라미터에 선형적으로 의존하는 선형 커널 MDP를 연구한다.
- 제너러티브 모델이나 조기 수렴 가정 없이 거의 최적의 값 함수를 학습하는 온라인 알고리즘을 개발한다.
- 제안된 접근법의 최적성을 확립하기 위해 상한 및 하한의 리그레트 경계를 제시한다.
제안 방법
- Upper-Confidence Linear Kernel Reinforcement Learning (UCLK) 알고리즘을 도입한다. 이 알고리즘은 에폭 단위로 적응 길이를 갖는다.
- 각 에폭에서 미지의 파라미터 \theta^*에 대한 정규화된 최소제곱 추정기를 정의한다.
- 추정기에 대해 근사 집합 \mathcal{C}_k를 구성하고 \mathcal{C}_k \cap \mathcal{B}에서 Extended Value Iteration (EVI)을 수행하여 Q_k를 얻는다.
- 확률적 매개변수들에 대해 근사 가능한 파라미터들 중에서의 최댓값화를 통해 Q_k를 계산하는 EVI를 사용하고, 이를 통해 거의 최적의 정책을 얻는다.
- Σ_t 및 b_t를 온라인으로 업데이트하고 Σ_t의 행렬식이 두 배가 될 때 에폭을 전환하며 전환 오차를 제어한다.
- β 및 U의 적절한 선택 하에서 고확률로 regret가 \tilde{O}(d \sqrt{T}/(1-\gamma)^2)임을 증명한다.
실험 결과
연구 질문
- RQ1피처 매핑을 활용한 할인된 MDP에 대해 제너러티브 모델이나 강한 상태 동질성 가정 없이도 증명 가능한 효율적인 RL 알고리즘을 설계할 수 있는가?
- RQ2UCLK와 같은 신뢰도 증가형 계획 방법을 사용할 때 선형 커널 MDP의 리그레트 보장은 무엇인가?
- RQ3상한과 하한이 피처 차원 d, 시점 수 T, 할인 인자 \gamma에 대해 얼마나 근접하게 최적의 의존성을 기술할 수 있는가?
주요 결과
- UCLK은 선형 커널 MDP에서 최적 가치 함수 학습에 대해 \tilde{O}(d sqrt(T)/(1-\gamma)^2)의 리그레트 상한을 달성한다.
- 리그레트 상한은 상태 공간 및 행동 공간의 기수성에 의존하지 않으므로 대규모 문제에 대한 확장성을 강조한다.
- 일치하는(문제 의존적) 하한은 어떤 알고리즘에 대해서도 최소한 \Omega(d sqrt(T)/(1-\gamma)^{1.5})의 리그레트를 보이며, (1-\gamma)^{-0.5} 인자까지 고려하면 상향 보정된다.
- 상한과 하한을 함께 보면 d와 T에 대해 UCLK의 거의 최적성, 그리고 (1-\gamma)^{-0.5} 인자에 대해서는 거의 최적성에 이르는 결론을 얻는다.
- 이 결과는 기본 모델들의 선형 결합으로 표현될 수 있는 광범위한 MDP에 적용되며, 선형 커널 MDP 프레임워크 하에서 다수의 선행 모델들을 하나로 통일한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.